確率変数の標準化






#Rで標準化前と標準後のヒストグラムを描写する。
#母集団は正規分布とする。
#乱数の種(seed)を指定
set.seed(100)

png("121223_normalization.png")
#ヒストグラムを重ねて描写
hist(rnorm(1000, mean=10, sd=3), xlim=c(-5,20), main="Normalization")
hist( ( rnorm(1000, mean=10, sd=3) - 10 ) / sqrt(3 ^ 2), add=T)
dev.off()


#標準化後の平均値
> mean ((rnorm(1000, mean=10, sd=3) - 10 ) / sqrt(3 ^ 2))
[1] 0.003523354

#標準化後の標準偏差
> var ((rnorm(1000, mean=10, sd=3) - 10 ) / sqrt(3 ^ 2))
[1] 0.9512305




## 数式のソースファイル ##

% normaliation.tex
\documentclass{jarticle}
\usepackage{amsmath}

\begin{document}
確率変数の標準化normalizationを行う。
今、連続型continuous typeの確率変数$X$が確率分布$f(x)$に従うとき、期待値の
演算$E$は次のように定義される。
\begin{eqnarray}
E(X) = \int_{-\infty}^{\infty} x f(x) dx
\end{eqnarray}
期待値Eの演算に関しては、下のような性質がある。
\begin{eqnarray}
E(c) = c \\
E(X + c) = E(X) + c \\ 
E(cX) = c E(X) \\
E(X+Y) = E(X) + E(Y) 
\end{eqnarray}
また、$X$の平均値のまわりの2次モーメント分散$V(X)$と呼び、以下の式で定義さ
れる。
\begin{eqnarray}
V(X) = E(X - \mu)^2 =\int_{-\infty}^{ \infty } (x - \mu )^2 f(x) dx
\end{eqnarray}
分散$V(X)$には以下のような性質がある。
\begin{eqnarray}
V(c) = 0 \\
V(X + c) = V(X) \\ 
E(cX) = c^2 V(X) 
\end{eqnarray}
任意のXからその期待値を引いて$X - E(X)$を考えると、期待値の性質と分散は、
それぞれ
\begin{eqnarray}E{X - E(X)} = E(X) - E (E(X)) = E(X) - E(X) = 0 \\
V{X - E(X)} = V(X) 
\end{eqnarray}
となる。ここで以下の式で$Z$を定義する。
\begin{eqnarray}
Z = \{X - E(X)\} \sqrt{V(X)}
\end{eqnarray}
この$Z$の期待値は0で、分散は1に調整されている。\\
いかなる確率変数もその期待値を引いて分散で除すことにより、期待値0、分散1に
調整することができる。\\
このような変換を標準化と呼び、$Z$を標準化変数と呼ぶ。
\\
\\
【参考文献】\\
東京大学教養部統計学教室(1991) 『統計学入門』 東京大学出版 94 - 99pp.


\pagestyle{empty}
\end{document}


なお、アップロード用のpngファイル作成については、
$ platex normalization.tex
$ dvipdfm normalization.tex
として、pdfファイルを生成したあと、
$ open normalization.tex

でmac備え付けのviewerでファイルを開き、本文を選択して、「Tool 」-> 「Crop」でクロッピングを行い、最後にpng形式で保存した。

統計学を築いた10人


Karl PearsonにはじまりWilliam Gosset, Ronald Fisherによって完成した今日の近代統計学理論の方法論としての特色は、「部分」が'正しく'選ばれていれば、それから「全体」を知ることが、論理上可能であるとうことです。「部分」と「全体」のギャップを埋めているのが、「確率」という論理装置です。以下には、近代統計学理論が成立するに至る2世紀の歩みを記述しました。


1.     William Petty, 1627 - 1687
          社会経済現象の数量的観察。「政治算術」Political Arithmetick, 1960を執筆

2.     Gottfried Achenwall, 1719 - 1772
          国勢学派。統計調査(今日の官庁統計)"Statistik"の語を使用。Stae(国家)を記述する学問の意。

3.     Simon Laplace, 1749 - 1827
          古典確率論の大成と近代確率論の基礎。

4.     Carl Friedrich Gauss, 1777 - 1855
          誤差理論と正規分布。最小二乗法

5.     Adolphe Quetelet, 1796 -1874
          大量観察と統計的法則性。「平均人」、「平均」の概念

6.     Francis Galton, 1822 -1911
          遺伝学の数理的基礎。「回帰」の導入

7.     Karl Pearson, 1851 - 1936
          近代統計学の数理的基礎。「母集団(population)」の萌芽。「相関係数」、χ^2統計量の導入

8.     William Gosset, 1876 - 1937
          t分布の導入。小(精密)標本理論。

9.     Ronald Fisher, 1890 - 1962
          統計学的推測理論の確立。標本分布論。実験計画法。F分布

10.     Abraham Wald, 1902 - 1950
          統計学的決定論。検定理論と推定理論の数学的統一と精密化



【参考文献】
東京大学教養部統計学教室(1991) 『統計学入門』 東京大学出版 4pp.

Galtonのデータ

Galtonは子供の身長と親の身長の間の相関を調べました。
今回は、このGaltonのデータセットを用いてscatter plotを描写してみました。



#galtonデータを含むパッケージのインストール
install.packages("UsingR")

#パッケージの読み込み
library("UsingR")

#galtonデータオブジェクトの生成
data(galton)

#データを上から5行分表示
  child parent
1  61.7   70.5
2  61.7   68.5
3  61.7   65.5
4  61.7   64.5
5  61.7   64.0
6  62.2   67.5


png("121222_galton.png")

#散布図の描写
plot(jitter(child,5) ~ jitter(parent,5),galton, xlab="The midparent height(inch)", ylab="The children's height(inch)", main="Scatterplot of Galton's data-set")

dev.off()

q()


データの要約

 データの要約は統計学の基本中の基本です。

身長の測定値のデータを例にとってRでの要約の方法を記述します。


> bl <- c(165,167,187,156,145,166,176,143,169,175,148,150)
> #オブジェクトの中身を確認
> bl
 [1] 165 167 187 156 145 166 176 143 169 175 148 150
> #平均値
> mean(bl)
[1] 162.25

> #中央値
> median(bl)
[1] 165.5
> #四分位値
> quantile(bl)
   0%   25%   50%   75%  100%
143.0 149.5 165.5 170.5 187.0 
[1] 165.5
> #四分位値偏差
> IQR(bl)
[1] 21

> #不偏分散      
> var(bl)
[1] 192.2045
> #範囲
> range
range          range.default 
> #範囲
> max(bl)-min(bl)
[1] 44
> png("121220_body_length.png")
> #身長を箱ひげ図に描写
> boxplot(bl, ylab="cm", main="The body length")
> dev.off()
null device
          1 

箱の中にある線が中央値Q2=165.5
左右の四分位値Q1=149.5, Q3=170.5で箱を作る。
四分位値偏差Q.D=21の1.5倍の範囲内にある最小、最大のデータに対してひげを引き、それを超えるデータ(はずれ値)をひとつひとつプロットする。





Binomial Distribution

結果が1か0のいずれかである実験を独立にn回繰り返します。
このとき、1の生じる確率をp、0の
生じる確率を1-pとする。
このような試行をベルヌーイ試行と呼ぶ。
n回中1の生じる確率変数をxとすると、
以下のようになります
いま、n=20, p = 1/6としたときに、x=1,2, ... , 15に対応するf(x)の値を計算し、棒グラフに描写する。

x <- 0: 15
y <- dbinom(x, 20, 1/6)
names(y) <- x
png("121218_binominal.png") 
barplot(y, ylab="f(x)", xlab="binominal distribution : n = 20, p = 1/6")
abline(h=0)
dev.off()






% binomial.tex
\documentclass{jarticle}
\usepackage{amsmath}

\begin{document}
\begin{eqnarray}
f(x) = \binom{n}{x}  p^x  (1 - p)^{n - p}
\end{eqnarray}
\pagestyle{empty}
\end{document}


$ platex binomial.tex
$ dvipng -T tight binomial.dvi