スマホで統計学

26

大数の法則と中心極限定理

標本数を増やしていくと、標本平均には2つの重要な変化が起こります。1つは母平均の近くに集まっていくこと。もう1つは、その分布の形が正規分布に近づいていくことです。この2つを、大数の法則と中心極限定理として整理します。
このページのゴール

大数の法則と中心極限定理の違いを区別し、「標本平均は母平均に集まる」「標本平均の分布は正規分布に近づく」という2つの性質を図から理解できるようになる。

STEP 01

大数の法則と中心極限定理は何が違う?

標本数 \(n\) を大きくしたとき、 標本平均 \(\bar{X}\) には2つの重要な性質が現れます。

大数の法則
標本平均は「どこ」に集まる?
\(n\) が大きくなるほど、 \(\bar{X}\) は母平均 \(\mu\) の近くに集まる
中心極限定理
標本平均は「どんな形」に分布する?
\(n\) が大きくなるほど、 \(\bar{X}\) の分布は正規分布に近づく
大数の法則
\(\bar{X}\rightarrow\mu\)
中心極限定理
分布の形 → 正規分布

似た話に見えますが、 「集まる場所」と「分布の形」という、 それぞれ別のことを説明する定理です。

ここがポイント
大数の法則は「どこへ集まるか」。
中心極限定理は「どんな形になるか」。
STEP 02

標本数を増やすと母平均に集まる

まず、大数の法則をイメージしてみましょう。

同じ母集団から標本を取り、 そのたびに標本平均 \(\bar{X}\) を計算すると、 標本平均は毎回少しずつ異なる値になります。

しかし、サンプルサイズ \(n\) を大きくすると、 そのばらつきが小さくなっていきます。

標本平均が現れる位置
\(n\) が小さい
\(\mu\)
\(n\) が大きくなる
\(\mu\)
\(n\) がさらに大きい
\(\mu\)

この理由は、前に確認した標本平均の分散を見るとわかります。

\[ V[\bar{X}] = \frac{\sigma^2}{n} \]

\(n\) が大きくなるほど、 \(\sigma^2/n\) は0に近づきます。

\(n\) が大きくなる
\(V[\bar{X}]=\sigma^2/n\) が小さくなる
\(\bar{X}\) が \(\mu\) の近くに集まる

この性質を、 大数の法則といいます。

\[ \bar{X} \xrightarrow{P} \mu \]

「標本平均が母平均 \(\mu\) に確率収束する」 と表現します。

ここがポイント
\(n\) を増やすほど標本平均のばらつきが小さくなり、 \(\bar{X}\) は \(\mu\) の近くに集まる。
STEP 03

「確率収束」とはどういう意味?

大数の法則では、 標本平均 \(\bar{X}\) が母平均 \(\mu\) に 確率収束するといいます。

これは、 「\(n\) を大きくすれば、ある時点から完全に一致して動かなくなる」 という意味ではありません。

正確には、 \(\bar{X}\) と \(\mu\) の差が一定以上になる確率が、 \(n\) を大きくするほど0に近づく という意味です。

\(\mu\) のまわりに小さな範囲をつくる
\(\mu-\varepsilon\)
\(\mu\)
\(\mu+\varepsilon\)
\(n\) が大きいほど
\(\bar{X}\) がこの範囲に入る確率 → 1

\(\varepsilon\) は、 どれだけ小さな正の数でも構いません。

どれだけ狭い範囲を設定しても、 \(n\) を十分大きくすれば、 標本平均 \(\bar{X}\) がその中に入る確率は1に近づいていきます。

確率収束
\[ P\left(|\bar{X}-\mu|\lt\varepsilon\right)\to1 \]
または同じ意味で
\[ P\left(|\bar{X}-\mu|\ge\varepsilon\right)\to0 \]
チェビシェフの不等式から確認する

平均 \(\mu\)、分散 \(\sigma^2\) の確率変数 \(X\) について、 任意の正の数 \(k\) に対して、 チェビシェフの不等式

\[ P\left(|X-\mu|\ge k\right)\le\frac{\sigma^2}{k^2} \]

が成り立ちます。

同じ内容を、 「平均から \(k\) 未満の範囲に入る確率」で書けば、

\[ P\left(|X-\mu|\lt k\right)\ge 1-\frac{\sigma^2}{k^2} \]

です。

これを標本平均 \(\bar{X}\) に適用します。 標本平均については、

\[ E[\bar{X}]=\mu,\qquad V[\bar{X}]=\frac{\sigma^2}{n} \]

でした。 \(k\) を任意の正の数 \(\varepsilon\) とすると、

\[ P\left(|\bar{X}-\mu|\lt\varepsilon\right) \ge 1-\frac{\sigma^2}{n\varepsilon^2} \]

となります。

ここで \(n\to\infty\) とすると、

\[ \frac{\sigma^2}{n\varepsilon^2}\to0 \]

なので、不等式の右辺は1に近づきます。

\[ 1-\frac{\sigma^2}{n\varepsilon^2}\to1 \]

確率は1を超えないため、結果として

\[ P\left(|\bar{X}-\mu|\lt\varepsilon\right)\to1 \]

となります。

これが、 標本平均 \(\bar{X}\) が母平均 \(\mu\) に 確率収束することの数式的な確認です。

ここがポイント
どれだけ狭い \(\mu\) の周辺を考えても、 \(n\) を増やせば \(\bar{X}\) がそこに入る確率は1へ近づく。
STEP 04

中心極限定理は「和の分布」の話

大数の法則からわかるのは、 標本平均がどこに集まるのかということでした。

しかし、それだけでは、 標本平均がどのような形の分布にしたがうのかまではわかりません。

そこで登場するのが、 中心極限定理です。

中心極限定理の基本イメージ
確率変数をたくさん足す
その和の分布が
正規分布に近づく

たとえば、 \(X_1,X_2,\ldots,X_n\) が互いに独立で、 同じ確率分布にしたがい、

\[ E[X_i]=\mu, \qquad V[X_i]=\sigma^2 \]

であるとします。

元の分布が正規分布でなくても、 \(n\) を大きくすると、 その

\[ S_n=X_1+X_2+\cdots+X_n \]

を適切に標準化した分布は、 標準正規分布に近づいていきます。

元の確率変数の分布は正規分布でなくてもよい
一様な分布
右に歪んだ分布
独立な確率変数をたくさん足す
\(X_1+X_2+\cdots+X_n\)
↓ \(n\) を大きくする
和の分布が正規分布に近づく

標本平均も、この「確率変数の和」の仲間です。

標本平均
\[ \bar{X} = \frac{X_1+X_2+\cdots+X_n}{n} \]
\[ \frac{X_1}{n} + \frac{X_2}{n} +\cdots+ \frac{X_n}{n} \]
標本平均も確率変数の「和」

そのため中心極限定理を使うと、 \(n\) が大きいとき、 標本平均の分布も正規分布に近づくことがわかります。

確率変数の和
中心極限定理
正規分布に近づく
標本平均も、次に見る二項分布も、
「確率変数の和」として考えられる
中心極限定理を数式で確認する

\(X_1,\ldots,X_n\) が独立同分布で、

\[ E[X_i]=\mu, \qquad V[X_i]=\sigma^2 \]

とします。

\[ S_n = X_1+X_2+\cdots+X_n \]

の期待値と分散は、

\[ E[S_n]=n\mu, \qquad V[S_n]=n\sigma^2 \]

です。

中心極限定理では、 この和を標準化した

\[ \frac{ S_n-n\mu }{ \sigma\sqrt{n} } \]

の分布が、 \(n\to\infty\) のとき標準正規分布へ近づきます。

\[ \frac{ S_n-n\mu }{ \sigma\sqrt{n} } \xrightarrow{d} N(0,1) \]

標本平均

\[ \bar{X}=\frac{S_n}{n} \]

を使えば、同じ内容を

\[ \frac{ \sqrt{n}(\bar{X}-\mu) }{ \sigma } \xrightarrow{d} N(0,1) \]

と表すことができます。

ここがポイント
中心極限定理の出発点は「確率変数の和」。
標本平均も二項分布も、その代表例として理解できる。
STEP 05

中心とばらつきはどこから来る?

中心極限定理と、前に学んだ標本平均の性質は、 ここで組み合わさります。

ただし、それぞれが教えてくれる内容は異なります。

標本平均の性質
中心: \[ E[\bar{X}]=\mu \] ばらつき: \[ V[\bar{X}] = \frac{\sigma^2}{n} \]
中心極限定理
分布の形が
正規分布に近づく
↓ 組み合わせる
\(n\) が十分大きいとき
\[ \bar{X} \approx N\left( \mu, \frac{\sigma^2}{n} \right) \]

ここは混同しやすいポイントです。

\(\mu\) と \(\sigma^2/n\) は 標本平均の期待値・分散の性質から得られます。

一方、 「正規分布に近づく」 という部分を与えてくれるのが中心極限定理です。

中心極限定理を数式で確認する

独立同分布な確率変数 \(X_1,\ldots,X_n\) が、

\[ E[X_i]=\mu, \qquad V[X_i]=\sigma^2 \]

を満たすとします。

中心極限定理では、

\[ \frac{ \sqrt{n}(\bar{X}-\mu) }{\sigma} \]

の分布が、 \(n\to\infty\) のとき標準正規分布へ近づくことを示します。

\[ \frac{ \sqrt{n}(\bar{X}-\mu) }{\sigma} \xrightarrow{d} N(0,1) \]

これを標本平均の形で見ると、 \(n\) が十分大きいとき

\[ \bar{X} \approx N\left( \mu, \frac{\sigma^2}{n} \right) \]

と近似できます。

ここがポイント
「中心と分散」は標本平均の性質。
「正規分布に近づく」は中心極限定理。
STEP 06

二項分布も正規分布に近づく

中心極限定理の代表的な例として、 二項分布があります。

二項分布は、0か1をとるベルヌーイ試行を \(n\) 回足し合わせたものです。

1回のベルヌーイ試行
0
または
1
↓ \(n\) 回足す
\(X=Y_1+Y_2+\cdots+Y_n\)
\(X\sim B(n,p)\)

つまり二項分布も、 確率変数の和です。

そのため試行回数 \(n\) を大きくすると、 二項分布も正規分布に近づいていきます。

\(n\) が小さい
離散的で歪みも目立つ
↓ \(n\) を大きくする
\(n\) が大きい
正規分布に近い形になる

ただし、 「\(n\ge30\) なら必ず中心極限定理を使える」 という明確な境界があるわけではありません。

\(n=30\) はあくまで目安
必要なサンプルサイズは、 元の分布がどの程度歪んでいるかなどによって変わります。 \(n=30\) は実務や入門書で使われることのある大まかな目安として考えましょう。
ここがポイント
二項分布も「0・1の確率変数の和」。 試行回数を増やすと正規分布に近づく。
SUMMARY

大数の法則と中心極限定理を整理する

大数の法則
\(n\) を増やすほど 標本平均は母平均 \(\mu\) に集まる
確率収束
\(\bar{X}\) が \(\mu\) から大きく外れる確率が0へ近づく
中心極限定理
\(n\) を増やすと 和や平均の分布が正規分布に近づく
標本平均
大標本では \(\bar{X}\approx N(\mu,\sigma^2/n)\)
二項分布
ベルヌーイ変数の和なので、 試行回数が大きいと正規分布に近づく
2つを区別する
大数の法則
どこに集まる?
→ 母平均 \(\mu\)
中心極限定理
どんな形になる?
→ 正規分布
最後に
大数の法則は「標本平均が母平均へ集まる」。
中心極限定理は「標本平均の分布が正規分布に近づく」。
NEXT STEP

次のステップ:統計検定®2級を目指す

このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。

統計検定®2級対策講座【ベストセラー版】

約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。

約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ

記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。

統計学ベーシック講座を見る →