33
母分散の区間推定
正規母集団から得られた標本を使って、母集団のばらつきである母分散 \(\sigma^2\) を区間推定する方法を学びます。
このページのゴール
偏差平方和とカイ二乗分布の関係を使って、母分散の信頼区間を導けるようになる。
STEP 01
母分散を区間推定する
前のレクチャーでは、
1つの母集団について
母平均 \(\mu\)
の区間推定を考えました。
今回は、
母集団のばらつきを表す
母分散 \(\sigma^2\)
を区間で推定します。
たとえば製品の品質管理
すべての製品を調べなくても、
一部の標本から
母集団全体のばらつき
を推定したい。
たとえば、
工場で製造される製品の重さについて、
平均だけでなく
どの程度ばらついているのか
を把握したい場合があります。
そのような場面で使うのが、
母分散の区間推定です。
今回の前提
\[
X\sim N(\mu,\sigma^2)
\]
正規母集団の母分散 \(\sigma^2\) を推定する
ここがポイント
今回知りたいのは母平均ではなく、
母集団のばらつきを表す母分散 \(\sigma^2\)。
STEP 02
母分散の区間推定も3つの手順で考える
母分散の区間推定も、
これまでと同じ
3つの手順
で考えていきます。
手順1
どんな値がどんな分布にしたがうか
を整理する
今回のポイントは、
ばらつきとカイ二乗分布をどう結びつけるか
です。
ここがポイント
母平均のときは標準正規分布や t分布を使った。
母分散では、カイ二乗分布を使う。
STEP 03
手順1:カイ二乗分布につながる値を考える
正規母集団
\[
X\sim N(\mu,\sigma^2)
\]
から得られた観測値 \(X_i\) を標準化すると、
\[
Z_i=
\frac{X_i-\mu}{\sigma}
\sim N(0,1)
\]
となります。
ここで、
今回推定したいのは
ばらつきを表す \(\sigma^2\)
です。
ばらつきと関係の深い標本分布として、
以前学んだ
カイ二乗分布
を思い出しましょう。
カイ二乗分布とは
\[
Z_1^2+Z_2^2+\cdots+Z_m^2
\sim\chi^2(m)
\]
標準正規分布にしたがう値を
二乗して足し合わせた値
がカイ二乗分布にしたがう。
正規分布
\[
X_i
\]
↓ 標準化
標準正規分布
\[
Z_i
\]
↓ 二乗して足す
カイ二乗分布
手順1のポイント
母分散を推定したいので、
「偏差の二乗和」がしたがうカイ二乗分布に注目する。
STEP 04
手順2:標本平均からの偏差平方和を使う
ただし、
実際には母平均 \(\mu\) は未知です。
そのため、
\(X_i-\mu\)
をそのまま計算することはできません。
そこで、
母平均 \(\mu\) の代わりに、
標本から計算できる
標本平均 \(\bar{X}\)
を使って、
\[
\sum_{i=1}^{n}
(X_i-\bar{X})^2
\]
という
標本平均からの偏差平方和
を考えます。
不偏分散と偏差平方和
\[
\hat{\sigma}^2
=
\frac{1}{n-1}
\sum_{i=1}^{n}
(X_i-\bar{X})^2
\]
↓ 両辺に \(n-1\)
\[
\sum_{i=1}^{n}
(X_i-\bar{X})^2
=
(n-1)\hat{\sigma}^2
\]
この偏差平方和を
母分散 \(\sigma^2\) で割ると、
\[
W
=
\frac{
\sum_{i=1}^{n}(X_i-\bar{X})^2
}{\sigma^2}
=
\frac{(n-1)\hat{\sigma}^2}{\sigma^2}
\]
となります。
正規母集団では、
この統計量 \(W\) が
自由度 \(n-1\) のカイ二乗分布
にしたがいます。
\[
W=
\frac{(n-1)\hat{\sigma}^2}{\sigma^2}
\sim
\chi^2(n-1)
\]
手順2のポイント
母分散 \(\sigma^2\) を含む統計量を、
カイ二乗分布の付表が使える形まで整理する。
STEP 05
なぜ自由度は \(n-1\) なのか
手順2では、
正規母集団から得られた標本について、
\[
W=
\frac{(n-1)\hat{\sigma}^2}{\sigma^2}
\sim
\chi^2(n-1)
\]
という統計量を使うことを確認しました。
ここで注意したいのが、
カイ二乗分布の
自由度
です。
標本は \(n\) 個あるにもかかわらず、
自由度は \(n\) ではなく
\(n-1\)
になります。
\(n\) 個の偏差は、すべて自由ではない
\[
X_1-\bar{X},\;
X_2-\bar{X},\;
\ldots,\;
X_n-\bar{X}
\]
ただし
\[
\sum_{i=1}^{n}(X_i-\bar{X})=0
\]
↓
\(n-1\) 個が決まれば、最後の1個は自動的に決まる
標本平均 \(\bar{X}\) を使うと、
\(n\) 個の偏差の合計は必ず0になります。
そのため、
\(n\) 個すべてを自由に決めることはできず、
本当に自由に動ける偏差は
\(n-1\) 個
です。
このことが、
\(W\) がしたがうカイ二乗分布の自由度
\(n-1\)
につながっています。
詳細:なぜ \(W\) は自由度 \(n-1\) のカイ二乗分布にしたがう?
まず、正規母集団から得られた
\(X_1,\ldots,X_n\) を標準化すると、
\[
Z_i=
\frac{X_i-\mu}{\sigma}
\sim N(0,1)
\]
となります。
したがって、その二乗和は
\[
\sum_{i=1}^{n}
\left(
\frac{X_i-\mu}{\sigma}
\right)^2
\sim
\chi^2(n)
\]
ここで、二乗和には次の分解が成り立ちます。
\[
\sum_{i=1}^{n}
(X_i-\mu)^2
=
\sum_{i=1}^{n}
(X_i-\bar X)^2
+
n(\bar X-\mu)^2
\]
全体のばらつき
=
標本平均まわりのばらつき
+
標本平均と母平均のズレ
両辺を \(\sigma^2\) で割ると、
\[
\sum_{i=1}^{n}
\left(
\frac{X_i-\mu}{\sigma}
\right)^2
=
\sum_{i=1}^{n}
\left(
\frac{X_i-\bar X}{\sigma}
\right)^2
+
\frac{n(\bar X-\mu)^2}{\sigma^2}
\]
右端の第2項に注目します。
標本平均について、
\[
\frac{\bar X-\mu}{\sigma/\sqrt n}
\sim N(0,1)
\]
なので、その二乗は
\[
\frac{n(\bar X-\mu)^2}{\sigma^2}
\sim
\chi^2(1)
\]
つまり、
もともと自由度 \(n\) をもつ二乗和のうち、
標本平均のズレを表す部分が自由度1を使っている
と考えられます。
全体
\(\chi^2(n)\)
=
標本平均まわりの偏差平方和
\(\chi^2(n-1)\)
+
標本平均のズレ
\(\chi^2(1)\)
ただし、
「全体が自由度 \(n\) で、第2項が自由度1だから、
残りは自動的に自由度 \(n-1\)」
と考えるだけでは十分ではありません。
正規母集団では、
標本平均 \(\bar X\) と、
標本平均まわりの偏差平方和が独立
という特別な性質があります。
この独立性によって、
二乗和を分解したときに
自由度も
\[
n=(n-1)+1
\]
と分けることができ、
標本平均まわりの偏差平方和は
\[
\sum_{i=1}^{n}
\left(
\frac{X_i-\bar X}{\sigma}
\right)^2
\sim
\chi^2(n-1)
\]
となります。
最後に、不偏分散
\[
\hat{\sigma}^2
=
\frac{1}{n-1}
\sum_{i=1}^{n}
(X_i-\bar X)^2
\]
を使うと、
\[
\sum_{i=1}^{n}
(X_i-\bar X)^2
=
(n-1)\hat{\sigma}^2
\]
なので、
\[
W=
\frac{(n-1)\hat{\sigma}^2}{\sigma^2}
\sim
\chi^2(n-1)
\]
※この「独立な二乗和に分解すると自由度も分かれる」という結果は、
コクランの定理と呼ばれます。
付表を見るときの注意
標本サイズが \(n\) なら、
カイ二乗分布表で確認する自由度は
\(n-1\)
です。
ここがポイント
標本平均を使うことで自由度を1つ使うため、
偏差平方和の自由度は \(n-1\)。
したがって
\(W=(n-1)\hat{\sigma}^2/\sigma^2\)
は自由度 \(n-1\) のカイ二乗分布にしたがう。
STEP 06
手順3:カイ二乗分布の中央95%を考える
ここまでで、
\[
W=
\frac{(n-1)\hat{\sigma}^2}{\sigma^2}
\sim
\chi^2(n-1)
\]
と整理できました。
ここからは、
カイ二乗分布の付表を使って、
\(W\) が入る確率の高い区間を考えます。
その前に、
カイ二乗分布で使う
「上側%点」
の意味を確認しておきましょう。
%点の意味は、これまでと同じ
標準正規分布
\[
P(Z\ge z_{\alpha})=\alpha
\]
\(z_{\alpha}\) は、
その値より右側の確率が \(\alpha\)
になる境界値です。
t分布
\[
P\left(
T\ge t_{\alpha}(n-1)
\right)
=
\alpha
\]
\(t_{\alpha}(n-1)\) も、
その値より右側の確率が \(\alpha\)
になる境界値です。
カイ二乗分布
\[
P\left(
W\ge
\chi^2_{\alpha}(n-1)
\right)
=
\alpha
\]
\(\chi^2_{\alpha}(n-1)\) も同じく、
その値より右側に \(W\) が入る確率が \(\alpha\)
になる境界値です。
つまり、
\(z_{\alpha}\)、
\(t_{\alpha}(n-1)\)、
\(\chi^2_{\alpha}(n-1)\)
は、
使っている分布は違いますが、
「その境界値より右側に残る確率が \(\alpha\)」
という意味では同じです。
では、
信頼係数95%の場合を考えます。
\[
1-\alpha=0.95
\]
↓
\[
\alpha=0.05
\]
↓ 左右に半分
\[
\frac{\alpha}{2}=0.025
\]
したがって、
カイ二乗分布でも、
中央95%を残すために
左右に2.5%ずつ
を残します。
カイ二乗分布の中央95%
左側の境界
下側2.5%点
=
上側97.5%点
右側の境界
上側2.5%点
ここで、
カイ二乗分布では1つ注意があります。
カイ二乗分布は
左右対称ではありません。
そのため、
標準正規分布や t分布のように、
右側の境界値にマイナスを付ければ
左側の境界値になる、
とは考えられません。
左右それぞれの境界値を、
カイ二乗分布の付表から
別々に確認する必要があります。
\[
P\left(
\chi^2_{1-\alpha/2}(n-1)
\le
W
\le
\chi^2_{\alpha/2}(n-1)
\right)
=
1-\alpha
\]
95%信頼区間なら、
\(\alpha/2=0.025\)
なので、
左側の境界
\[
\chi^2_{0.975}(n-1)
\]
上側97.5%点
= 下側2.5%点
右側の境界
\[
\chi^2_{0.025}(n-1)
\]
上側2.5%点
つまり、
上側%点という言葉だけを見ると少し複雑ですが、
「その境界より右側に何%残るのか」
と考えれば、
zやtの%点と同じ意味だと理解できます。
手順3のポイント
カイ二乗分布の%点も、
zやtの%点と同じく
「右側に残る確率」で定義する。
ただしカイ二乗分布は左右非対称なので、
左右の境界値はそれぞれ付表から確認する。
STEP 07
\(W\) の区間から母分散 \(\sigma^2\) の区間へ
ここまでで、
自由度 \(n-1\) のカイ二乗分布を使って、
\(W\) の中央 \(1-\alpha\) の区間を
\[
\chi^2_{1-\alpha/2}(n-1)
\le
W
\le
\chi^2_{\alpha/2}(n-1)
\]
と表せることを確認しました。
ここで、
この式に登場するカイ二乗の記号を、
もう一度整理しておきましょう。
カイ二乗の記号は「%点」を表している
\[
\chi^2_{\alpha/2}(n-1)
\]
自由度 \(n-1\) のカイ二乗分布における、
上側 \(\alpha/2\) 点です。
つまり、この値より右側の確率が
\(\alpha/2\)
になります。
\[
\chi^2_{1-\alpha/2}(n-1)
\]
自由度 \(n-1\) のカイ二乗分布における、
上側 \(1-\alpha/2\) 点です。
記号の \(n-1\) が2か所に出てくるので注意
最終的な信頼区間では、
\(n-1\) が複数回登場しますが、
意味は異なります。
分子の \(n-1\)
不偏分散
\[
\hat{\sigma}^2
=
\frac{1}{n-1}
\sum (X_i-\bar X)^2
\]
から出てきた係数
\(\chi^2_{\alpha/2}(n-1)\)
の中の \(n-1\)
カイ二乗分布の
自由度
では、
母分散 \(\sigma^2\) の区間を求めていきます。
\(W\) は
\[
W=
\frac{(n-1)\hat{\sigma}^2}{\sigma^2}
\]
でした。
これを先ほどの確率区間に代入します。
\[
\chi^2_{1-\alpha/2}(n-1)
\le
W
\le
\chi^2_{\alpha/2}(n-1)
\]
↓ \(W\) を代入
\[
\chi^2_{1-\alpha/2}(n-1)
\le
\frac{(n-1)\hat{\sigma}^2}{\sigma^2}
\le
\chi^2_{\alpha/2}(n-1)
\]
↓ \(\sigma^2\) について整理
\[
\frac{(n-1)\hat{\sigma}^2}
{\chi^2_{\alpha/2}(n-1)}
\le
\sigma^2
\le
\frac{(n-1)\hat{\sigma}^2}
{\chi^2_{1-\alpha/2}(n-1)}
\]
これが、
母分散 \(\sigma^2\) の
\(1-\alpha\) 信頼区間
です。
最終式をパーツに分けて読む
分子
\[
(n-1)\hat{\sigma}^2
\]
標本から計算できる
偏差平方和
分母
\[
\chi^2_{\alpha/2}(n-1)
\qquad
\chi^2_{1-\alpha/2}(n-1)
\]
自由度 \(n-1\) のカイ二乗分布から
付表で探す%点
ここで、
境界値の位置が入れ替わっている点にも注意しましょう。
なぜ%点の位置が入れ替わる?
\(W\) の区間では、
\[
\chi^2_{1-\alpha/2}(n-1)
\le
W
\le
\chi^2_{\alpha/2}(n-1)
\]
でした。
しかし、
\(\sigma^2\) について解くと、
カイ二乗分布の%点が
分母
に入ります。
大きい値で割るほど結果は小さくなり、
小さい値で割るほど結果は大きくなるため、
左右の%点の位置が入れ替わります。
ここがポイント
\(\chi^2_{\alpha/2}(n-1)\) などは、
自由度 \(n-1\) のカイ二乗分布の
「%点」を表す記号。
分子の \(n-1\) とは役割が異なるので、
式をパーツに分けて読む。
STEP 08
母分散の区間推定を3つの手順で整理する
手順1
ばらつきと関係する分布を考える
標準正規分布の二乗和
→ カイ二乗分布
↓
手順2
カイ二乗分布の付表が使える形へ
\[
\frac{(n-1)\hat{\sigma}^2}{\sigma^2}
\sim
\chi^2(n-1)
\]
↓
手順3
中央 \(1-\alpha\) の確率区間を作る
\[
\chi^2_{1-\alpha/2}(n-1)
\le W \le
\chi^2_{\alpha/2}(n-1)
\]
↓
\[
\frac{(n-1)\hat{\sigma}^2}
{\chi^2_{\alpha/2}(n-1)}
\le
\sigma^2
\le
\frac{(n-1)\hat{\sigma}^2}
{\chi^2_{1-\alpha/2}(n-1)}
\]
母分散の区間推定では、
公式をそのまま覚えるよりも、
「偏差平方和 → カイ二乗分布 → 確率区間 → \(\sigma^2\) について整理」
という流れで理解しておくと、
式の意味を追いやすくなります。
最後に
母分散の区間推定でも基本は3つの手順。
特に「なぜカイ二乗分布が出てくるのか」を、
偏差平方和から理解しておく。
SUMMARY
母分散の区間推定を整理する
推定対象
母集団のばらつき
\(\sigma^2\)
手順2
\[
\frac{(n-1)\hat{\sigma}^2}{\sigma^2}
\sim
\chi^2(n-1)
\]
手順3
カイ二乗分布の
中央 \(1-\alpha\)
の区間を考える
自由度
標本サイズ \(n\) に対して
\(n-1\)
95%信頼区間なら
信頼係数
\[
1-\alpha=0.95
\]
↓
\[
\alpha=0.05
\]
↓ 左右に半分
\[
\frac{\alpha}{2}=0.025
\]
↓
左側の境界
\[
\chi^2_{0.975}(n-1)
\]
上側97.5%点
右側の境界
\[
\chi^2_{0.025}(n-1)
\]
上側2.5%点
母分散の \(1-\alpha\) 信頼区間
\[
\frac{(n-1)\hat{\sigma}^2}
{\chi^2_{\alpha/2}(n-1)}
\le
\sigma^2
\le
\frac{(n-1)\hat{\sigma}^2}
{\chi^2_{1-\alpha/2}(n-1)}
\]
95%信頼区間の場合
\(\alpha=0.05\)、\(\alpha/2=0.025\) を代入する
\[
\frac{(n-1)\hat{\sigma}^2}
{\chi^2_{0.025}(n-1)}
\le
\sigma^2
\le
\frac{(n-1)\hat{\sigma}^2}
{\chi^2_{0.975}(n-1)}
\]
式の読み方
分子の \((n-1)\hat{\sigma}^2\) は
標本から計算する偏差平方和。
分母の
\(\chi^2_{0.025}(n-1)\)、
\(\chi^2_{0.975}(n-1)\)
は、
自由度 \(n-1\) のカイ二乗分布の%点
です。
特に注意する3点
① カイ二乗分布の自由度は \(n-1\)
② カイ二乗分布は左右対称ではない
③ \(\sigma^2\) について解くと%点の位置が入れ替わる
最後に
母分散の区間推定は、
「偏差平方和 → カイ二乗分布 → 中央の確率区間 → \(\sigma^2\) について解く」
という流れで整理する。
95%信頼区間なら、
左右2.5%ずつを除き、
上側2.5%点と上側97.5%点を使う。
NEXT STEP
次のステップ:統計検定®2級を目指す
このサイトで統計学の基礎を学んだあと、
統計検定®2級の合格まで体系的に学びたい方へ。
統計検定®2級対策講座【ベストセラー版】
約9時間の動画講義と200問以上の小テストに加えて、
模擬試験にも取り組めます。
講座内ではQ&Aも利用でき、
これまでに400問以上の質問に回答してきました。
約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ
記述統計・確率・推定・検定を基礎から学ぶ
「統計学ベーシック講座その1『確率分布・推定・検定』」
も用意しています。
統計学ベーシック講座を見る →