スマホで統計学

33

母分散の区間推定

正規母集団から得られた標本を使って、母集団のばらつきである母分散 \(\sigma^2\) を区間推定する方法を学びます。
このページのゴール

偏差平方和とカイ二乗分布の関係を使って、母分散の信頼区間を導けるようになる。

STEP 01

母分散を区間推定する

前のレクチャーでは、 1つの母集団について 母平均 \(\mu\) の区間推定を考えました。

今回は、 母集団のばらつきを表す 母分散 \(\sigma^2\) を区間で推定します。

たとえば製品の品質管理
工場で作られる製品 標本 知りたいもの 重さの ばらつき
すべての製品を調べなくても、 一部の標本から 母集団全体のばらつき を推定したい。

たとえば、 工場で製造される製品の重さについて、 平均だけでなく どの程度ばらついているのか を把握したい場合があります。

そのような場面で使うのが、 母分散の区間推定です。

今回の前提
\[ X\sim N(\mu,\sigma^2) \]
正規母集団の母分散 \(\sigma^2\) を推定する
ここがポイント
今回知りたいのは母平均ではなく、 母集団のばらつきを表す母分散 \(\sigma^2\)。
STEP 02

母分散の区間推定も3つの手順で考える

母分散の区間推定も、 これまでと同じ 3つの手順 で考えていきます。

手順1
どんな値がどんな分布にしたがうか を整理する
手順2
カイ二乗分布の付表が使える形 に整理する
手順3
確率を使って母分散の区間をつくる

今回のポイントは、 ばらつきとカイ二乗分布をどう結びつけるか です。

ここがポイント
母平均のときは標準正規分布や t分布を使った。
母分散では、カイ二乗分布を使う。
STEP 03

手順1:カイ二乗分布につながる値を考える

正規母集団

\[ X\sim N(\mu,\sigma^2) \]

から得られた観測値 \(X_i\) を標準化すると、

\[ Z_i= \frac{X_i-\mu}{\sigma} \sim N(0,1) \]

となります。

ここで、 今回推定したいのは ばらつきを表す \(\sigma^2\) です。

ばらつきと関係の深い標本分布として、 以前学んだ カイ二乗分布 を思い出しましょう。

カイ二乗分布とは
\[ Z_1^2+Z_2^2+\cdots+Z_m^2 \sim\chi^2(m) \]
標準正規分布にしたがう値を 二乗して足し合わせた値 がカイ二乗分布にしたがう。
正規分布 \[ X_i \]
↓ 標準化
標準正規分布 \[ Z_i \]
↓ 二乗して足す
カイ二乗分布
手順1のポイント
母分散を推定したいので、 「偏差の二乗和」がしたがうカイ二乗分布に注目する。
STEP 04

手順2:標本平均からの偏差平方和を使う

ただし、 実際には母平均 \(\mu\) は未知です。

そのため、 \(X_i-\mu\) をそのまま計算することはできません。

そこで、 母平均 \(\mu\) の代わりに、 標本から計算できる 標本平均 \(\bar{X}\) を使って、

\[ \sum_{i=1}^{n} (X_i-\bar{X})^2 \]

という 標本平均からの偏差平方和 を考えます。

不偏分散と偏差平方和
\[ \hat{\sigma}^2 = \frac{1}{n-1} \sum_{i=1}^{n} (X_i-\bar{X})^2 \]
↓ 両辺に \(n-1\)
\[ \sum_{i=1}^{n} (X_i-\bar{X})^2 = (n-1)\hat{\sigma}^2 \]

この偏差平方和を 母分散 \(\sigma^2\) で割ると、

\[ W = \frac{ \sum_{i=1}^{n}(X_i-\bar{X})^2 }{\sigma^2} = \frac{(n-1)\hat{\sigma}^2}{\sigma^2} \]

となります。

正規母集団では、 この統計量 \(W\) が 自由度 \(n-1\) のカイ二乗分布 にしたがいます。

\[ W= \frac{(n-1)\hat{\sigma}^2}{\sigma^2} \sim \chi^2(n-1) \]
手順2のポイント
母分散 \(\sigma^2\) を含む統計量を、 カイ二乗分布の付表が使える形まで整理する。
STEP 05

なぜ自由度は \(n-1\) なのか

手順2では、 正規母集団から得られた標本について、

\[ W= \frac{(n-1)\hat{\sigma}^2}{\sigma^2} \sim \chi^2(n-1) \]

という統計量を使うことを確認しました。

ここで注意したいのが、 カイ二乗分布の 自由度 です。

標本は \(n\) 個あるにもかかわらず、 自由度は \(n\) ではなく \(n-1\) になります。

\(n\) 個の偏差は、すべて自由ではない
\[ X_1-\bar{X},\; X_2-\bar{X},\; \ldots,\; X_n-\bar{X} \]
ただし
\[ \sum_{i=1}^{n}(X_i-\bar{X})=0 \]
\(n-1\) 個が決まれば、最後の1個は自動的に決まる

標本平均 \(\bar{X}\) を使うと、 \(n\) 個の偏差の合計は必ず0になります。

そのため、 \(n\) 個すべてを自由に決めることはできず、 本当に自由に動ける偏差は \(n-1\) 個 です。

このことが、 \(W\) がしたがうカイ二乗分布の自由度 \(n-1\) につながっています。

詳細:なぜ \(W\) は自由度 \(n-1\) のカイ二乗分布にしたがう?

まず、正規母集団から得られた \(X_1,\ldots,X_n\) を標準化すると、

\[ Z_i= \frac{X_i-\mu}{\sigma} \sim N(0,1) \]

となります。 したがって、その二乗和は

\[ \sum_{i=1}^{n} \left( \frac{X_i-\mu}{\sigma} \right)^2 \sim \chi^2(n) \]

ここで、二乗和には次の分解が成り立ちます。

\[ \sum_{i=1}^{n} (X_i-\mu)^2 = \sum_{i=1}^{n} (X_i-\bar X)^2 + n(\bar X-\mu)^2 \]
全体のばらつき
標本平均まわりのばらつき
標本平均と母平均のズレ

両辺を \(\sigma^2\) で割ると、

\[ \sum_{i=1}^{n} \left( \frac{X_i-\mu}{\sigma} \right)^2 = \sum_{i=1}^{n} \left( \frac{X_i-\bar X}{\sigma} \right)^2 + \frac{n(\bar X-\mu)^2}{\sigma^2} \]

右端の第2項に注目します。 標本平均について、

\[ \frac{\bar X-\mu}{\sigma/\sqrt n} \sim N(0,1) \]

なので、その二乗は

\[ \frac{n(\bar X-\mu)^2}{\sigma^2} \sim \chi^2(1) \]

つまり、 もともと自由度 \(n\) をもつ二乗和のうち、 標本平均のズレを表す部分が自由度1を使っている と考えられます。

全体 \(\chi^2(n)\)
標本平均まわりの偏差平方和 \(\chi^2(n-1)\)
標本平均のズレ \(\chi^2(1)\)

ただし、 「全体が自由度 \(n\) で、第2項が自由度1だから、 残りは自動的に自由度 \(n-1\)」 と考えるだけでは十分ではありません。

正規母集団では、 標本平均 \(\bar X\) と、 標本平均まわりの偏差平方和が独立 という特別な性質があります。

この独立性によって、 二乗和を分解したときに 自由度も

\[ n=(n-1)+1 \]

と分けることができ、 標本平均まわりの偏差平方和は

\[ \sum_{i=1}^{n} \left( \frac{X_i-\bar X}{\sigma} \right)^2 \sim \chi^2(n-1) \]

となります。

最後に、不偏分散

\[ \hat{\sigma}^2 = \frac{1}{n-1} \sum_{i=1}^{n} (X_i-\bar X)^2 \]

を使うと、

\[ \sum_{i=1}^{n} (X_i-\bar X)^2 = (n-1)\hat{\sigma}^2 \]

なので、

\[ W= \frac{(n-1)\hat{\sigma}^2}{\sigma^2} \sim \chi^2(n-1) \]

※この「独立な二乗和に分解すると自由度も分かれる」という結果は、 コクランの定理と呼ばれます。

付表を見るときの注意
標本サイズが \(n\) なら、 カイ二乗分布表で確認する自由度は \(n-1\) です。
ここがポイント
標本平均を使うことで自由度を1つ使うため、 偏差平方和の自由度は \(n-1\)。
したがって \(W=(n-1)\hat{\sigma}^2/\sigma^2\) は自由度 \(n-1\) のカイ二乗分布にしたがう。
STEP 06

手順3:カイ二乗分布の中央95%を考える

ここまでで、

\[ W= \frac{(n-1)\hat{\sigma}^2}{\sigma^2} \sim \chi^2(n-1) \]

と整理できました。

ここからは、 カイ二乗分布の付表を使って、 \(W\) が入る確率の高い区間を考えます。

その前に、 カイ二乗分布で使う 「上側%点」 の意味を確認しておきましょう。

%点の意味は、これまでと同じ
標準正規分布
\[ P(Z\ge z_{\alpha})=\alpha \]
\(z_{\alpha}\) は、 その値より右側の確率が \(\alpha\) になる境界値です。
t分布
\[ P\left( T\ge t_{\alpha}(n-1) \right) = \alpha \]
\(t_{\alpha}(n-1)\) も、 その値より右側の確率が \(\alpha\) になる境界値です。
カイ二乗分布
\[ P\left( W\ge \chi^2_{\alpha}(n-1) \right) = \alpha \]
\(\chi^2_{\alpha}(n-1)\) も同じく、 その値より右側に \(W\) が入る確率が \(\alpha\) になる境界値です。

つまり、 \(z_{\alpha}\)、 \(t_{\alpha}(n-1)\)、 \(\chi^2_{\alpha}(n-1)\) は、 使っている分布は違いますが、

「その境界値より右側に残る確率が \(\alpha\)」 という意味では同じです。

では、 信頼係数95%の場合を考えます。

\[ 1-\alpha=0.95 \]
\[ \alpha=0.05 \]
↓ 左右に半分
\[ \frac{\alpha}{2}=0.025 \]

したがって、 カイ二乗分布でも、 中央95%を残すために 左右に2.5%ずつ を残します。

カイ二乗分布の中央95%
95% 2.5% 2.5%
左側の境界
下側2.5%点 = 上側97.5%点
右側の境界
上側2.5%点

ここで、 カイ二乗分布では1つ注意があります。

カイ二乗分布は 左右対称ではありません

そのため、 標準正規分布や t分布のように、 右側の境界値にマイナスを付ければ 左側の境界値になる、 とは考えられません。

左右それぞれの境界値を、 カイ二乗分布の付表から 別々に確認する必要があります。

\[ P\left( \chi^2_{1-\alpha/2}(n-1) \le W \le \chi^2_{\alpha/2}(n-1) \right) = 1-\alpha \]

95%信頼区間なら、 \(\alpha/2=0.025\) なので、

左側の境界
\[ \chi^2_{0.975}(n-1) \] 上側97.5%点 = 下側2.5%点

右側の境界
\[ \chi^2_{0.025}(n-1) \] 上側2.5%点

つまり、 上側%点という言葉だけを見ると少し複雑ですが、

「その境界より右側に何%残るのか」

と考えれば、 zやtの%点と同じ意味だと理解できます。

手順3のポイント
カイ二乗分布の%点も、 zやtの%点と同じく 「右側に残る確率」で定義する。
ただしカイ二乗分布は左右非対称なので、 左右の境界値はそれぞれ付表から確認する。
STEP 07

\(W\) の区間から母分散 \(\sigma^2\) の区間へ

ここまでで、 自由度 \(n-1\) のカイ二乗分布を使って、 \(W\) の中央 \(1-\alpha\) の区間を

\[ \chi^2_{1-\alpha/2}(n-1) \le W \le \chi^2_{\alpha/2}(n-1) \]

と表せることを確認しました。

ここで、 この式に登場するカイ二乗の記号を、 もう一度整理しておきましょう。

カイ二乗の記号は「%点」を表している
\[ \chi^2_{\alpha/2}(n-1) \]
自由度 \(n-1\) のカイ二乗分布における、 上側 \(\alpha/2\) 点です。
つまり、この値より右側の確率が \(\alpha/2\) になります。
\[ \chi^2_{1-\alpha/2}(n-1) \]
自由度 \(n-1\) のカイ二乗分布における、 上側 \(1-\alpha/2\) 点です。
記号の \(n-1\) が2か所に出てくるので注意

最終的な信頼区間では、 \(n-1\) が複数回登場しますが、 意味は異なります。
分子の \(n-1\)
不偏分散 \[ \hat{\sigma}^2 = \frac{1}{n-1} \sum (X_i-\bar X)^2 \] から出てきた係数
\(\chi^2_{\alpha/2}(n-1)\) の中の \(n-1\)
カイ二乗分布の 自由度

では、 母分散 \(\sigma^2\) の区間を求めていきます。

\(W\) は

\[ W= \frac{(n-1)\hat{\sigma}^2}{\sigma^2} \]

でした。 これを先ほどの確率区間に代入します。

\[ \chi^2_{1-\alpha/2}(n-1) \le W \le \chi^2_{\alpha/2}(n-1) \]
↓ \(W\) を代入
\[ \chi^2_{1-\alpha/2}(n-1) \le \frac{(n-1)\hat{\sigma}^2}{\sigma^2} \le \chi^2_{\alpha/2}(n-1) \]
↓ \(\sigma^2\) について整理
\[ \frac{(n-1)\hat{\sigma}^2} {\chi^2_{\alpha/2}(n-1)} \le \sigma^2 \le \frac{(n-1)\hat{\sigma}^2} {\chi^2_{1-\alpha/2}(n-1)} \]

これが、 母分散 \(\sigma^2\) の \(1-\alpha\) 信頼区間 です。

最終式をパーツに分けて読む
分子
\[ (n-1)\hat{\sigma}^2 \]
標本から計算できる 偏差平方和
分母
\[ \chi^2_{\alpha/2}(n-1) \qquad \chi^2_{1-\alpha/2}(n-1) \]
自由度 \(n-1\) のカイ二乗分布から 付表で探す%点

ここで、 境界値の位置が入れ替わっている点にも注意しましょう。

なぜ%点の位置が入れ替わる?

\(W\) の区間では、 \[ \chi^2_{1-\alpha/2}(n-1) \le W \le \chi^2_{\alpha/2}(n-1) \] でした。 しかし、 \(\sigma^2\) について解くと、 カイ二乗分布の%点が 分母 に入ります。

大きい値で割るほど結果は小さくなり、 小さい値で割るほど結果は大きくなるため、 左右の%点の位置が入れ替わります。
ここがポイント
\(\chi^2_{\alpha/2}(n-1)\) などは、 自由度 \(n-1\) のカイ二乗分布の 「%点」を表す記号。
分子の \(n-1\) とは役割が異なるので、 式をパーツに分けて読む。
STEP 08

母分散の区間推定を3つの手順で整理する

手順1
ばらつきと関係する分布を考える
標準正規分布の二乗和 → カイ二乗分布
手順2
カイ二乗分布の付表が使える形へ
\[ \frac{(n-1)\hat{\sigma}^2}{\sigma^2} \sim \chi^2(n-1) \]
手順3
中央 \(1-\alpha\) の確率区間を作る
\[ \chi^2_{1-\alpha/2}(n-1) \le W \le \chi^2_{\alpha/2}(n-1) \]
\[ \frac{(n-1)\hat{\sigma}^2} {\chi^2_{\alpha/2}(n-1)} \le \sigma^2 \le \frac{(n-1)\hat{\sigma}^2} {\chi^2_{1-\alpha/2}(n-1)} \]

母分散の区間推定では、 公式をそのまま覚えるよりも、

「偏差平方和 → カイ二乗分布 → 確率区間 → \(\sigma^2\) について整理」

という流れで理解しておくと、 式の意味を追いやすくなります。

最後に
母分散の区間推定でも基本は3つの手順。
特に「なぜカイ二乗分布が出てくるのか」を、 偏差平方和から理解しておく。
SUMMARY

母分散の区間推定を整理する

推定対象
母集団のばらつき \(\sigma^2\)
手順1
偏差の二乗和と カイ二乗分布を結びつける
手順2
\[ \frac{(n-1)\hat{\sigma}^2}{\sigma^2} \sim \chi^2(n-1) \]
手順3
カイ二乗分布の 中央 \(1-\alpha\) の区間を考える
自由度
標本サイズ \(n\) に対して \(n-1\)
95%信頼区間なら
信頼係数
\[ 1-\alpha=0.95 \]
\[ \alpha=0.05 \]
↓ 左右に半分
\[ \frac{\alpha}{2}=0.025 \]
左側の境界
\[ \chi^2_{0.975}(n-1) \] 上側97.5%点
右側の境界
\[ \chi^2_{0.025}(n-1) \] 上側2.5%点
母分散の \(1-\alpha\) 信頼区間
\[ \frac{(n-1)\hat{\sigma}^2} {\chi^2_{\alpha/2}(n-1)} \le \sigma^2 \le \frac{(n-1)\hat{\sigma}^2} {\chi^2_{1-\alpha/2}(n-1)} \]
95%信頼区間の場合
\(\alpha=0.05\)、\(\alpha/2=0.025\) を代入する
\[ \frac{(n-1)\hat{\sigma}^2} {\chi^2_{0.025}(n-1)} \le \sigma^2 \le \frac{(n-1)\hat{\sigma}^2} {\chi^2_{0.975}(n-1)} \]
式の読み方
分子の \((n-1)\hat{\sigma}^2\) は 標本から計算する偏差平方和
分母の \(\chi^2_{0.025}(n-1)\)、 \(\chi^2_{0.975}(n-1)\) は、 自由度 \(n-1\) のカイ二乗分布の%点 です。
特に注意する3点
① カイ二乗分布の自由度は \(n-1\)
② カイ二乗分布は左右対称ではない
③ \(\sigma^2\) について解くと%点の位置が入れ替わる
最後に
母分散の区間推定は、
「偏差平方和 → カイ二乗分布 → 中央の確率区間 → \(\sigma^2\) について解く」 という流れで整理する。

95%信頼区間なら、 左右2.5%ずつを除き、 上側2.5%点と上側97.5%点を使う。
NEXT STEP

次のステップ:統計検定®2級を目指す

このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。

統計検定®2級対策講座【ベストセラー版】

約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。

約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ

記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。

統計学ベーシック講座を見る →