52
適合度の検定
適合度検定では、あらかじめ想定されたカテゴリーごとの割合に対して、実際に観測された度数がどの程度一致しているかを検定します。このレクチャーでは、期待度数と観測度数の意味を整理し、カイ二乗統計量を用いた検定の流れを確認します。
このページのゴール
期待度数と観測度数の違いから、適合度検定の仕組みを理解する。
STEP 01
適合度検定では「期待」と「観測」の一致度を見る
このレクチャーでは、
適合度の検定
を見ていきます。
英語では
goodness of fit
と呼ばれ、
「どれくらいうまく当てはまっているか」
を検定する方法です。
では、
何と何がうまく当てはまっているかを見るのでしょうか。
あらかじめ期待される度数
期待度数
と
実際の標本で観測された度数
観測度数
↓
どのくらい一致しているかを調べる
適合度検定とは
期待度数に対して、
実際の観測度数がどれくらい
fitしているかを見る検定です。
STEP 02
血液型を例に期待度数と観測度数を考える
まずは具体例から考えてみましょう。
質的変数として
血液型
を考えます。
血液型には、
A型・O型・B型・AB型という
4つの水準があります。
ここで、
母集団では次のような割合になると
あらかじめ想定されているとします。
|
血液型
|
A型
|
O型
|
B型
|
AB型
|
|
期待割合
|
40% |
30% |
20% |
10% |
標本サイズが
\(n=100\)
人なら、
この割合から期待される人数は、
A型:\(100\times0.4=40\) 人
O型:\(100\times0.3=30\) 人
B型:\(100\times0.2=20\) 人
AB型:\(100\times0.1=10\) 人
これが
期待度数
です。
STEP 03
実際に集計した人数が観測度数
これに対して、
実際に100人を観測したところ、
次のような結果だったとします。
|
血液型
|
A型
|
O型
|
B型
|
AB型
|
|
期待度数
|
40 |
30 |
20 |
10 |
|
観測度数
|
42 |
30 |
18 |
10 |
このとき、
期待していた人数と、
実際に観測した人数には
少しズレがあります。
期待度数
40・30・20・10
VS
観測度数
42・30・18・10
適合度検定の関心
このズレが、
標本抽出による偶然の範囲なのか、
それとも無視できないほど大きいのかを調べます。
STEP 04
一般には \(A_i\)、\(O_i\)、\(E_i\) と表す
ここで、
一般的な記号も整理しておきましょう。
質的変数の水準が
\(k\) 個あるとします。
|
水準
|
\(A_1\)
|
\(A_2\)
|
\(\cdots\)
|
\(A_k\)
|
合計
|
|
観測度数
|
\(O_1\) |
\(O_2\) |
\(\cdots\) |
\(O_k\) |
\(n\) |
|
期待度数
|
\(E_1\) |
\(E_2\) |
\(\cdots\) |
\(E_k\) |
\(n\) |
\[
\sum_{i=1}^{k}O_i=n
\qquad
\sum_{i=1}^{k}E_i=n
\]
観測度数も期待度数も、
すべての水準について合計すると
標本サイズ \(n\) になります。
STEP 05
手順0:帰無仮説として期待する割合を設定する
適合度検定では、
各水準となる確率が、
あらかじめ想定した値に等しいという
帰無仮説を置きます。
\[
H_0:
P(A_i)=p_i
\qquad
(i=1,\ldots,k)
\]
この帰無仮説のもとでは、
水準 \(A_i\) の期待度数は、
\[
E_i=np_i
\]
となります。
想定している確率
\[
p_i
\]
↓ × 標本サイズ \(n\)
期待度数
\[
E_i=np_i
\]
STEP 06
血液型の例では何を帰無仮説にしているのか
血液型の例では、
次の割合が正しいと仮定しています。
\[
H_0:
(p_A,p_O,p_B,p_{AB})
=
(0.4,0.3,0.2,0.1)
\]
標本サイズが100人なら、
この帰無仮説から、
\[
(E_A,E_O,E_B,E_{AB})
=
(40,30,20,10)
\]
という期待度数が得られます。
帰無仮説の世界
「期待している割合が正しい」
という世界をまず仮定し、
その世界では実際の観測結果が
どれくらい珍しいかを調べます。
STEP 07
手順2:観測度数と期待度数のズレを数値化する
適合度検定では、
観測度数と期待度数のズレを
次の検定統計量で表します。
\[
\chi^2
=
\sum_{i=1}^{k}
\frac{(O_i-E_i)^2}{E_i}
\]
この式は、
ただ暗記するよりも、
何をしている式なのかを分解して見ると理解しやすくなります。
観測度数 − 期待度数
\[
O_i-E_i
\]
ズレを求める
↓ 二乗
\[
(O_i-E_i)^2
\]
ズレの大きさとして評価する
↓ 期待度数で割る
\[
\frac{(O_i-E_i)^2}{E_i}
\]
期待度数の大きさを考慮して調整する
↓ 全水準について合計
\[
\chi^2
=
\sum_{i=1}^{k}
\frac{(O_i-E_i)^2}{E_i}
\]
STEP 08
血液型の例でカイ二乗統計量を計算する
先ほどの血液型の例を
実際に式へ代入してみましょう。
\[
\chi^2
=
\frac{(42-40)^2}{40}
+
\frac{(30-30)^2}{30}
+
\frac{(18-20)^2}{20}
+
\frac{(10-10)^2}{10}
\]
それぞれの項を計算すると、
\[
\chi^2
=
0.1+0+0.2+0
=
0.3
\]
となります。
この例では、
観測度数が期待度数にかなり近いため、
カイ二乗統計量も
小さな値
になっています。
STEP 09
この統計量はカイ二乗分布で評価する
帰無仮説が正しく、
標本サイズが十分に大きいとき、
検定統計量
\[
\chi^2
=
\sum_{i=1}^{k}
\frac{(O_i-E_i)^2}{E_i}
\]
は、
近似的にカイ二乗分布にしたがいます。
\[
\chi^2
\sim
\chi^2(k-1)
\]
観測度数には、
標本抽出による偶然のばらつきがあります。
そのズレを
期待度数の大きさを考慮しながら調整し、
二乗して合計したものを、
カイ二乗分布によって評価するという考え方です。
近似を使うための注意
カイ二乗分布による近似を使うためには、
各カテゴリーの期待度数が
極端に小さくないことが前提になります。
STEP 10
自由度が \(k-1\) になる理由
適合度検定では、
水準が \(k\) 個あっても、
自由度は \(k\) ではありません。
\[
df=k-1
\]
\(df\) とは?
\(df\) は
degrees of freedom
の略で、
日本語では
自由度
を意味します。
統計学では、
自由度を
\(df\)
と表記することがあります。
では、
なぜ適合度検定の自由度が
\(k-1\)
になるのでしょうか。
理由は、
観測度数の合計が
標本サイズ \(n\) に固定されているからです。
血液型の例で確認してみましょう。
合計は100人
\[
100-42-30-18=10
\]
このように、
最初の3つの度数が決まれば、
最後の1つは自動的に決まります。
つまり、
4つの値をすべて自由に決められるわけではなく、
自由に決められるのは3つだけです。
\[
df
=
4-1
=
3
\]
一般に、
水準が \(k\) 個あるときには、
最後の1つが合計から自動的に決まるため、
\[
df=k-1
\]
自由度
\(k\) 個の度数のうち、
自由に決められるのは
\(k-1\) 個です。
STEP 11
手順3:カイ二乗分布の上側を棄却域にする
カイ二乗統計量は、
観測度数と期待度数のズレが大きいほど
大きな値になります。
\(O_i\) と \(E_i\) が近い
↓
\(\chi^2\) は小さい
↓
期待した分布とよく合っている
一方で、
\(O_i\) と \(E_i\) が大きくズレる
↓
\(\chi^2\) が大きくなる
↓
帰無仮説では起こりにくい
そのため、
有意水準を5%とするなら、
カイ二乗分布の
上側5%
を棄却域とします。
\[
P(\chi^2 \ge \chi^2_{\mathrm{crit}})
=
0.05
\]
STEP 12
適合度検定の流れを一本につなげる
想定している割合
\[
p_i
\]
↓ × \(n\)
期待度数
\[
E_i=np_i
\]
VS
実際の観測度数
\[
O_i
\]
↓ ズレを数値化
\[
\chi^2
=
\sum_{i=1}^{k}
\frac{(O_i-E_i)^2}{E_i}
\]
↓
\[
\chi^2(k-1)
\]
と比較
↓
上側棄却域に入るか判断
SUMMARY
適合度検定を整理する
何を調べる検定か
あらかじめ期待される度数に対して、
実際の観測度数がどの程度一致しているかを調べます。
期待度数
\[
E_i=np_i
\]
想定する確率 \(p_i\) に
標本サイズ \(n\) を掛けて求めます。
カイ二乗統計量
\[
\chi^2
=
\sum_{i=1}^{k}
\frac{(O_i-E_i)^2}{E_i}
\]
観測度数と期待度数のズレを、
期待度数の大きさを考慮しながらまとめた統計量です。
分布と自由度
\[
\chi^2
\sim
\chi^2(k-1)
\]
水準が \(k\) 個なら、
合計度数が固定されているため、
自由度は \(k-1\) です。
特に重要な3点
① 期待割合から期待度数を求める
② 観測度数とのズレをカイ二乗統計量にまとめる
③ 統計量が大きいほど期待した分布から大きくズレている
最後に
適合度検定は、
「期待していた分布」と
「実際に観測された分布」のズレが、
偶然の範囲で説明できるかを判断する検定です。
NEXT STEP
次のステップ:統計検定®2級を目指す
このサイトで統計学の基礎を学んだあと、
統計検定®2級の合格まで体系的に学びたい方へ。
統計検定®2級対策講座【ベストセラー版】
約9時間の動画講義と200問以上の小テストに加えて、
模擬試験にも取り組めます。
講座内ではQ&Aも利用でき、
これまでに400問以上の質問に回答してきました。
約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ
記述統計・確率・推定・検定を基礎から学ぶ
「統計学ベーシック講座その1『確率分布・推定・検定』」
も用意しています。
統計学ベーシック講座を見る →