スマホで統計学

52

適合度の検定

適合度検定では、あらかじめ想定されたカテゴリーごとの割合に対して、実際に観測された度数がどの程度一致しているかを検定します。このレクチャーでは、期待度数と観測度数の意味を整理し、カイ二乗統計量を用いた検定の流れを確認します。
このページのゴール

期待度数と観測度数の違いから、適合度検定の仕組みを理解する。

STEP 01

適合度検定では「期待」と「観測」の一致度を見る

このレクチャーでは、 適合度の検定 を見ていきます。

英語では goodness of fit と呼ばれ、 「どれくらいうまく当てはまっているか」 を検定する方法です。

では、 何と何がうまく当てはまっているかを見るのでしょうか。

あらかじめ期待される度数
期待度数
実際の標本で観測された度数
観測度数
どのくらい一致しているかを調べる
適合度検定とは
期待度数に対して、 実際の観測度数がどれくらい fitしているかを見る検定です。
STEP 02

血液型を例に期待度数と観測度数を考える

まずは具体例から考えてみましょう。

質的変数として 血液型 を考えます。

血液型には、 A型・O型・B型・AB型という 4つの水準があります。

ここで、 母集団では次のような割合になると あらかじめ想定されているとします。

血液型 A型 O型 B型 AB型
期待割合 40% 30% 20% 10%

標本サイズが \(n=100\) 人なら、 この割合から期待される人数は、

A型:\(100\times0.4=40\) 人
O型:\(100\times0.3=30\) 人
B型:\(100\times0.2=20\) 人
AB型:\(100\times0.1=10\) 人

これが 期待度数 です。

STEP 03

実際に集計した人数が観測度数

これに対して、 実際に100人を観測したところ、 次のような結果だったとします。

血液型 A型 O型 B型 AB型
期待度数 40 30 20 10
観測度数 42 30 18 10

このとき、 期待していた人数と、 実際に観測した人数には 少しズレがあります。

期待度数
40・30・20・10
VS
観測度数
42・30・18・10
適合度検定の関心
このズレが、 標本抽出による偶然の範囲なのか、 それとも無視できないほど大きいのかを調べます。
STEP 04

一般には \(A_i\)、\(O_i\)、\(E_i\) と表す

ここで、 一般的な記号も整理しておきましょう。

質的変数の水準が \(k\) 個あるとします。

水準 \(A_1\) \(A_2\) \(\cdots\) \(A_k\) 合計
観測度数 \(O_1\) \(O_2\) \(\cdots\) \(O_k\) \(n\)
期待度数 \(E_1\) \(E_2\) \(\cdots\) \(E_k\) \(n\)
\[ \sum_{i=1}^{k}O_i=n \qquad \sum_{i=1}^{k}E_i=n \]

観測度数も期待度数も、 すべての水準について合計すると 標本サイズ \(n\) になります。

STEP 05

手順0:帰無仮説として期待する割合を設定する

適合度検定では、 各水準となる確率が、 あらかじめ想定した値に等しいという 帰無仮説を置きます。

\[ H_0: P(A_i)=p_i \qquad (i=1,\ldots,k) \]

この帰無仮説のもとでは、 水準 \(A_i\) の期待度数は、

\[ E_i=np_i \]

となります。

想定している確率 \[ p_i \]
↓ × 標本サイズ \(n\)
期待度数 \[ E_i=np_i \]
STEP 06

血液型の例では何を帰無仮説にしているのか

血液型の例では、 次の割合が正しいと仮定しています。

\[ H_0: (p_A,p_O,p_B,p_{AB}) = (0.4,0.3,0.2,0.1) \]

標本サイズが100人なら、 この帰無仮説から、

\[ (E_A,E_O,E_B,E_{AB}) = (40,30,20,10) \]

という期待度数が得られます。

帰無仮説の世界
「期待している割合が正しい」 という世界をまず仮定し、 その世界では実際の観測結果が どれくらい珍しいかを調べます。
STEP 07

手順2:観測度数と期待度数のズレを数値化する

適合度検定では、 観測度数と期待度数のズレを 次の検定統計量で表します。

\[ \chi^2 = \sum_{i=1}^{k} \frac{(O_i-E_i)^2}{E_i} \]

この式は、 ただ暗記するよりも、 何をしている式なのかを分解して見ると理解しやすくなります。

観測度数 − 期待度数 \[ O_i-E_i \] ズレを求める
↓ 二乗
\[ (O_i-E_i)^2 \] ズレの大きさとして評価する
↓ 期待度数で割る
\[ \frac{(O_i-E_i)^2}{E_i} \] 期待度数の大きさを考慮して調整する
↓ 全水準について合計
\[ \chi^2 = \sum_{i=1}^{k} \frac{(O_i-E_i)^2}{E_i} \]
STEP 08

血液型の例でカイ二乗統計量を計算する

先ほどの血液型の例を 実際に式へ代入してみましょう。

\[ \chi^2 = \frac{(42-40)^2}{40} + \frac{(30-30)^2}{30} + \frac{(18-20)^2}{20} + \frac{(10-10)^2}{10} \]

それぞれの項を計算すると、

\[ \chi^2 = 0.1+0+0.2+0 = 0.3 \]

となります。

この例では、 観測度数が期待度数にかなり近いため、 カイ二乗統計量も 小さな値 になっています。
STEP 09

この統計量はカイ二乗分布で評価する

帰無仮説が正しく、 標本サイズが十分に大きいとき、 検定統計量

\[ \chi^2 = \sum_{i=1}^{k} \frac{(O_i-E_i)^2}{E_i} \]

は、 近似的にカイ二乗分布にしたがいます。

\[ \chi^2 \sim \chi^2(k-1) \]

観測度数には、 標本抽出による偶然のばらつきがあります。

そのズレを 期待度数の大きさを考慮しながら調整し、 二乗して合計したものを、 カイ二乗分布によって評価するという考え方です。

近似を使うための注意

カイ二乗分布による近似を使うためには、 各カテゴリーの期待度数が 極端に小さくないことが前提になります。
STEP 10

自由度が \(k-1\) になる理由

適合度検定では、 水準が \(k\) 個あっても、 自由度は \(k\) ではありません。

\[ df=k-1 \]
\(df\) とは?

\(df\) は degrees of freedom の略で、 日本語では 自由度 を意味します。

統計学では、 自由度を \(df\) と表記することがあります。

では、 なぜ適合度検定の自由度が \(k-1\) になるのでしょうか。

理由は、 観測度数の合計が 標本サイズ \(n\) に固定されているからです。

血液型の例で確認してみましょう。

A型
42
O型
30
B型
18
AB型
?
合計は100人
\[ 100-42-30-18=10 \]

このように、 最初の3つの度数が決まれば、 最後の1つは自動的に決まります。

つまり、 4つの値をすべて自由に決められるわけではなく、 自由に決められるのは3つだけです。

\[ df = 4-1 = 3 \]

一般に、 水準が \(k\) 個あるときには、 最後の1つが合計から自動的に決まるため、

\[ df=k-1 \]
自由度
\(k\) 個の度数のうち、 自由に決められるのは \(k-1\) 個です。
STEP 11

手順3:カイ二乗分布の上側を棄却域にする

カイ二乗統計量は、 観測度数と期待度数のズレが大きいほど 大きな値になります。

\(O_i\) と \(E_i\) が近い
\(\chi^2\) は小さい
期待した分布とよく合っている

一方で、

\(O_i\) と \(E_i\) が大きくズレる
\(\chi^2\) が大きくなる
帰無仮説では起こりにくい

そのため、 有意水準を5%とするなら、 カイ二乗分布の 上側5% を棄却域とします。

\[ P(\chi^2 \ge \chi^2_{\mathrm{crit}}) = 0.05 \]
STEP 12

適合度検定の流れを一本につなげる

想定している割合 \[ p_i \]
↓ × \(n\)
期待度数 \[ E_i=np_i \]
VS
実際の観測度数 \[ O_i \]
↓ ズレを数値化
\[ \chi^2 = \sum_{i=1}^{k} \frac{(O_i-E_i)^2}{E_i} \]
\[ \chi^2(k-1) \] と比較
上側棄却域に入るか判断
SUMMARY

適合度検定を整理する

何を調べる検定か
あらかじめ期待される度数に対して、 実際の観測度数がどの程度一致しているかを調べます。
期待度数
\[ E_i=np_i \]
想定する確率 \(p_i\) に 標本サイズ \(n\) を掛けて求めます。
カイ二乗統計量
\[ \chi^2 = \sum_{i=1}^{k} \frac{(O_i-E_i)^2}{E_i} \]
観測度数と期待度数のズレを、 期待度数の大きさを考慮しながらまとめた統計量です。
分布と自由度
\[ \chi^2 \sim \chi^2(k-1) \]
水準が \(k\) 個なら、 合計度数が固定されているため、 自由度は \(k-1\) です。
特に重要な3点
① 期待割合から期待度数を求める
② 観測度数とのズレをカイ二乗統計量にまとめる
③ 統計量が大きいほど期待した分布から大きくズレている
最後に
適合度検定は、

「期待していた分布」と 「実際に観測された分布」のズレが、 偶然の範囲で説明できるかを判断する検定です。
NEXT STEP

次のステップ:統計検定®2級を目指す

このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。

統計検定®2級対策講座【ベストセラー版】

約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。

約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ

記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。

統計学ベーシック講座を見る →