53
独立性の検定
独立性の検定では、2つの質的変数の間に関係があるのか、それとも互いに独立しているのかを、クロス集計表を用いて検証します。このレクチャーでは、周辺度数から期待度数を求め、観測度数とのズレをカイ二乗統計量で評価する流れを確認します。
このページのゴール
クロス集計表から期待度数を求め、独立性検定の流れを理解する。
STEP 01
独立性の検定では2つの質的変数の関係を見る
このレクチャーでは、
独立性の検定
を見ていきます。
独立性の検定では、
2つの質的変数について、
互いに関係があるのか、
それとも
関係がなく独立しているのか
を調べます。
2つの質的変数
↓
関係がない
= 独立
または
関係がある
= 連関がある
独立性の検定とは
2つの質的変数の間に、
何らかの連関があるかどうかを調べる検定です。
STEP 02
2つの質的変数をクロス集計表にまとめる
独立性の検定では、
2つの質的変数を
クロス集計表
にまとめます。
質的変数 \(A\) が
\(r\) 個の水準をもち、
質的変数 \(B\) が
\(c\) 個の水準をもつとします。
|
\(A \backslash B\)
|
\(B_1\)
|
\(B_2\)
|
\(\cdots\)
|
\(B_c\)
|
行和
|
|
\(A_1\)
|
\(O_{11}\) |
\(O_{12}\) |
\(\cdots\) |
\(O_{1c}\) |
\(O_{1\cdot}\) |
|
\(A_2\)
|
\(O_{21}\) |
\(O_{22}\) |
\(\cdots\) |
\(O_{2c}\) |
\(O_{2\cdot}\) |
|
\(\vdots\)
|
\(\vdots\) |
\(\vdots\) |
\(\ddots\) |
\(\vdots\) |
\(\vdots\) |
|
列和
|
\(O_{\cdot1}\) |
\(O_{\cdot2}\) |
\(\cdots\) |
\(O_{\cdot c}\) |
\(n\) |
表の内側に入っている
\(O_{ij}\)
が
観測度数
です。
また、
各行と各列の合計を
周辺度数
と呼びます。
STEP 03
性別と血液型の具体例で考える
ここからは、
具体例を使って考えてみましょう。
2つの質的変数として、
性別
と
血液型
を考えます。
100人を観測したところ、
次のようなクロス集計表になったとします。
|
性別 \ 血液型
|
A型
|
O型
|
B型
|
AB型
|
行和
|
|
男性
|
21 |
15 |
9 |
5 |
50 |
|
女性
|
19 |
15 |
11 |
5 |
50 |
|
列和
|
40 |
30 |
20 |
10 |
100 |
この表では、
行方向に性別、
列方向に血液型が並んでいます。
表の内側の数字が、
実際に観測された
観測度数
です。
STEP 04
独立なら、どんなクロス集計表になると期待されるか
独立性の検定では、
観測度数とは別に、
期待度数
を考えます。
期待度数とは、
2つの質的変数に
何ら連関がない
と仮定したときに、
各セルに期待される度数です。
性別と血液型には関係がない
↓
男性でも女性でも、
血液型の割合は同じと考える
↓
独立な場合に期待される度数を計算する
期待度数
「2つの質的変数が独立である」
と仮定した世界で期待されるセルの度数です。
STEP 05
期待度数は周辺度数だけを使って計算する
独立な場合の期待度数は、
観測度数の
周辺度数
から計算します。
行 \(i\)、列 \(j\) の期待度数を
\(E_{ij}\)
とすると、
\[
E_{ij}
=
n
\times
\frac{\text{行 }i\text{ の合計}}{n}
\times
\frac{\text{列 }j\text{ の合計}}{n}
\]
したがって、
次のようにも書けます。
\[
E_{ij}
=
\frac{
(\text{行 }i\text{ の合計})
(\text{列 }j\text{ の合計})
}{n}
\]
行の周辺度数の割合
×
列の周辺度数の割合
× \(n\)
期待度数 \(E_{ij}\)
STEP 06
男性かつA型の期待度数を計算する
具体的に、
「男性かつA型」のセルを考えてみましょう。
全体100人のうち、
男性は50人、
A型は40人です。
男性である割合
\[
\frac{50}{100}
\]
×
A型である割合
\[
\frac{40}{100}
\]
↓ 独立なら
男性かつA型である割合
\[
\frac{50}{100}
\times
\frac{40}{100}
=
0.2
\]
↓ ×100人
期待度数
\[
E_{11}=20
\]
式でまとめると、
\[
E_{11}
=
100
\times
\frac{50}{100}
\times
\frac{40}{100}
=
20
\]
STEP 07
すべてのセルについて期待度数を求める
同じ計算を、
すべてのセルについて行います。
|
性別 \ 血液型
|
A型
|
O型
|
B型
|
AB型
|
行和
|
|
男性
|
20 |
15 |
10 |
5 |
50 |
|
女性
|
20 |
15 |
10 |
5 |
50 |
|
列和
|
40 |
30 |
20 |
10 |
100 |
この表が、
性別と血液型が独立である場合に期待されるクロス集計表
です。
観測と期待
実際の観測度数と、
独立な場合に期待される度数を比較する準備ができました。
STEP 08
手順0:帰無仮説は「2つの変数は独立」
期待度数を求めることができたので、
ここから仮説検定の流れを整理していきましょう。
独立性の検定では、
まず
2つの質的変数は独立である
という帰無仮説を置きます。
\[
H_0:
P(A_i\cap B_j)
=
P(A_i)P(B_j)
\]
これは、
\(A_i\) であることと
\(B_j\) であることの間に
連関がない
という意味です。
一方、
対立仮説は、
\[
H_1:
A\text{ と }B\text{ は独立ではない}
\]
\(H_0\)
2つの質的変数は独立
VS
\(H_1\)
2つの質的変数には連関がある
帰無仮説の世界
「2つの質的変数には何ら関係がない」
という世界をまず仮定します。
STEP 09
手順1:観測と期待のズレはカイ二乗分布で評価する
帰無仮説が正しい、
つまり2つの質的変数が独立であるとき、
各セルでは観測度数
\(O_{ij}\)
が期待度数
\(E_{ij}\)
の周辺でばらつきます。
そこで、
各セルの
「観測度数と期待度数のズレ」を
次の形でまとめます。
\[
\sum_{i=1}^{r}
\sum_{j=1}^{c}
\frac{(O_{ij}-E_{ij})^2}{E_{ij}}
\]
標本サイズが十分に大きいとき、
この値は帰無仮説のもとで近似的に、
\[
\chi^2\bigl((r-1)(c-1)\bigr)
\]
というカイ二乗分布にしたがいます。
補足|なぜカイ二乗分布が登場するの?
ここでは厳密な証明ではなく、
カイ二乗分布が登場する流れだけを確認します。
① 観測と期待のズレを考える
\[
O_{ij}-E_{ij}
\]
↓
② 標本サイズが十分に大きければ
度数のズレは、
正規分布を用いて近似できる
↓
③ ズレを調整して二乗する
\[
\frac{(O_{ij}-E_{ij})^2}{E_{ij}}
\]
↓
④ すべてのセルについて合計する
\[
\sum_{i=1}^{r}
\sum_{j=1}^{c}
\frac{(O_{ij}-E_{ij})^2}{E_{ij}}
\]
がカイ二乗分布に近づく
ただし、
各セルの度数をすべて自由に決められるわけではありません。
行和と列和が決まっているため、
セルどうしには制約があります。
この制約によって、
自由度はセル数 \(rc\) ではなく、
\[
(r-1)(c-1)
\]
となります。
次のSTEPで、
この自由度について具体的に確認します。
手順1
帰無仮説のもとでは、
観測度数と期待度数のズレをまとめた値が、
近似的にカイ二乗分布にしたがいます。
STEP 10
自由度が \((r-1)(c-1)\) になる理由
手順1では、
\[
\chi^2
\sim
\chi^2\bigl((r-1)(c-1)\bigr)
\]
と整理しました。
では、
なぜ自由度はセルの数
\(rc\)
ではなく、
\((r-1)(c-1)\)
なのでしょうか。
\(df\) とは?
\(df\) は
degrees of freedom
の略で、
日本語では
自由度
を意味します。
性別×血液型の例では、
行数は
\(r=2\)、
列数は
\(c=4\)
です。
ただし、
行和と列和がすでに決まっているため、
8個のセルをすべて自由に決めることはできません。
左上の
\((r-1)\times(c-1)\)
個を決めれば、
残りは行和・列和から自動的に決まります。
性別×血液型の例では、
\[
df
=
(2-1)(4-1)
=
3
\]
自由度
\(r\times c\) 個のセルがあっても、
行和と列和という制約があるため、
自由度は
\((r-1)(c-1)\)
になります。
STEP 11
手順2:カイ二乗統計量を実際に計算する
手順1で、
観測度数と期待度数のズレをまとめた値が
カイ二乗分布にしたがうことを確認しました。
そこで、
実際の標本から次の検定統計量を計算します。
\[
\chi^2
=
\sum_{i=1}^{r}
\sum_{j=1}^{c}
\frac{(O_{ij}-E_{ij})^2}{E_{ij}}
\]
やっていることは、
直前に学んだ
適合度検定と同じ
です。
観測度数
\[
O_{ij}
\]
−
期待度数
\[
E_{ij}
\]
↓ 二乗して期待度数で割る
\[
\frac{(O_{ij}-E_{ij})^2}{E_{ij}}
\]
↓ 全セルで合計
カイ二乗統計量
計算上の注意
分母は
\(E_{ij}\)
です。
\(E_{ij}^2\)
ではありません。
STEP 12
具体的なセルについて計算してみる
性別×血液型の例で、
実際に計算してみましょう。
「男性かつA型」のセルでは、
観測度数が21人、
期待度数が20人でした。
\[
\frac{(21-20)^2}{20}
\]
一方、
「男性かつO型」のセルでは、
観測度数も期待度数も15人です。
\[
\frac{(15-15)^2}{15}
=
0
\]
このような計算を、
クロス集計表のすべてのセルについて行い、
最後に合計します。
観測度数と期待度数が近い
↓
そのセルの寄与は小さい
一方
観測度数と期待度数が大きくズレる
↓
そのセルの寄与は大きい
STEP 13
手順3:カイ二乗分布の上側を棄却域にする
最後に、
検定統計量の実現値を
カイ二乗分布と比較します。
観測度数と期待度数が近ければ、
カイ二乗統計量は小さくなります。
観測度数 ≈ 期待度数
↓
\(\chi^2\) は小さい
↓
「独立」という仮説と矛盾しにくい
一方、
観測度数と期待度数が大きくズレるほど、
カイ二乗統計量は大きくなります。
観測度数と期待度数が大きくズレる
↓
\(\chi^2\) が大きくなる
↓
「2つの変数は独立」
では説明しにくい
したがって、
独立性の検定では、
カイ二乗分布の
上側
を棄却域とします。
\[
P(\chi^2\geq\chi^2_{\mathrm{crit}})
=
0.05
\]
STEP 14
独立性の検定の流れを一本につなげる
観測度数のクロス集計表
↓ 周辺度数を確認
手順0
「2つの変数は独立」と仮定
↓
独立な場合の期待度数
\[
E_{ij}
=
\frac{(\text{行合計})(\text{列合計})}{n}
\]
↓
手順1
帰無仮説のもとで
\[
\chi^2((r-1)(c-1))
\]
にしたがう
↓
手順2
\[
\chi^2
=
\sum_{i=1}^{r}
\sum_{j=1}^{c}
\frac{(O_{ij}-E_{ij})^2}{E_{ij}}
\]
を計算
↓
手順3
上側棄却域に入るかを判断
STEP 15
適合度検定と独立性検定を整理する
最後に、
このセクションで学んだ
2つのカイ二乗検定を比較しておきましょう。
|
適合度検定
|
独立性検定
|
|
対象
|
1つの質的変数
|
2つの質的変数
|
|
何を調べる?
|
想定した分布に合うか
|
2変数が独立か
|
|
期待度数
|
想定した割合から計算
|
周辺度数から計算
|
|
検定統計量
|
\[
\sum
\frac{(O-E)^2}{E}
\]
|
\[
\sum\sum
\frac{(O-E)^2}{E}
\]
|
|
自由度
|
\(k-1\)
|
\((r-1)(c-1)\)
|
|
棄却域
|
上側
|
上側
|
期待度数の求め方と自由度は異なりますが、
検定の基本構造は共通しています。
帰無仮説のもとで期待度数を求める
↓
観測度数とのズレを二乗してまとめる
↓
カイ二乗分布の上側で判断する
共通点
適合度検定も独立性検定も、
「観測度数」と「期待度数」のズレを
カイ二乗統計量によって評価する検定です。
SUMMARY
独立性の検定を整理する
手順0|帰無仮説
\[
H_0:
P(A_i\cap B_j)
=
P(A_i)P(B_j)
\]
2つの質的変数は独立であり、
連関はないと仮定します。
期待度数
\[
E_{ij}
=
\frac{
(\text{行合計})
(\text{列合計})
}{n}
\]
独立であると仮定したときに
各セルに期待される度数を、
周辺度数から計算します。
手順1|分布
\[
\chi^2
\sim
\chi^2\bigl((r-1)(c-1)\bigr)
\]
観測度数と期待度数のズレをまとめた統計量は、
帰無仮説のもとで近似的に
カイ二乗分布にしたがいます。
手順2|検定統計量
\[
\chi^2
=
\sum_{i=1}^{r}
\sum_{j=1}^{c}
\frac{(O_{ij}-E_{ij})^2}{E_{ij}}
\]
観測度数と期待度数のズレを、
すべてのセルについて合計します。
手順3|判定
カイ二乗統計量が大きいほど、
「2つの質的変数は独立」という世界では
起こりにくい結果になります。
したがって、
カイ二乗分布の
上側
を棄却域とします。
特に重要な3点
① 帰無仮説は「2つの質的変数は独立」
② 期待度数は周辺度数から計算する
③ 観測度数と期待度数のズレをカイ二乗分布で評価する
最後に
独立性の検定では、
「2つの質的変数が独立なら期待される度数」と
「実際に観測された度数」を比較し、
そのズレが偶然の範囲で説明できるかを
カイ二乗分布によって判断します。
NEXT STEP
次のステップ:統計検定®2級を目指す
このサイトで統計学の基礎を学んだあと、
統計検定®2級の合格まで体系的に学びたい方へ。
統計検定®2級対策講座【ベストセラー版】
約9時間の動画講義と200問以上の小テストに加えて、
模擬試験にも取り組めます。
講座内ではQ&Aも利用でき、
これまでに400問以上の質問に回答してきました。
約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ
記述統計・確率・推定・検定を基礎から学ぶ
「統計学ベーシック講座その1『確率分布・推定・検定』」
も用意しています。
統計学ベーシック講座を見る →