スマホで統計学

53

独立性の検定

独立性の検定では、2つの質的変数の間に関係があるのか、それとも互いに独立しているのかを、クロス集計表を用いて検証します。このレクチャーでは、周辺度数から期待度数を求め、観測度数とのズレをカイ二乗統計量で評価する流れを確認します。
このページのゴール

クロス集計表から期待度数を求め、独立性検定の流れを理解する。

STEP 01

独立性の検定では2つの質的変数の関係を見る

このレクチャーでは、 独立性の検定 を見ていきます。

独立性の検定では、 2つの質的変数について、 互いに関係があるのか、 それとも 関係がなく独立しているのか を調べます。

2つの質的変数
関係がない
= 独立
または
関係がある
= 連関がある
独立性の検定とは
2つの質的変数の間に、 何らかの連関があるかどうかを調べる検定です。
STEP 02

2つの質的変数をクロス集計表にまとめる

独立性の検定では、 2つの質的変数を クロス集計表 にまとめます。

質的変数 \(A\) が \(r\) 個の水準をもち、 質的変数 \(B\) が \(c\) 個の水準をもつとします。

\(A \backslash B\) \(B_1\) \(B_2\) \(\cdots\) \(B_c\) 行和
\(A_1\) \(O_{11}\) \(O_{12}\) \(\cdots\) \(O_{1c}\) \(O_{1\cdot}\)
\(A_2\) \(O_{21}\) \(O_{22}\) \(\cdots\) \(O_{2c}\) \(O_{2\cdot}\)
\(\vdots\) \(\vdots\) \(\vdots\) \(\ddots\) \(\vdots\) \(\vdots\)
列和 \(O_{\cdot1}\) \(O_{\cdot2}\) \(\cdots\) \(O_{\cdot c}\) \(n\)

表の内側に入っている \(O_{ij}\) が 観測度数 です。

また、 各行と各列の合計を 周辺度数 と呼びます。

STEP 03

性別と血液型の具体例で考える

ここからは、 具体例を使って考えてみましょう。

2つの質的変数として、 性別血液型 を考えます。

100人を観測したところ、 次のようなクロス集計表になったとします。

性別 \ 血液型 A型 O型 B型 AB型 行和
男性 21 15 9 5 50
女性 19 15 11 5 50
列和 40 30 20 10 100

この表では、 行方向に性別、 列方向に血液型が並んでいます。

表の内側の数字が、 実際に観測された 観測度数 です。

STEP 04

独立なら、どんなクロス集計表になると期待されるか

独立性の検定では、 観測度数とは別に、 期待度数 を考えます。

期待度数とは、 2つの質的変数に 何ら連関がない と仮定したときに、 各セルに期待される度数です。

性別と血液型には関係がない
男性でも女性でも、 血液型の割合は同じと考える
独立な場合に期待される度数を計算する
期待度数
「2つの質的変数が独立である」 と仮定した世界で期待されるセルの度数です。
STEP 05

期待度数は周辺度数だけを使って計算する

独立な場合の期待度数は、 観測度数の 周辺度数 から計算します。

行 \(i\)、列 \(j\) の期待度数を \(E_{ij}\) とすると、

\[ E_{ij} = n \times \frac{\text{行 }i\text{ の合計}}{n} \times \frac{\text{列 }j\text{ の合計}}{n} \]

したがって、 次のようにも書けます。

\[ E_{ij} = \frac{ (\text{行 }i\text{ の合計}) (\text{列 }j\text{ の合計}) }{n} \]
行の周辺度数の割合
×
列の周辺度数の割合
× \(n\)
期待度数 \(E_{ij}\)
STEP 06

男性かつA型の期待度数を計算する

具体的に、 「男性かつA型」のセルを考えてみましょう。

全体100人のうち、 男性は50人、 A型は40人です。

男性である割合 \[ \frac{50}{100} \]
×
A型である割合 \[ \frac{40}{100} \]
↓ 独立なら
男性かつA型である割合 \[ \frac{50}{100} \times \frac{40}{100} = 0.2 \]
↓ ×100人
期待度数 \[ E_{11}=20 \]

式でまとめると、

\[ E_{11} = 100 \times \frac{50}{100} \times \frac{40}{100} = 20 \]
STEP 07

すべてのセルについて期待度数を求める

同じ計算を、 すべてのセルについて行います。

性別 \ 血液型 A型 O型 B型 AB型 行和
男性 20 15 10 5 50
女性 20 15 10 5 50
列和 40 30 20 10 100

この表が、 性別と血液型が独立である場合に期待されるクロス集計表 です。

観測と期待
実際の観測度数と、 独立な場合に期待される度数を比較する準備ができました。
STEP 08

手順0:帰無仮説は「2つの変数は独立」

期待度数を求めることができたので、 ここから仮説検定の流れを整理していきましょう。

独立性の検定では、 まず 2つの質的変数は独立である という帰無仮説を置きます。

\[ H_0: P(A_i\cap B_j) = P(A_i)P(B_j) \]

これは、 \(A_i\) であることと \(B_j\) であることの間に 連関がない という意味です。

一方、 対立仮説は、

\[ H_1: A\text{ と }B\text{ は独立ではない} \]
\(H_0\)
2つの質的変数は独立
VS
\(H_1\)
2つの質的変数には連関がある
帰無仮説の世界
「2つの質的変数には何ら関係がない」 という世界をまず仮定します。
STEP 09

手順1:観測と期待のズレはカイ二乗分布で評価する

帰無仮説が正しい、 つまり2つの質的変数が独立であるとき、 各セルでは観測度数 \(O_{ij}\) が期待度数 \(E_{ij}\) の周辺でばらつきます。

そこで、 各セルの 「観測度数と期待度数のズレ」を 次の形でまとめます。

\[ \sum_{i=1}^{r} \sum_{j=1}^{c} \frac{(O_{ij}-E_{ij})^2}{E_{ij}} \]

標本サイズが十分に大きいとき、 この値は帰無仮説のもとで近似的に、

\[ \chi^2\bigl((r-1)(c-1)\bigr) \]

というカイ二乗分布にしたがいます。

補足|なぜカイ二乗分布が登場するの?

ここでは厳密な証明ではなく、 カイ二乗分布が登場する流れだけを確認します。

① 観測と期待のズレを考える \[ O_{ij}-E_{ij} \]
② 標本サイズが十分に大きければ

度数のズレは、 正規分布を用いて近似できる
③ ズレを調整して二乗する \[ \frac{(O_{ij}-E_{ij})^2}{E_{ij}} \]
④ すべてのセルについて合計する \[ \sum_{i=1}^{r} \sum_{j=1}^{c} \frac{(O_{ij}-E_{ij})^2}{E_{ij}} \] がカイ二乗分布に近づく

ただし、 各セルの度数をすべて自由に決められるわけではありません。 行和と列和が決まっているため、 セルどうしには制約があります。

この制約によって、 自由度はセル数 \(rc\) ではなく、

\[ (r-1)(c-1) \]

となります。 次のSTEPで、 この自由度について具体的に確認します。

手順1
帰無仮説のもとでは、 観測度数と期待度数のズレをまとめた値が、 近似的にカイ二乗分布にしたがいます。
STEP 10

自由度が \((r-1)(c-1)\) になる理由

手順1では、

\[ \chi^2 \sim \chi^2\bigl((r-1)(c-1)\bigr) \]

と整理しました。

では、 なぜ自由度はセルの数 \(rc\) ではなく、 \((r-1)(c-1)\) なのでしょうか。

\(df\) とは?

\(df\) は degrees of freedom の略で、 日本語では 自由度 を意味します。

性別×血液型の例では、 行数は \(r=2\)、 列数は \(c=4\) です。

ただし、 行和と列和がすでに決まっているため、 8個のセルをすべて自由に決めることはできません。

自由
自由
自由
自動
自動
自動
自動
自動
左上の \((r-1)\times(c-1)\) 個を決めれば、
残りは行和・列和から自動的に決まります。

性別×血液型の例では、

\[ df = (2-1)(4-1) = 3 \]
自由度
\(r\times c\) 個のセルがあっても、 行和と列和という制約があるため、 自由度は \((r-1)(c-1)\) になります。
STEP 11

手順2:カイ二乗統計量を実際に計算する

手順1で、 観測度数と期待度数のズレをまとめた値が カイ二乗分布にしたがうことを確認しました。

そこで、 実際の標本から次の検定統計量を計算します。

\[ \chi^2 = \sum_{i=1}^{r} \sum_{j=1}^{c} \frac{(O_{ij}-E_{ij})^2}{E_{ij}} \]

やっていることは、 直前に学んだ 適合度検定と同じ です。

観測度数 \[ O_{ij} \]
期待度数 \[ E_{ij} \]
↓ 二乗して期待度数で割る
\[ \frac{(O_{ij}-E_{ij})^2}{E_{ij}} \]
↓ 全セルで合計
カイ二乗統計量
計算上の注意

分母は \(E_{ij}\) です。
\(E_{ij}^2\) ではありません。
STEP 12

具体的なセルについて計算してみる

性別×血液型の例で、 実際に計算してみましょう。

「男性かつA型」のセルでは、 観測度数が21人、 期待度数が20人でした。

\[ \frac{(21-20)^2}{20} \]

一方、 「男性かつO型」のセルでは、 観測度数も期待度数も15人です。

\[ \frac{(15-15)^2}{15} = 0 \]

このような計算を、 クロス集計表のすべてのセルについて行い、 最後に合計します。

観測度数と期待度数が近い
そのセルの寄与は小さい
一方
観測度数と期待度数が大きくズレる
そのセルの寄与は大きい
STEP 13

手順3:カイ二乗分布の上側を棄却域にする

最後に、 検定統計量の実現値を カイ二乗分布と比較します。

観測度数と期待度数が近ければ、 カイ二乗統計量は小さくなります。

観測度数 ≈ 期待度数
\(\chi^2\) は小さい
「独立」という仮説と矛盾しにくい

一方、 観測度数と期待度数が大きくズレるほど、 カイ二乗統計量は大きくなります。

観測度数と期待度数が大きくズレる
\(\chi^2\) が大きくなる
「2つの変数は独立」 では説明しにくい

したがって、 独立性の検定では、 カイ二乗分布の 上側 を棄却域とします。

\[ P(\chi^2\geq\chi^2_{\mathrm{crit}}) = 0.05 \]
STEP 14

独立性の検定の流れを一本につなげる

観測度数のクロス集計表
↓ 周辺度数を確認
手順0
「2つの変数は独立」と仮定
独立な場合の期待度数 \[ E_{ij} = \frac{(\text{行合計})(\text{列合計})}{n} \]
手順1
帰無仮説のもとで \[ \chi^2((r-1)(c-1)) \] にしたがう
手順2 \[ \chi^2 = \sum_{i=1}^{r} \sum_{j=1}^{c} \frac{(O_{ij}-E_{ij})^2}{E_{ij}} \] を計算
手順3
上側棄却域に入るかを判断
STEP 15

適合度検定と独立性検定を整理する

最後に、 このセクションで学んだ 2つのカイ二乗検定を比較しておきましょう。

適合度検定 独立性検定
対象 1つの質的変数 2つの質的変数
何を調べる? 想定した分布に合うか 2変数が独立か
期待度数 想定した割合から計算 周辺度数から計算
検定統計量 \[ \sum \frac{(O-E)^2}{E} \] \[ \sum\sum \frac{(O-E)^2}{E} \]
自由度 \(k-1\) \((r-1)(c-1)\)
棄却域 上側 上側

期待度数の求め方と自由度は異なりますが、 検定の基本構造は共通しています。

帰無仮説のもとで期待度数を求める
観測度数とのズレを二乗してまとめる
カイ二乗分布の上側で判断する
共通点
適合度検定も独立性検定も、 「観測度数」と「期待度数」のズレを カイ二乗統計量によって評価する検定です。
SUMMARY

独立性の検定を整理する

手順0|帰無仮説
\[ H_0: P(A_i\cap B_j) = P(A_i)P(B_j) \]
2つの質的変数は独立であり、 連関はないと仮定します。
期待度数
\[ E_{ij} = \frac{ (\text{行合計}) (\text{列合計}) }{n} \]
独立であると仮定したときに 各セルに期待される度数を、 周辺度数から計算します。
手順1|分布
\[ \chi^2 \sim \chi^2\bigl((r-1)(c-1)\bigr) \]
観測度数と期待度数のズレをまとめた統計量は、 帰無仮説のもとで近似的に カイ二乗分布にしたがいます。
手順2|検定統計量
\[ \chi^2 = \sum_{i=1}^{r} \sum_{j=1}^{c} \frac{(O_{ij}-E_{ij})^2}{E_{ij}} \]
観測度数と期待度数のズレを、 すべてのセルについて合計します。
手順3|判定
カイ二乗統計量が大きいほど、 「2つの質的変数は独立」という世界では 起こりにくい結果になります。

したがって、 カイ二乗分布の 上側 を棄却域とします。
特に重要な3点
① 帰無仮説は「2つの質的変数は独立」
② 期待度数は周辺度数から計算する
③ 観測度数と期待度数のズレをカイ二乗分布で評価する
最後に
独立性の検定では、

「2つの質的変数が独立なら期待される度数」と 「実際に観測された度数」を比較し、

そのズレが偶然の範囲で説明できるかを カイ二乗分布によって判断します。
← 前の講義 次の講義 →
NEXT STEP

次のステップ:統計検定®2級を目指す

このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。

統計検定®2級対策講座【ベストセラー版】

約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。

約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ

記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。

統計学ベーシック講座を見る →