スマホで統計学

44

母比率の差の仮説検定

互いに独立な2つの母集団から得られた2標本を使って、2つの母比率に差があるかどうかを検定します。大標本における正規近似を利用し、帰無仮説 \(p_1=p_2\) のもとで検定統計量を構成して、棄却域との比較から判断します。
このページのゴール

2つの母比率について帰無仮説を設定し、標本比率の差の近似分布を整理したうえで、プールした標本比率を使ったz検定統計量を求め、帰無仮説を棄却するか判断できるようになる。

STEP 01

2つの母集団の母比率に差があるかを検定する

このレクチャーでは、 2標本問題の仮説検定の最後として、 母比率の差の仮説検定 を見ていきます。

たとえば、 2つの地域について 内閣支持率に差があるかどうかを考えるような場面です。

2つの地域の支持率を比較
地域1
母比率 \[ p_1 \]
地域2
母比率 \[ p_2 \]

今回は、 「2つの母比率に差がない」と仮定したときに、 実際の標本比率の差が めったに起こらないほど大きな差かどうか を検証します。

前提
2つの標本は互いに独立であり、 正規近似を使うため、 それぞれのサンプルサイズが十分に大きい 場合を扱います。
今回のテーマ
2つの母比率に差がないという世界を仮定して、 観測された標本比率の差がどれほど極端かを見る。
STEP 02

手順0:2つの母比率が等しいという帰無仮説を立てる

仮説検定なので、 まず帰無仮説と対立仮説を設定します。

帰無仮説
\[ H_0:p_1=p_2 \]
対立仮説
\[ H_1:p_1\neq p_2 \]

今回は、 どちらの母比率が大きいか方向を限定しない 両側検定 とします。

帰無仮説のもとでは、 2つの母比率は同じなので、 共通の母比率を \(p\) と書けば、

\[ p_1=p_2=p \]
手順0
帰無仮説の世界では、 2つの母集団は同じ成功確率 \(p\) をもつと考える。
STEP 03

手順1:2つの成功回数は二項分布にしたがう

まず、 それぞれの母集団は 0か1かの結果からなると考えます。

内閣支持率なら、 1を「支持する」、 0を「支持しない」 と考えることができます。

母集団1
1 0 1 0 1
母集団2
1 0 1 1 0

母集団1から サンプルサイズ \(n_1\) を抽出し、 その成功回数を \(X_1\) とすると、

\[ X_1\sim\mathrm{Bin}(n_1,p_1) \]

同様に、

\[ X_2\sim\mathrm{Bin}(n_2,p_2) \]

となります。

STEP 04

大標本なら成功回数を正規分布で近似できる

成功回数 \(X_1,X_2\) は、 0か1かの結果を足し合わせたものです。

したがって、 サンプルサイズが十分に大きければ、 中心極限定理 により正規分布に近似できます。

\[ X_1 \approx N\left( n_1p_1,\; n_1p_1(1-p_1) \right) \]
\[ X_2 \approx N\left( n_2p_2,\; n_2p_2(1-p_2) \right) \]
ここがポイント
二項分布は0・1確率変数の和なので、 大標本では正規近似できる。
STEP 05

成功回数を標本比率に変換する

今回考えたいのは 人数ではなく 比率 です。

そこで、 成功回数をそれぞれのサンプルサイズで割ります。

\[ \hat p_1=\frac{X_1}{n_1} \]
\[ \hat p_2=\frac{X_2}{n_2} \]

それぞれの標本比率は、 大標本では近似的に

\[ \hat p_1 \approx N\left( p_1,\; \frac{p_1(1-p_1)}{n_1} \right) \]
\[ \hat p_2 \approx N\left( p_2,\; \frac{p_2(1-p_2)}{n_2} \right) \]
分散の変換
\(X/n\) の分散は、 \(X\) の分散を \(n^2\) で割るため、 \[ \frac{np(1-p)}{n^2} = \frac{p(1-p)}{n} \] となります。
STEP 06

標本比率の差の分布を整理する

今回検定したいのは 母比率の差なので、 それに対応する 標本比率の差

\[ \hat p_1-\hat p_2 \]

を考えます。

2つの標本は互いに独立なので、 共分散は0となり、 分散はそれぞれの分散を足せます。

\[ \hat p_1-\hat p_2 \approx N\left( p_1-p_2,\; \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} \right) \]
平均 \[ p_1-p_2 \] 分散
\[ \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} \]
手順1の結論
標本比率の差は、 母比率の差を平均とする正規分布に近似できる。
STEP 07

帰無仮説のもとでは標本比率の差の平均は0になる

手順1では、 標本比率の差について、

\[ \hat p_1-\hat p_2 \approx N\left( p_1-p_2,\; \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} \right) \]

と整理しました。

ここで、 今回の帰無仮説は

\[ H_0:p_1=p_2 \]

です。

したがって、 帰無仮説の世界では

\[ p_1-p_2=0 \]

となるので、 標本比率の差の分布の 平均は0 になります。

\[ E[\hat p_1-\hat p_2]=0 \]

さらに、 帰無仮説のもとでは 2つの母比率は同じなので、 共通の母比率を \(p\) と書けば、

\[ p_1=p_2=p \]

となります。

ここで、 もともとの標本比率の差の分散は、

\[ V(\hat p_1-\hat p_2) = \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} \]

でした。

ここに、 帰無仮説から得られる \(p_1=p_2=p\) を代入すると、

\[ V(\hat p_1-\hat p_2) = \frac{p(1-p)}{n_1} + \frac{p(1-p)}{n_2} \]
↓ \(p(1-p)\) をくくる
\[ V(\hat p_1-\hat p_2) = p(1-p) \left( \frac{1}{n_1} + \frac{1}{n_2} \right) \]

したがって、 帰無仮説のもとでは、 標本比率の差は近似的に

\[ \hat p_1-\hat p_2 \approx N\left( 0,\; p(1-p) \left( \frac1{n_1} + \frac1{n_2} \right) \right) \]
帰無仮説の効果
\(H_0:p_1=p_2\) と仮定することで、
標本比率の差の平均は0となり、 分散も1つの共通比率 \(p\) を使って整理できる。
STEP 08

共通の母比率は「プールした標本比率」で推定する

ここで、 帰無仮説のもとで共通となる母比率 \(p\) は、 もちろん未知です。

そこで、 2つの標本をまとめて、 共通の母比率を推定します。

2つの標本をまとめる
標本1
成功回数 \(X_1\)
標本数 \(n_1\)
標本2
成功回数 \(X_2\)
標本数 \(n_2\)
↓ 合計
\[ \hat p = \frac{X_1+X_2}{n_1+n_2} \]

この \(\hat p\) を プールした標本比率 と考えます。

なぜまとめる?
帰無仮説では \(p_1=p_2=p\) と仮定しています。
つまり2つの標本は 同じ成功確率をもつ母集団から得られたもの と考えられるため、 2標本をまとめて共通の \(p\) を推定できます。
STEP 09

手順2:標本比率の差を標準化する

帰無仮説のもとでは、 標本比率の差の平均は0です。

また、 共通の母比率 \(p\) を プールした標本比率 \(\hat p\) で推定します。

すると、 検定統計量は

\[ Z = \frac{ \hat p_1-\hat p_2 }{ \sqrt{ \hat p(1-\hat p) \left( \frac{1}{n_1} + \frac{1}{n_2} \right) } } \approx N(0,1) \]

と整理できます。

この \(Z\) が、 母比率の差を検定するための 検定統計量 です。

区間推定との違い

区間推定では、 \[ \frac{\hat p_1(1-\hat p_1)}{n_1} + \frac{\hat p_2(1-\hat p_2)}{n_2} \] を使いました。

仮説検定では、 \(H_0:p_1=p_2\) を仮定しているため、 共通の比率をプールした \(\hat p\) で推定 します。
手順2
帰無仮説によって 2つの母比率を共通化し、 プールした標本比率を使って標準化する。
STEP 10

手順3:両側5%の棄却域を設定する

ここでは、 有意水準を

\[ \alpha=0.05 \]

とします。

対立仮説は

\[ H_1:p_1\neq p_2 \]

なので、 両側検定です。

標準正規分布の左右2.5%を棄却域にする
2.5% 2.5%
\[ |Z|\ge z_{0.025} \]

95%両側検定なら、

\[ |Z|\ge1.96 \]

が棄却域です。

STEP 11

zの実現値を計算して棄却域と比較する

最後に、 実際の標本から 標本比率とプールした標本比率を計算します。

\[ \hat p_1=\frac{x_1}{n_1}, \qquad \hat p_2=\frac{x_2}{n_2} \]
\[ \hat p = \frac{x_1+x_2}{n_1+n_2} \]

これらを使って、 検定統計量の実現値を

\[ z_{\mathrm{obs}} = \frac{ \hat p_1-\hat p_2 }{ \sqrt{ \hat p(1-\hat p) \left( \frac{1}{n_1} + \frac{1}{n_2} \right) } } \]
\(z_{\mathrm{obs}}\) は、 実際の2標本から計算された 検定統計量 \(Z\) の実現値 です。
\(|z_{\mathrm{obs}}|\ge1.96\)
→ \(H_0:p_1=p_2\) を棄却
棄却域に入らない
→ 帰無仮説を棄却しない
判定
標本比率の差が、 「母比率は等しい」という世界では 起こりにくいほど大きければ、 帰無仮説を棄却する。
STEP 12

母比率の差の検定を4つの手順で整理する

手順0
帰無仮説を設定 \[ H_0:p_1=p_2 \]
手順1
標本比率の差の分布を整理
\[ \hat p_1-\hat p_2 \approx N\left( p_1-p_2,\; \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} \right) \]
手順2
共通比率をプールしてzへ標準化
\[ Z = \frac{ \hat p_1-\hat p_2 }{ \sqrt{ \hat p(1-\hat p) \left( \frac1{n_1}+\frac1{n_2} \right) } } \]
手順3
両側の棄却域と \(z_{\mathrm{obs}}\) を比較
このレクチャーの核心
帰無仮説 \(p_1=p_2\) によって、 2つの未知母比率を 1つの共通母比率として扱える。

その共通比率を、 2標本をまとめた プールした標本比率で推定する。
SUMMARY

母比率の差の仮説検定を整理する

手順0
\[ H_0:p_1=p_2 \] を設定
手順1
大標本で 標本比率の差を正規近似
手順2
共通母比率を プールした標本比率 で推定してzへ標準化
手順3
標準正規分布の 両側の棄却域 と実現値を比較
プールした標本比率
\[ \hat p = \frac{x_1+x_2}{n_1+n_2} \]
検定統計量
\[ Z = \frac{ \hat p_1-\hat p_2 }{ \sqrt{ \hat p(1-\hat p) \left( \frac1{n_1}+\frac1{n_2} \right) } } \approx N(0,1) \]
両側5%検定
\[ |Z|\ge z_{0.025} \] \[ |Z|\ge1.96 \]
区間推定との違い

区間推定では \(\hat p_1,\hat p_2\) をそれぞれ使う。

仮説検定では \(H_0:p_1=p_2\) を仮定するため、 2標本をまとめた \(\hat p\) を使う。
最後に
母比率の差の仮説検定も、 「何がどんな分布にしたがうか」が出発点。

帰無仮説によって \(p_1=p_2\) と置けるため、 共通の母比率をプールして推定し、 z検定へつなげる。
NEXT STEP

次のステップ:統計検定®2級を目指す

このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。

統計検定®2級対策講座【ベストセラー版】

約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。

約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ

記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。

統計学ベーシック講座を見る →