44
母比率の差の仮説検定
互いに独立な2つの母集団から得られた2標本を使って、2つの母比率に差があるかどうかを検定します。大標本における正規近似を利用し、帰無仮説 \(p_1=p_2\) のもとで検定統計量を構成して、棄却域との比較から判断します。
このページのゴール
2つの母比率について帰無仮説を設定し、標本比率の差の近似分布を整理したうえで、プールした標本比率を使ったz検定統計量を求め、帰無仮説を棄却するか判断できるようになる。
STEP 01
2つの母集団の母比率に差があるかを検定する
このレクチャーでは、
2標本問題の仮説検定の最後として、
母比率の差の仮説検定
を見ていきます。
たとえば、
2つの地域について
内閣支持率に差があるかどうかを考えるような場面です。
今回は、
「2つの母比率に差がない」と仮定したときに、
実際の標本比率の差が
めったに起こらないほど大きな差かどうか
を検証します。
前提
2つの標本は互いに独立であり、
正規近似を使うため、
それぞれのサンプルサイズが十分に大きい
場合を扱います。
今回のテーマ
2つの母比率に差がないという世界を仮定して、
観測された標本比率の差がどれほど極端かを見る。
STEP 02
手順0:2つの母比率が等しいという帰無仮説を立てる
仮説検定なので、
まず帰無仮説と対立仮説を設定します。
対立仮説
\[
H_1:p_1\neq p_2
\]
今回は、
どちらの母比率が大きいか方向を限定しない
両側検定
とします。
帰無仮説のもとでは、
2つの母比率は同じなので、
共通の母比率を
\(p\)
と書けば、
\[
p_1=p_2=p
\]
手順0
帰無仮説の世界では、
2つの母集団は同じ成功確率
\(p\)
をもつと考える。
STEP 03
手順1:2つの成功回数は二項分布にしたがう
まず、
それぞれの母集団は
0か1かの結果からなると考えます。
内閣支持率なら、
1を「支持する」、
0を「支持しない」
と考えることができます。
母集団1から
サンプルサイズ \(n_1\) を抽出し、
その成功回数を \(X_1\) とすると、
\[
X_1\sim\mathrm{Bin}(n_1,p_1)
\]
同様に、
\[
X_2\sim\mathrm{Bin}(n_2,p_2)
\]
となります。
STEP 04
大標本なら成功回数を正規分布で近似できる
成功回数 \(X_1,X_2\) は、
0か1かの結果を足し合わせたものです。
したがって、
サンプルサイズが十分に大きければ、
中心極限定理
により正規分布に近似できます。
\[
X_1
\approx
N\left(
n_1p_1,\;
n_1p_1(1-p_1)
\right)
\]
\[
X_2
\approx
N\left(
n_2p_2,\;
n_2p_2(1-p_2)
\right)
\]
ここがポイント
二項分布は0・1確率変数の和なので、
大標本では正規近似できる。
STEP 05
成功回数を標本比率に変換する
今回考えたいのは
人数ではなく
比率
です。
そこで、
成功回数をそれぞれのサンプルサイズで割ります。
\[
\hat p_1=\frac{X_1}{n_1}
\]
\[
\hat p_2=\frac{X_2}{n_2}
\]
それぞれの標本比率は、
大標本では近似的に
\[
\hat p_1
\approx
N\left(
p_1,\;
\frac{p_1(1-p_1)}{n_1}
\right)
\]
\[
\hat p_2
\approx
N\left(
p_2,\;
\frac{p_2(1-p_2)}{n_2}
\right)
\]
分散の変換
\(X/n\) の分散は、
\(X\) の分散を \(n^2\) で割るため、
\[
\frac{np(1-p)}{n^2}
=
\frac{p(1-p)}{n}
\]
となります。
STEP 06
標本比率の差の分布を整理する
今回検定したいのは
母比率の差なので、
それに対応する
標本比率の差
\[
\hat p_1-\hat p_2
\]
を考えます。
2つの標本は互いに独立なので、
共分散は0となり、
分散はそれぞれの分散を足せます。
\[
\hat p_1-\hat p_2
\approx
N\left(
p_1-p_2,\;
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
\right)
\]
平均
\[
p_1-p_2
\]
分散
\[
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
\]
手順1の結論
標本比率の差は、
母比率の差を平均とする正規分布に近似できる。
STEP 07
帰無仮説のもとでは標本比率の差の平均は0になる
手順1では、
標本比率の差について、
\[
\hat p_1-\hat p_2
\approx
N\left(
p_1-p_2,\;
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
\right)
\]
と整理しました。
ここで、
今回の帰無仮説は
\[
H_0:p_1=p_2
\]
です。
したがって、
帰無仮説の世界では
\[
p_1-p_2=0
\]
となるので、
標本比率の差の分布の
平均は0
になります。
\[
E[\hat p_1-\hat p_2]=0
\]
さらに、
帰無仮説のもとでは
2つの母比率は同じなので、
共通の母比率を
\(p\)
と書けば、
\[
p_1=p_2=p
\]
となります。
ここで、
もともとの標本比率の差の分散は、
\[
V(\hat p_1-\hat p_2)
=
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
\]
でした。
ここに、
帰無仮説から得られる
\(p_1=p_2=p\)
を代入すると、
\[
V(\hat p_1-\hat p_2)
=
\frac{p(1-p)}{n_1}
+
\frac{p(1-p)}{n_2}
\]
↓ \(p(1-p)\) をくくる
\[
V(\hat p_1-\hat p_2)
=
p(1-p)
\left(
\frac{1}{n_1}
+
\frac{1}{n_2}
\right)
\]
したがって、
帰無仮説のもとでは、
標本比率の差は近似的に
\[
\hat p_1-\hat p_2
\approx
N\left(
0,\;
p(1-p)
\left(
\frac1{n_1}
+
\frac1{n_2}
\right)
\right)
\]
帰無仮説の効果
\(H_0:p_1=p_2\)
と仮定することで、
標本比率の差の平均は0となり、
分散も1つの共通比率 \(p\) を使って整理できる。
STEP 08
共通の母比率は「プールした標本比率」で推定する
ここで、
帰無仮説のもとで共通となる母比率 \(p\) は、
もちろん未知です。
そこで、
2つの標本をまとめて、
共通の母比率を推定します。
2つの標本をまとめる
標本1
成功回数 \(X_1\)
標本数 \(n_1\)
標本2
成功回数 \(X_2\)
標本数 \(n_2\)
↓ 合計
\[
\hat p
=
\frac{X_1+X_2}{n_1+n_2}
\]
この
\(\hat p\)
を
プールした標本比率
と考えます。
なぜまとめる?
帰無仮説では
\(p_1=p_2=p\)
と仮定しています。
つまり2つの標本は
同じ成功確率をもつ母集団から得られたもの
と考えられるため、
2標本をまとめて共通の \(p\) を推定できます。
STEP 09
手順2:標本比率の差を標準化する
帰無仮説のもとでは、
標本比率の差の平均は0です。
また、
共通の母比率 \(p\) を
プールした標本比率 \(\hat p\) で推定します。
すると、
検定統計量は
\[
Z
=
\frac{
\hat p_1-\hat p_2
}{
\sqrt{
\hat p(1-\hat p)
\left(
\frac{1}{n_1}
+
\frac{1}{n_2}
\right)
}
}
\approx N(0,1)
\]
と整理できます。
この \(Z\) が、
母比率の差を検定するための
検定統計量
です。
区間推定との違い
区間推定では、
\[
\frac{\hat p_1(1-\hat p_1)}{n_1}
+
\frac{\hat p_2(1-\hat p_2)}{n_2}
\]
を使いました。
仮説検定では、
\(H_0:p_1=p_2\)
を仮定しているため、
共通の比率をプールした \(\hat p\) で推定
します。
手順2
帰無仮説によって
2つの母比率を共通化し、
プールした標本比率を使って標準化する。
STEP 10
手順3:両側5%の棄却域を設定する
ここでは、
有意水準を
\[
\alpha=0.05
\]
とします。
対立仮説は
\[
H_1:p_1\neq p_2
\]
なので、
両側検定です。
標準正規分布の左右2.5%を棄却域にする
\[
|Z|\ge z_{0.025}
\]
95%両側検定なら、
\[
|Z|\ge1.96
\]
が棄却域です。
STEP 11
zの実現値を計算して棄却域と比較する
最後に、
実際の標本から
標本比率とプールした標本比率を計算します。
\[
\hat p_1=\frac{x_1}{n_1},
\qquad
\hat p_2=\frac{x_2}{n_2}
\]
\[
\hat p
=
\frac{x_1+x_2}{n_1+n_2}
\]
これらを使って、
検定統計量の実現値を
\[
z_{\mathrm{obs}}
=
\frac{
\hat p_1-\hat p_2
}{
\sqrt{
\hat p(1-\hat p)
\left(
\frac{1}{n_1}
+
\frac{1}{n_2}
\right)
}
}
\]
\(z_{\mathrm{obs}}\)
は、
実際の2標本から計算された
検定統計量 \(Z\) の実現値
です。
\(|z_{\mathrm{obs}}|\ge1.96\)
→ \(H_0:p_1=p_2\) を棄却
棄却域に入らない
→ 帰無仮説を棄却しない
判定
標本比率の差が、
「母比率は等しい」という世界では
起こりにくいほど大きければ、
帰無仮説を棄却する。
STEP 12
母比率の差の検定を4つの手順で整理する
手順0
帰無仮説を設定
\[
H_0:p_1=p_2
\]
↓
手順1
標本比率の差の分布を整理
\[
\hat p_1-\hat p_2
\approx
N\left(
p_1-p_2,\;
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
\right)
\]
↓
手順2
共通比率をプールしてzへ標準化
\[
Z
=
\frac{
\hat p_1-\hat p_2
}{
\sqrt{
\hat p(1-\hat p)
\left(
\frac1{n_1}+\frac1{n_2}
\right)
}
}
\]
↓
手順3
両側の棄却域と
\(z_{\mathrm{obs}}\)
を比較
このレクチャーの核心
帰無仮説
\(p_1=p_2\)
によって、
2つの未知母比率を
1つの共通母比率として扱える。
その共通比率を、
2標本をまとめた
プールした標本比率で推定する。
SUMMARY
母比率の差の仮説検定を整理する
手順0
\[
H_0:p_1=p_2
\]
を設定
手順2
共通母比率を
プールした標本比率
で推定してzへ標準化
手順3
標準正規分布の
両側の棄却域
と実現値を比較
プールした標本比率
\[
\hat p
=
\frac{x_1+x_2}{n_1+n_2}
\]
検定統計量
\[
Z
=
\frac{
\hat p_1-\hat p_2
}{
\sqrt{
\hat p(1-\hat p)
\left(
\frac1{n_1}+\frac1{n_2}
\right)
}
}
\approx N(0,1)
\]
両側5%検定
\[
|Z|\ge z_{0.025}
\]
\[
|Z|\ge1.96
\]
区間推定との違い
区間推定では
\(\hat p_1,\hat p_2\)
をそれぞれ使う。
仮説検定では
\(H_0:p_1=p_2\)
を仮定するため、
2標本をまとめた \(\hat p\)
を使う。
最後に
母比率の差の仮説検定も、
「何がどんな分布にしたがうか」が出発点。
帰無仮説によって
\(p_1=p_2\)
と置けるため、
共通の母比率をプールして推定し、
z検定へつなげる。
NEXT STEP
次のステップ:統計検定®2級を目指す
このサイトで統計学の基礎を学んだあと、
統計検定®2級の合格まで体系的に学びたい方へ。
統計検定®2級対策講座【ベストセラー版】
約9時間の動画講義と200問以上の小テストに加えて、
模擬試験にも取り組めます。
講座内ではQ&Aも利用でき、
これまでに400問以上の質問に回答してきました。
約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ
記述統計・確率・推定・検定を基礎から学ぶ
「統計学ベーシック講座その1『確率分布・推定・検定』」
も用意しています。
統計学ベーシック講座を見る →