37
母比率の差の区間推定
互いに独立な2つの母集団から得られた2標本を使って、母比率の差 \(p_1-p_2\) を区間推定する方法を学びます。二項分布と中心極限定理を使って標本比率の差の分布を整理し、標準正規分布を利用して信頼区間を導きます。
このページのゴール
2つの標本比率の差 \(\hat p_1-\hat p_2\) の近似分布を理解し、母比率の差 \(p_1-p_2\) の信頼区間を求められるようになる。
STEP 01
2つの母集団の「比率の差」を推定する
このレクチャーでは、
2標本問題の最後として
母比率の差の区間推定
を見ていきます。
母比率の差は、
2つの母集団で
ある条件に該当する割合がどれくらい違うのか
を考えるときに使います。
たとえば2つの地域の内閣支持率
推定したいのは
2つの母比率の差
\[
p_1-p_2
\]
ここでも、
これまでの区間推定と同じ
3つの手順
で考えていきます。
手順1
2つの標本比率が
どんな分布にしたがうか
を整理する
手順3
中央の確率から
母比率の差の区間
をつくる
ここがポイント
2つの標本から、
母比率の差
\(p_1-p_2\)
を区間推定する。
STEP 02
互いに独立な2つの母集団を考える
今回は、
互いに独立な2つの母集団
を考えます。
それぞれの母集団は、
1つひとつの結果が
0か1
の2値で表される母集団です。
2つの0・1母集団
母集団1
1
0
1
0
1
1
0
1
「1」になる確率
\(p_1\)
母集団2
1
0
0
1
0
1
0
1
「1」になる確率
\(p_2\)
内閣支持率なら、
1を「支持する」、
0を「支持しない」
と考えることができます。
不良品率なら、
1を「不良品」、
0を「不良品ではない」
と考えても同じです。
今回の前提
2つの標本は互いに独立であり、
中心極限定理による正規近似を使うため、
それぞれのサンプルサイズが十分に大きい
ことを前提とします。
また、1標本問題と同様に、
実際には有限である母集団を、
標本サイズに比べて十分大きければ
無限母集団に近いものとして扱う
という考え方を使います。
STEP 03
手順1:成功回数は2つの二項分布にしたがう
まず、
母集団1から
サンプルサイズ \(n_1\) の標本を抽出します。
その標本で
「1」となった個数、
つまり
成功回数
を \(X_1\) とします。
母集団1から \(n_1\) 個を抽出
1
0
1
1
0
1
↓ 1の個数を数える
成功回数 \(X_1\)
\[
X_1\sim\mathrm{Bin}(n_1,p_1)
\]
同様に、
母集団2から
サンプルサイズ \(n_2\) の標本を抽出し、
その成功回数を \(X_2\) とすると、
\[
X_2\sim\mathrm{Bin}(n_2,p_2)
\]
手順1の入口
2つの母集団から得られる成功回数は、
それぞれ二項分布にしたがう。
STEP 04
中心極限定理で2つの二項分布を正規近似する
成功回数 \(X_1\)、\(X_2\) は、
それぞれ
0か1かの結果を足し合わせたもの
と考えることができます。
したがって、
サンプルサイズが十分に大きければ、
中心極限定理
によって正規分布に近似できます。
\[
X_1\sim\mathrm{Bin}(n_1,p_1)
\]
↓ \(n_1\) が十分大きい
\[
X_1
\approx
N\left(
n_1p_1,\;
n_1p_1(1-p_1)
\right)
\]
\[
X_2\sim\mathrm{Bin}(n_2,p_2)
\]
↓ \(n_2\) が十分大きい
\[
X_2
\approx
N\left(
n_2p_2,\;
n_2p_2(1-p_2)
\right)
\]
ここがポイント
二項分布は0・1確率変数の和なので、
大標本では中心極限定理によって正規近似できる。
STEP 05
成功回数から2つの標本比率へ
今回推定したいのは
成功した
人数
ではなく
比率
です。
そこで、
成功回数をそれぞれのサンプルサイズで割り、
標本比率を考えます。
標本1
\[
\hat p_1
=
\frac{X_1}{n_1}
\]
標本2
\[
\hat p_2
=
\frac{X_2}{n_2}
\]
\(X_1\) を \(n_1\) で割ると、
標本比率 \(\hat p_1\) は
\[
\hat p_1
\approx
N\left(
p_1,\;
\frac{p_1(1-p_1)}{n_1}
\right)
\]
となります。
同様に、
\[
\hat p_2
\approx
N\left(
p_2,\;
\frac{p_2(1-p_2)}{n_2}
\right)
\]
分散の変換に注意
\[
V\left(\frac{X_1}{n_1}\right)
=
\frac{1}{n_1^2}V(X_1)
\]
なので、
\[
\frac{n_1p_1(1-p_1)}{n_1^2}
=
\frac{p_1(1-p_1)}{n_1}
\]
となります。
ここがポイント
2つの成功回数をサンプルサイズで割り、
2つの標本比率の分布に整理する。
STEP 06
標本比率の差はどんな分布にしたがう?
今回推定したいのは、
母比率の差
\[
p_1-p_2
\]
です。
そこで、
それに対応する
標本比率の差
\[
\hat p_1-\hat p_2
\]
を考えます。
2つの標本は互いに独立なので、
標本比率の差も近似的に正規分布にしたがいます。
\[
\hat p_1-\hat p_2
\approx
N\left(
p_1-p_2,\;
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
\right)
\]
平均と分散を分けて見る
平均
\[
E[\hat p_1-\hat p_2]
=
p_1-p_2
\]
分散
\[
V[\hat p_1-\hat p_2]
=
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
\]
差をとっているのに、
分散は
足し算
になっている点にも注意しましょう。
一般には、
\[
V(A-B)
=
V(A)+V(B)-2\operatorname{Cov}(A,B)
\]
ですが、
今回は2つの標本が互いに独立なので、
\[
\operatorname{Cov}(\hat p_1,\hat p_2)=0
\]
となり、
2つの分散をそのまま足せます。
手順1の結論
\[
\hat p_1-\hat p_2
\approx
N\left(
p_1-p_2,\;
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
\right)
\]
STEP 07
手順2:標本比率の差を標準化する
手順1で、
標本比率の差がどのような分布にしたがうかを
整理できました。
そこで、
標準正規分布の付表が使えるように
標準化します。
\[
Z
=
\frac{
(\hat p_1-\hat p_2)
–
(p_1-p_2)
}{
\sqrt{
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
}
}
\approx
N(0,1)
\]
標準化の中身
観測する値
\(\hat p_1-\hat p_2\)
平均
\(p_1-p_2\)
標準偏差
\[
\sqrt{
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
}
\]
手順2のポイント
標本比率の差から平均を引き、
標準偏差で割って
標準正規分布が使える形にする。
STEP 08
手順3:標準正規分布の中央95%を考える
標準正規分布にしたがう形まで整理できたので、
あとは付表を使って確率を考えます。
95%信頼区間なら、
中央95%を残し、
左右に2.5%ずつを残します。
標準正規分布の中央95%
\[
P\left(
-z_{0.025}
\le
Z
\le
z_{0.025}
\right)
=
0.95
\]
ここで、
\[
z_{0.025}\approx1.96
\]
です。
STEP 09
標準誤差の \(p_1,p_2\) を標本比率で近似する
ここで、
標準化した式の分母には、
推定したい母比率
\(p_1,p_2\)
が含まれています。
\[
\sqrt{
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
}
\]
このままでは、
\(p_1-p_2\) について整理するのが複雑になります。
そこで、
1標本問題の母比率と同じように、
大数の法則
を利用します。
大標本なら標本比率は母比率に近づく
\[
\hat p_1\approx p_1
\]
\[
\hat p_2\approx p_2
\]
したがって、
標準誤差の中の \(p_1,p_2\) を
\(\hat p_1,\hat p_2\) で置き換えます。
\[
\sqrt{
\frac{
\hat p_1(1-\hat p_1)
}{n_1}
+
\frac{
\hat p_2(1-\hat p_2)
}{n_2}
}
\]
注意
区間推定したい
分子側の \(p_1-p_2\)
はそのまま残します。
近似するのは、
標準誤差を計算する
分母側の \(p_1,p_2\)
です。
ここがポイント
大標本では
\(p_1\approx\hat p_1\)、
\(p_2\approx\hat p_2\)
と考えて標準誤差を計算する。
STEP 10
母比率の差の信頼区間を求める
標準誤差の \(p_1,p_2\) を
標本比率で近似すると、
母比率の差
\(p_1-p_2\)
について区間を整理できます。
母比率の差の \(1-\alpha\) 信頼区間
\[
\begin{aligned}
(\hat p_1-\hat p_2)
–
z_{\alpha/2}
\sqrt{
\frac{\hat p_1(1-\hat p_1)}{n_1}
+
\frac{\hat p_2(1-\hat p_2)}{n_2}
}
&\le
p_1-p_2
\\[6pt]
p_1-p_2
&\le
(\hat p_1-\hat p_2)
+
z_{\alpha/2}
\sqrt{
\frac{\hat p_1(1-\hat p_1)}{n_1}
+
\frac{\hat p_2(1-\hat p_2)}{n_2}
}
\end{aligned}
\]
つまり、
信頼区間の中心は
\[
\hat p_1-\hat p_2
\]
となります。
信頼区間の構造
標本比率の差
\[
\hat p_1-\hat p_2
\]
±
%点 × 標準誤差
ここがポイント
母比率の差の信頼区間も、
「標本で得られた差 ± 誤差の幅」
という形になる。
STEP 11
95%信頼区間なら \(1.96\) を使う
95%信頼区間なら、
\[
z_{0.025}\approx1.96
\]
なので、
母比率の差の95%信頼区間は、
\[
\begin{aligned}
(\hat p_1-\hat p_2)
–
1.96
\sqrt{
\frac{\hat p_1(1-\hat p_1)}{n_1}
+
\frac{\hat p_2(1-\hat p_2)}{n_2}
}
&\le
p_1-p_2
\\[6pt]
p_1-p_2
&\le
(\hat p_1-\hat p_2)
+
1.96
\sqrt{
\frac{\hat p_1(1-\hat p_1)}{n_1}
+
\frac{\hat p_2(1-\hat p_2)}{n_2}
}
\end{aligned}
\]
式を読むときは
中心:
\(\hat p_1-\hat p_2\)
幅:
\[
1.96
\sqrt{
\frac{\hat p_1(1-\hat p_1)}{n_1}
+
\frac{\hat p_2(1-\hat p_2)}{n_2}
}
\]
95%なら
2つの標本比率の差を中心として、
左右に
\(1.96\times\)標準誤差
の幅をとる。
STEP 12
母比率の差の区間推定を3つの手順で整理する
手順1
2つの標本比率の分布を整理
\[
\hat p_1-\hat p_2
\approx
N\left(
p_1-p_2,\;
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
\right)
\]
↓
手順2
標準正規分布へ標準化
\[
Z
=
\frac{
(\hat p_1-\hat p_2)-(p_1-p_2)
}{
\sqrt{
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
}
}
\approx N(0,1)
\]
↓
手順3
中央 \(1-\alpha\) の確率区間を考える
\[
-z_{\alpha/2}
\le
Z
\le
z_{\alpha/2}
\]
↓ 標準誤差の \(p_1,p_2\) を標本比率で近似
\[
\begin{aligned}
(\hat p_1-\hat p_2)
–
z_{\alpha/2}
\sqrt{
\frac{\hat p_1(1-\hat p_1)}{n_1}
+
\frac{\hat p_2(1-\hat p_2)}{n_2}
}
&\le
p_1-p_2
\\[5pt]
p_1-p_2
&\le
(\hat p_1-\hat p_2)
+
z_{\alpha/2}
\sqrt{
\frac{\hat p_1(1-\hat p_1)}{n_1}
+
\frac{\hat p_2(1-\hat p_2)}{n_2}
}
\end{aligned}
\]
最後の公式だけを見ると複雑に感じますが、
重要なのは、
どこからこの式が出てきたのか
を理解することです。
まず何がどんな分布にしたがうかを整理し、
それを標準化し、
最後に確率区間から信頼区間を導く、
という流れは、
ここまで見てきた区間推定と変わりません。
最後に
公式を単独で覚えるのではなく、
「二項分布 → 正規近似 → 標本比率 → 差の分布 → 標準化 → 信頼区間」
という流れで理解する。
SUMMARY
母比率の差の区間推定を整理する
推定対象
2つの母集団の
母比率の差 \(p_1-p_2\)
手順1
2つの二項分布から
標本比率の差の分布
を整理する
手順3
中央 \(1-\alpha\) の区間から
母比率の差の信頼区間
をつくる
成功回数
\[
X_1\sim\mathrm{Bin}(n_1,p_1)
\]
\[
X_2\sim\mathrm{Bin}(n_2,p_2)
\]
標本比率
\[
\hat p_1=\frac{X_1}{n_1},
\qquad
\hat p_2=\frac{X_2}{n_2}
\]
標本比率の差の近似分布
\[
\hat p_1-\hat p_2
\approx
N\left(
p_1-p_2,\;
\frac{p_1(1-p_1)}{n_1}
+
\frac{p_2(1-p_2)}{n_2}
\right)
\]
母比率の差の95%信頼区間
\[
\begin{aligned}
(\hat p_1-\hat p_2)
–
1.96
\sqrt{
\frac{\hat p_1(1-\hat p_1)}{n_1}
+
\frac{\hat p_2(1-\hat p_2)}{n_2}
}
&\le
p_1-p_2
\\[6pt]
p_1-p_2
&\le
(\hat p_1-\hat p_2)
+
1.96
\sqrt{
\frac{\hat p_1(1-\hat p_1)}{n_1}
+
\frac{\hat p_2(1-\hat p_2)}{n_2}
}
\end{aligned}
\]
特に注意する3点
① 2つの標本は互いに独立
② サンプルサイズが十分大きい場合の正規近似を使う
③ 標準誤差の中の \(p_1,p_2\) は \(\hat p_1,\hat p_2\) で近似する
最後に
「何がどんな分布にしたがうか」をまず整理し、
標準化して確率区間をつくる。
公式だけでなく、
その導出の流れまで理解することを意識する。
NEXT STEP
次のステップ:統計検定®2級を目指す
このサイトで統計学の基礎を学んだあと、
統計検定®2級の合格まで体系的に学びたい方へ。
統計検定®2級対策講座【ベストセラー版】
約9時間の動画講義と200問以上の小テストに加えて、
模擬試験にも取り組めます。
講座内ではQ&Aも利用でき、
これまでに400問以上の質問に回答してきました。
約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ
記述統計・確率・推定・検定を基礎から学ぶ
「統計学ベーシック講座その1『確率分布・推定・検定』」
も用意しています。
統計学ベーシック講座を見る →