スマホで統計学

37

母比率の差の区間推定

互いに独立な2つの母集団から得られた2標本を使って、母比率の差 \(p_1-p_2\) を区間推定する方法を学びます。二項分布と中心極限定理を使って標本比率の差の分布を整理し、標準正規分布を利用して信頼区間を導きます。
このページのゴール

2つの標本比率の差 \(\hat p_1-\hat p_2\) の近似分布を理解し、母比率の差 \(p_1-p_2\) の信頼区間を求められるようになる。

STEP 01

2つの母集団の「比率の差」を推定する

このレクチャーでは、 2標本問題の最後として 母比率の差の区間推定 を見ていきます。

母比率の差は、 2つの母集団で ある条件に該当する割合がどれくらい違うのか を考えるときに使います。

たとえば2つの地域の内閣支持率
地域1
母比率 \(p_1\)
地域2
母比率 \(p_2\)
推定したいのは 2つの母比率の差 \[ p_1-p_2 \]

ここでも、 これまでの区間推定と同じ 3つの手順 で考えていきます。

手順1
2つの標本比率が どんな分布にしたがうか を整理する
手順2
標準正規分布が使えるように 標準化 する
手順3
中央の確率から 母比率の差の区間 をつくる
ここがポイント
2つの標本から、 母比率の差 \(p_1-p_2\) を区間推定する。
STEP 02

互いに独立な2つの母集団を考える

今回は、 互いに独立な2つの母集団 を考えます。

それぞれの母集団は、 1つひとつの結果が 0か1 の2値で表される母集団です。

2つの0・1母集団
母集団1
1 0 1 0 1 1 0 1
「1」になる確率 \(p_1\)
母集団2
1 0 0 1 0 1 0 1
「1」になる確率 \(p_2\)

内閣支持率なら、 1を「支持する」、 0を「支持しない」 と考えることができます。

不良品率なら、 1を「不良品」、 0を「不良品ではない」 と考えても同じです。

今回の前提
2つの標本は互いに独立であり、 中心極限定理による正規近似を使うため、 それぞれのサンプルサイズが十分に大きい ことを前提とします。

また、1標本問題と同様に、 実際には有限である母集団を、 標本サイズに比べて十分大きければ 無限母集団に近いものとして扱う という考え方を使います。

STEP 03

手順1:成功回数は2つの二項分布にしたがう

まず、 母集団1から サンプルサイズ \(n_1\) の標本を抽出します。

その標本で 「1」となった個数、 つまり 成功回数 を \(X_1\) とします。

母集団1から \(n_1\) 個を抽出
1 0 1 1 0 1
↓ 1の個数を数える
成功回数 \(X_1\)
\[ X_1\sim\mathrm{Bin}(n_1,p_1) \]

同様に、 母集団2から サンプルサイズ \(n_2\) の標本を抽出し、 その成功回数を \(X_2\) とすると、

\[ X_2\sim\mathrm{Bin}(n_2,p_2) \]
手順1の入口
2つの母集団から得られる成功回数は、 それぞれ二項分布にしたがう。
STEP 04

中心極限定理で2つの二項分布を正規近似する

成功回数 \(X_1\)、\(X_2\) は、 それぞれ 0か1かの結果を足し合わせたもの と考えることができます。

したがって、 サンプルサイズが十分に大きければ、 中心極限定理 によって正規分布に近似できます。

\[ X_1\sim\mathrm{Bin}(n_1,p_1) \]
↓ \(n_1\) が十分大きい
\[ X_1 \approx N\left( n_1p_1,\; n_1p_1(1-p_1) \right) \]
\[ X_2\sim\mathrm{Bin}(n_2,p_2) \]
↓ \(n_2\) が十分大きい
\[ X_2 \approx N\left( n_2p_2,\; n_2p_2(1-p_2) \right) \]
ここがポイント
二項分布は0・1確率変数の和なので、 大標本では中心極限定理によって正規近似できる。
STEP 05

成功回数から2つの標本比率へ

今回推定したいのは 成功した 人数 ではなく 比率 です。

そこで、 成功回数をそれぞれのサンプルサイズで割り、 標本比率を考えます。

標本1 \[ \hat p_1 = \frac{X_1}{n_1} \]
標本2 \[ \hat p_2 = \frac{X_2}{n_2} \]

\(X_1\) を \(n_1\) で割ると、 標本比率 \(\hat p_1\) は

\[ \hat p_1 \approx N\left( p_1,\; \frac{p_1(1-p_1)}{n_1} \right) \]

となります。

同様に、

\[ \hat p_2 \approx N\left( p_2,\; \frac{p_2(1-p_2)}{n_2} \right) \]
分散の変換に注意

\[ V\left(\frac{X_1}{n_1}\right) = \frac{1}{n_1^2}V(X_1) \] なので、 \[ \frac{n_1p_1(1-p_1)}{n_1^2} = \frac{p_1(1-p_1)}{n_1} \] となります。
ここがポイント
2つの成功回数をサンプルサイズで割り、 2つの標本比率の分布に整理する。
STEP 06

標本比率の差はどんな分布にしたがう?

今回推定したいのは、 母比率の差

\[ p_1-p_2 \]

です。

そこで、 それに対応する 標本比率の差

\[ \hat p_1-\hat p_2 \]

を考えます。

2つの標本は互いに独立なので、 標本比率の差も近似的に正規分布にしたがいます。

\[ \hat p_1-\hat p_2 \approx N\left( p_1-p_2,\; \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} \right) \]
平均と分散を分けて見る
平均 \[ E[\hat p_1-\hat p_2] = p_1-p_2 \]
分散 \[ V[\hat p_1-\hat p_2] = \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} \]

差をとっているのに、 分散は 足し算 になっている点にも注意しましょう。

一般には、

\[ V(A-B) = V(A)+V(B)-2\operatorname{Cov}(A,B) \]

ですが、 今回は2つの標本が互いに独立なので、

\[ \operatorname{Cov}(\hat p_1,\hat p_2)=0 \]

となり、 2つの分散をそのまま足せます。

手順1の結論
\[ \hat p_1-\hat p_2 \approx N\left( p_1-p_2,\; \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} \right) \]
STEP 07

手順2:標本比率の差を標準化する

手順1で、 標本比率の差がどのような分布にしたがうかを 整理できました。

そこで、 標準正規分布の付表が使えるように 標準化します。

\[ Z = \frac{ (\hat p_1-\hat p_2) – (p_1-p_2) }{ \sqrt{ \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} } } \approx N(0,1) \]
標準化の中身
観測する値
\(\hat p_1-\hat p_2\)
平均
\(p_1-p_2\)
標準偏差 \[ \sqrt{ \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} } \]
手順2のポイント
標本比率の差から平均を引き、 標準偏差で割って 標準正規分布が使える形にする。
STEP 08

手順3:標準正規分布の中央95%を考える

標準正規分布にしたがう形まで整理できたので、 あとは付表を使って確率を考えます。

95%信頼区間なら、 中央95%を残し、 左右に2.5%ずつを残します。

標準正規分布の中央95%
95% 2.5% 2.5%
\[ P\left( -z_{0.025} \le Z \le z_{0.025} \right) = 0.95 \]

ここで、

\[ z_{0.025}\approx1.96 \]

です。

STEP 09

標準誤差の \(p_1,p_2\) を標本比率で近似する

ここで、 標準化した式の分母には、 推定したい母比率 \(p_1,p_2\) が含まれています。

\[ \sqrt{ \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} } \]

このままでは、 \(p_1-p_2\) について整理するのが複雑になります。

そこで、 1標本問題の母比率と同じように、 大数の法則 を利用します。

大標本なら標本比率は母比率に近づく
\[ \hat p_1\approx p_1 \]
\[ \hat p_2\approx p_2 \]

したがって、 標準誤差の中の \(p_1,p_2\) を \(\hat p_1,\hat p_2\) で置き換えます。

\[ \sqrt{ \frac{ \hat p_1(1-\hat p_1) }{n_1} + \frac{ \hat p_2(1-\hat p_2) }{n_2} } \]
注意
区間推定したい 分子側の \(p_1-p_2\) はそのまま残します。
近似するのは、 標準誤差を計算する 分母側の \(p_1,p_2\) です。
ここがポイント
大標本では \(p_1\approx\hat p_1\)、 \(p_2\approx\hat p_2\) と考えて標準誤差を計算する。
STEP 10

母比率の差の信頼区間を求める

標準誤差の \(p_1,p_2\) を 標本比率で近似すると、 母比率の差 \(p_1-p_2\) について区間を整理できます。

母比率の差の \(1-\alpha\) 信頼区間
\[ \begin{aligned} (\hat p_1-\hat p_2) – z_{\alpha/2} \sqrt{ \frac{\hat p_1(1-\hat p_1)}{n_1} + \frac{\hat p_2(1-\hat p_2)}{n_2} } &\le p_1-p_2 \\[6pt] p_1-p_2 &\le (\hat p_1-\hat p_2) + z_{\alpha/2} \sqrt{ \frac{\hat p_1(1-\hat p_1)}{n_1} + \frac{\hat p_2(1-\hat p_2)}{n_2} } \end{aligned} \]

つまり、 信頼区間の中心は

\[ \hat p_1-\hat p_2 \]

となります。

信頼区間の構造
標本比率の差 \[ \hat p_1-\hat p_2 \]
±
%点 × 標準誤差
ここがポイント
母比率の差の信頼区間も、 「標本で得られた差 ± 誤差の幅」 という形になる。
STEP 11

95%信頼区間なら \(1.96\) を使う

95%信頼区間なら、

\[ z_{0.025}\approx1.96 \]

なので、 母比率の差の95%信頼区間は、

\[ \begin{aligned} (\hat p_1-\hat p_2) – 1.96 \sqrt{ \frac{\hat p_1(1-\hat p_1)}{n_1} + \frac{\hat p_2(1-\hat p_2)}{n_2} } &\le p_1-p_2 \\[6pt] p_1-p_2 &\le (\hat p_1-\hat p_2) + 1.96 \sqrt{ \frac{\hat p_1(1-\hat p_1)}{n_1} + \frac{\hat p_2(1-\hat p_2)}{n_2} } \end{aligned} \]
式を読むときは

中心: \(\hat p_1-\hat p_2\)

幅: \[ 1.96 \sqrt{ \frac{\hat p_1(1-\hat p_1)}{n_1} + \frac{\hat p_2(1-\hat p_2)}{n_2} } \]
95%なら
2つの標本比率の差を中心として、 左右に \(1.96\times\)標準誤差 の幅をとる。
STEP 12

母比率の差の区間推定を3つの手順で整理する

手順1
2つの標本比率の分布を整理
\[ \hat p_1-\hat p_2 \approx N\left( p_1-p_2,\; \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} \right) \]
手順2
標準正規分布へ標準化
\[ Z = \frac{ (\hat p_1-\hat p_2)-(p_1-p_2) }{ \sqrt{ \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} } } \approx N(0,1) \]
手順3
中央 \(1-\alpha\) の確率区間を考える
\[ -z_{\alpha/2} \le Z \le z_{\alpha/2} \]
↓ 標準誤差の \(p_1,p_2\) を標本比率で近似
\[ \begin{aligned} (\hat p_1-\hat p_2) – z_{\alpha/2} \sqrt{ \frac{\hat p_1(1-\hat p_1)}{n_1} + \frac{\hat p_2(1-\hat p_2)}{n_2} } &\le p_1-p_2 \\[5pt] p_1-p_2 &\le (\hat p_1-\hat p_2) + z_{\alpha/2} \sqrt{ \frac{\hat p_1(1-\hat p_1)}{n_1} + \frac{\hat p_2(1-\hat p_2)}{n_2} } \end{aligned} \]

最後の公式だけを見ると複雑に感じますが、 重要なのは、 どこからこの式が出てきたのか を理解することです。

まず何がどんな分布にしたがうかを整理し、 それを標準化し、 最後に確率区間から信頼区間を導く、 という流れは、 ここまで見てきた区間推定と変わりません。

最後に
公式を単独で覚えるのではなく、
「二項分布 → 正規近似 → 標本比率 → 差の分布 → 標準化 → 信頼区間」 という流れで理解する。
SUMMARY

母比率の差の区間推定を整理する

推定対象
2つの母集団の 母比率の差 \(p_1-p_2\)
手順1
2つの二項分布から 標本比率の差の分布 を整理する
手順2
標本比率の差を 標準正規分布へ標準化
手順3
中央 \(1-\alpha\) の区間から 母比率の差の信頼区間 をつくる
成功回数
\[ X_1\sim\mathrm{Bin}(n_1,p_1) \] \[ X_2\sim\mathrm{Bin}(n_2,p_2) \]
標本比率
\[ \hat p_1=\frac{X_1}{n_1}, \qquad \hat p_2=\frac{X_2}{n_2} \]
標本比率の差の近似分布
\[ \hat p_1-\hat p_2 \approx N\left( p_1-p_2,\; \frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2} \right) \]
母比率の差の95%信頼区間
\[ \begin{aligned} (\hat p_1-\hat p_2) – 1.96 \sqrt{ \frac{\hat p_1(1-\hat p_1)}{n_1} + \frac{\hat p_2(1-\hat p_2)}{n_2} } &\le p_1-p_2 \\[6pt] p_1-p_2 &\le (\hat p_1-\hat p_2) + 1.96 \sqrt{ \frac{\hat p_1(1-\hat p_1)}{n_1} + \frac{\hat p_2(1-\hat p_2)}{n_2} } \end{aligned} \]
特に注意する3点
① 2つの標本は互いに独立
② サンプルサイズが十分大きい場合の正規近似を使う
③ 標準誤差の中の \(p_1,p_2\) は \(\hat p_1,\hat p_2\) で近似する
最後に
「何がどんな分布にしたがうか」をまず整理し、
標準化して確率区間をつくる。

公式だけでなく、 その導出の流れまで理解することを意識する。
NEXT STEP

次のステップ:統計検定®2級を目指す

このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。

統計検定®2級対策講座【ベストセラー版】

約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。

約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ

記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。

統計学ベーシック講座を見る →