34
母比率の区間推定
標本で観測された割合から、母集団全体の割合である母比率 \(p\) を区間推定する方法を学びます。二項分布と中心極限定理を使って標本比率の分布を整理し、標準正規分布を利用して信頼区間を導きます。
このページのゴール
標本比率 \(\hat p\) の近似分布を理解し、母比率 \(p\) の信頼区間を求められるようになる。
STEP 01
母比率の区間推定とは何か
今回は、
1つの母集団について
母比率 \(p\)
を区間推定する方法を見ていきます。
母比率とは、
母集団の中で
ある条件に該当するものの割合
のことです。
たとえば世論調査
一部の人を標本として調査し、
その結果から
母集団全体の比率 \(p\)
を推定します。
たとえば1000人を調査して、
500人が「支持する」と回答すれば、
標本では50%が支持したことになります。
\[
\hat p
=
\frac{500}{1000}
=
0.5
\]
この
標本比率 \(\hat p\)
を使って、
母集団全体の母比率 \(p\) を区間で推定していきます。
今回の前提
母比率の区間推定では、
正規近似を利用するため、
サンプルサイズ \(n\) が十分に大きい
ことを前提とします。
このレクチャーでは、
大標本の場合を扱います。
ここがポイント
標本で観測された割合 \(\hat p\) から、
母集団全体の割合 \(p\) を区間推定する。
STEP 02
母比率の区間推定も3つの手順で考える
母比率の区間推定も、
これまでと同じ
3つの手順
で整理できます。
手順1
成功回数・標本比率がどんな分布にしたがうか
を整理する
手順3
確率から母比率 \(p\) の区間をつくる
ここがポイント
母比率でも、
「分布 → 標準化 → 確率区間」
という基本の流れは同じ。
STEP 03
手順1:0か1かの結果から二項分布へ
母比率を考えるときは、
まず1人ひとりの結果を
0か1
で考えるとわかりやすくなります。
1人をランダムに抽出したとき、
「1」になる確率を \(p\) とします。
この \(p\) が、
今回推定したい
母比率
です。
\(n\) 人を抽出すると
↓ 1の個数を数える
成功回数 \(X=4\)
一般に、
\(n\) 人のうち成功した人数を \(X\) とすると、
\(X\) は
二項分布
にしたがいます。
\[
X\sim \mathrm{Bin}(n,p)
\]
ここで、
手順1の入口
0か1かの結果を \(n\) 回集めると、
1の個数 \(X\) は二項分布
\(\mathrm{Bin}(n,p)\) にしたがう。
STEP 04
母集団が十分大きいことを前提にする
ここで、
二項分布を使ううえで
1つ注意があります。
二項分布では、
各試行の成功確率 \(p\) が
一定
であることを前提とします。
ところが、
有限の母集団から
人を1人ずつ取り出して戻さない場合には、
母集団の構成が少しずつ変わります。
母集団が小さいと確率が変化する
1人目を抽出
↓
母集団から1人減る
↓
次の人が「1」になる確率も少し変わる
そのため、
母比率の基本的な区間推定では、
母集団が標本サイズに比べて
十分に大きい
と考えます。
母集団が非常に大きければ、
\(n\) 人を抽出した程度では
母集団の比率はほとんど変化しません。
ここでの考え方
実際の母集団は有限でも、
標本サイズに比べて十分大きければ、
無限母集団に近いものとして扱う
という考え方を使います。
ここがポイント
二項分布として扱うため、
各人の成功確率 \(p\) がほぼ一定と考えられる
大きな母集団を前提とする。
STEP 05
中心極限定理で二項分布を正規分布に近似する
成功回数 \(X\) は、
\[
X\sim \mathrm{Bin}(n,p)
\]
という二項分布にしたがいます。
ここで、
二項分布は
0か1かの確率変数を足し合わせたもの
と考えることができます。
成功回数は「0と1の和」
\[
X
=
1+0+0+1+1+1
=
4
\]
一般には、
\(n\) 個の0・1確率変数の和
したがって、
\(n\) が十分に大きければ、
中心極限定理
によって、
この和は正規分布に近似できます。
\[
X
\approx
N\left(
np,\;
np(1-p)
\right)
\]
期待値
\[
E[X]=np
\]
分散
\[
V[X]=np(1-p)
\]
ここがポイント
二項分布は0・1確率変数の和なので、
\(n\) が十分大きければ中心極限定理によって正規分布に近似できる。
STEP 06
成功回数 \(X\) から標本比率 \(\hat p\) へ
今回推定したいのは、
成功した
人数
ではなく、
母集団における
比率 \(p\)
です。
そこで、
成功回数 \(X\) を標本サイズ \(n\) で割ります。
\[
\hat p
=
\frac{X}{n}
\]
これが
標本比率 \(\hat p\)
です。
\(X\) を \(n\) で割るとどうなる?
\[
X
\approx
N\left(
np,\;
np(1-p)
\right)
\]
↓ \(n\) で割る
\[
\hat p
=
\frac{X}{n}
\approx
N\left(
p,\;
\frac{p(1-p)}{n}
\right)
\]
平均は
\[
E[\hat p]
=
\frac{1}{n}E[X]
=
p
\]
となります。
一方、
分散では定数を外に出すときに
二乗
されるので、
\[
V[\hat p]
=
V\left[\frac{X}{n}\right]
=
\frac{1}{n^2}V[X]
\]
↓
\[
V[\hat p]
=
\frac{np(1-p)}{n^2}
=
\frac{p(1-p)}{n}
\]
分散の変換に注意
\(X\) を \(n\) で割ったとき、
分散は \(n\) ではなく
\(n^2\)
で割られます。
手順1の結論
サンプルサイズが十分大きいとき、
\[
\hat p
\approx
N\left(
p,\frac{p(1-p)}{n}
\right)
\]
と考えられる。
STEP 07
手順2:標本比率を標準化する
手順1で、
標本比率 \(\hat p\) は近似的に
\[
\hat p
\approx
N\left(
p,
\frac{p(1-p)}{n}
\right)
\]
にしたがうことがわかりました。
次は、
標準正規分布の付表が使える形にするため、
標準化します。
標本比率を標準化
\[
\hat p
\approx
N\left(
p,
\frac{p(1-p)}{n}
\right)
\]
↓
\[
Z
=
\frac{\hat p-p}
{\sqrt{p(1-p)/n}}
\approx N(0,1)
\]
分子では、
標本比率 \(\hat p\) から平均 \(p\) を引き、
分母では、
標本比率の標準偏差
\[
\sqrt{\frac{p(1-p)}{n}}
\]
で割っています。
手順2のポイント
標本比率を標準化して、
標準正規分布の付表が使える
\(Z\) に変換する。
STEP 08
手順3:中央95%の確率区間を考える
\(Z\) が標準正規分布にしたがう形まで整理できたので、
ここから付表を使います。
95%信頼区間なら、
これまでと同じように
中央95%を残します。
標準正規分布の中央95%
\[
P\left(
-z_{\alpha/2}
\le
Z
\le
z_{\alpha/2}
\right)
=
1-\alpha
\]
95%信頼区間なら、
\[
\alpha=0.05
\]
\[
\frac{\alpha}{2}=0.025
\]
\[
z_{0.025}\approx1.96
\]
手順3のポイント
母比率でも、
標準正規分布の中央95%を使う考え方は
母平均の場合と同じ。
STEP 09
最後に分母の \(p\) を \(\hat p\) で近似する
ここまでで、
\[
Z
=
\frac{\hat p-p}
{\sqrt{p(1-p)/n}}
\]
という式が得られました。
ただし、
このまま \(p\) について整理しようとすると、
分母の平方根の中にも
\(p\) が入っています。
困るところ
推定したい \(p\) が、
分子だけでなく
\[
\sqrt{p(1-p)/n}
\]
の中にも入っているため、
そのまま解くと式が複雑になります。
そこで、
大標本の場合には、
分母にある \(p\) を
標本比率 \(\hat p\)
で近似します。
\(p\) を \(\hat p\) に置き換える
\[
\sqrt{
\frac{p(1-p)}{n}
}
\]
↓ 近似
\[
\sqrt{
\frac{\hat p(1-\hat p)}{n}
}
\]
なぜこの置き換えができるのでしょうか。
標本比率は、
\[
\hat p
=
\frac{X}{n}
\]
なので、
0か1かの \(n\) 個の結果の
平均
と考えることができます。
したがって、
サンプルサイズ \(n\) が大きくなるほど、
大数の法則
により
\[
\hat p \approx p
\]
と考えられるため、
分母の \(p\) を \(\hat p\) で近似します。
ここでのポイント
\(p\) をすべて \(\hat p\) に置き換えるわけではありません。
区間推定したい
分子側の \(p\)
は残し、
標準誤差を計算する
分母側の \(p\)
を \(\hat p\) で近似します。
ここがポイント
大標本では \(\hat p\approx p\) と考え、
標準誤差の中にある \(p\) を
\(\hat p\) で近似する。
STEP 10
95%信頼区間の形にまとめる
ここまで整理できれば、
あとは
95%信頼区間の形
にまとめるだけです。
95%信頼区間では、
標準正規分布の
上側2.5%点
を使います。
95%信頼区間なら
\[
z_{0.025}\approx 1.96
\]
したがって、
前の手順で得られた区間推定の式に
\(z_{0.025}\approx 1.96\)
を代入すると、
母比率 \(p\) の95%信頼区間は次のように書けます。
母比率 \(p\) の95%信頼区間
\[
\begin{aligned}
\hat p – 1.96\sqrt{\frac{\hat p(1-\hat p)}{n}}
&\le p \\[4pt]
p
&\le \hat p + 1.96\sqrt{\frac{\hat p(1-\hat p)}{n}}
\end{aligned}
\]
※不等式を2行に分けて、
スマホでも横にはみ出しにくい形にしています。
これは、
標本比率 \(\hat p\) を中心として、
そのまわりに
誤差の幅
\[
1.96\sqrt{\frac{\hat p(1-\hat p)}{n}}
\]
を足し引きした形になっています。
見方
中心:\(\hat p\)
幅:\(\displaystyle 1.96\sqrt{\frac{\hat p(1-\hat p)}{n}}\)
ここがポイント
95%信頼区間では
\(z_{0.025}\approx 1.96\) を使い、
母比率 \(p\) を
「標本比率 ± 誤差の幅」
の形で表す。
STEP 11
母比率の区間推定を3つの手順で整理する
手順1
標本比率の分布を整理する
\[
X\sim \mathrm{Bin}(n,p)
\]
\[
\hat p=\frac{X}{n}
\]
\[
\hat p
\approx
N\left(
p,
\frac{p(1-p)}{n}
\right)
\]
↓
手順2
標準正規分布へ標準化
\[
Z
=
\frac{\hat p-p}
{\sqrt{p(1-p)/n}}
\approx N(0,1)
\]
↓
手順3
中央 \(1-\alpha\) の確率区間を考える
\[
-z_{\alpha/2}
\le
Z
\le
z_{\alpha/2}
\]
↓ 分母の \(p\) を \(\hat p\) で近似
\[
\begin{aligned}
\hat p
–
z_{\alpha/2}
\sqrt{
\frac{\hat p(1-\hat p)}{n}
}
&\le
p
\\[4pt]
p
&\le
\hat p
+
z_{\alpha/2}
\sqrt{
\frac{\hat p(1-\hat p)}{n}
}
\end{aligned}
\]
母比率の区間推定では、
二項分布から正規分布への近似
が重要なポイントです。
そのため、
この方法は
サンプルサイズが十分に大きい場合
に利用することを覚えておきましょう。
最後に
0・1の結果
→ 二項分布
→ 中心極限定理
→ 標本比率の正規近似
→ 標準化
→ 信頼区間、
という流れで理解する。
SUMMARY
母比率の区間推定を整理する
手順1
成功回数
\(X\sim\mathrm{Bin}(n,p)\)
から、
標本比率の分布を整理する
手順3
標準正規分布の
中央 \(1-\alpha\)
の区間を使う
近似
標準誤差の中にある
\(p\) を \(\hat p\) で置き換える
成功回数
\[
X\sim\mathrm{Bin}(n,p)
\]
標本比率
\[
\hat p=\frac{X}{n}
\]
標本比率の近似分布
\[
\hat p
\approx
N\left(
p,
\frac{p(1-p)}{n}
\right)
\]
標準化
\[
Z
=
\frac{\hat p-p}
{\sqrt{p(1-p)/n}}
\approx N(0,1)
\]
母比率の \(1-\alpha\) 信頼区間
\[
\begin{aligned}
\hat p
–
z_{\alpha/2}
\sqrt{
\frac{\hat p(1-\hat p)}{n}
}
&\le p
\\[4pt]
p
&\le
\hat p
+
z_{\alpha/2}
\sqrt{
\frac{\hat p(1-\hat p)}{n}
}
\end{aligned}
\]
95%信頼区間なら
\(z_{0.025}\approx1.96\)
\[
\begin{aligned}
\hat p
–
1.96
\sqrt{
\frac{\hat p(1-\hat p)}{n}
}
&\le p
\\[4pt]
p
&\le
\hat p
+
1.96
\sqrt{
\frac{\hat p(1-\hat p)}{n}
}
\end{aligned}
\]
特に注意する3点
① サンプルサイズが十分に大きい場合の近似である
② 標本比率の分散は \(p(1-p)/n\)
③ 信頼区間では、標準誤差の中の \(p\) を \(\hat p\) で近似する
最後に
母比率の区間推定は、
「0・1の結果
→ 二項分布
→ 正規近似
→ 標準化
→ 確率区間
→ \(\hat p\) で近似」
という流れで整理する。
NEXT STEP
次のステップ:統計検定®2級を目指す
このサイトで統計学の基礎を学んだあと、
統計検定®2級の合格まで体系的に学びたい方へ。
統計検定®2級対策講座【ベストセラー版】
約9時間の動画講義と200問以上の小テストに加えて、
模擬試験にも取り組めます。
講座内ではQ&Aも利用でき、
これまでに400問以上の質問に回答してきました。
約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ
記述統計・確率・推定・検定を基礎から学ぶ
「統計学ベーシック講座その1『確率分布・推定・検定』」
も用意しています。
統計学ベーシック講座を見る →