スマホで統計学

21

連続型確率分布

ここでは、代表的な連続型確率分布として、一様分布・正規分布・指数分布を学びます。離散型とは異なり、連続型では1つの値の「確率」ではなく、確率密度とその面積によって確率を考えます。それぞれどんな確率変数がしたがうのかを確認しながら、分布の形・パラメータ・期待値・分散を整理していきます。
このページのゴール

一様分布・正規分布・指数分布について、どんな確率変数がしたがうのかを理解し、特に正規分布を平均0・分散1の標準正規分布へ変換する方法を説明できるようになる

STEP 01

連続型確率分布の見方を確認する

ここでは、 代表的な連続型確率分布を 見ていきます。

前のレクチャーで扱った離散型では、 \(X=0,1,2,\ldots\) のように、 確率変数が飛び飛びの値をとりました。

一方、連続型では、 長さ・時間・重さなどのように、 値と値の間にも無数の値が存在します。

離散型
1つの値に確率を与える
\(P(X=x)\)
連続型
区間の面積で確率を考える
確率密度関数 \(f(x)\) の下の面積
\[ P(a\le X\le b) = \int_a^b f(x)\,dx \]
連続型では、確率密度関数そのものではなく、 曲線の下の面積が確率を表します

今回は、 一様分布・正規分布・指数分布 の3つを整理します。

ここがポイント
連続型では、 1点の確率ではなく「区間の面積」で確率を考える
STEP 02

一様分布を理解する

最初に見るのが、 一様分布です。

一様分布では、 区間 \([a,b]\) の中で 確率密度が一定 になっています。

「どの値も同じ確率」ではありません
連続型では1点の確率は0です
一様分布では、同じ長さの区間なら同じ確率になります

区間 \([a,b]\) の中では高さが一定なので、 確率密度関数は

一様分布の確率密度関数
\[ f(x)= \begin{cases} \dfrac{1}{b-a} & (a\le x\le b)\\ 0 & (\text{それ以外}) \end{cases} \]

では、 なぜ区間内の高さが \(\frac{1}{b-a}\) になるのでしょうか。

連続型確率分布では、 確率密度関数の下の面積全体が1 になる必要があります。

一様分布では、 区間 \([a,b]\) の中が一定の高さなので、 分布全体は長方形になります。

長方形の面積を1にする
横の長さ
\(b-a\)
×
高さ
\(h\)

1

したがって、 高さ \(h\) について解けば、

\[ (b-a)h=1 \] \[ h=\frac{1}{b-a} \]

となります。

つまり、 区間の幅が広くなるほど高さは低くなり、 区間の幅が狭くなるほど高さは高くなる わけです。

区間 \([-1,1]\) の一様分布
-1 1 高さ 1/2 幅 2 × 高さ 1/2 = 面積 1

この例では、 \(a=-1,\;b=1\) なので、 区間の幅は

\[ b-a=1-(-1)=2 \]

です。 したがって、 確率密度の高さは

\[ \frac{1}{b-a} = \frac12 \]

となり、 幅2、高さ \(\frac12\) の長方形なので、 全体の面積は1になります。

一様分布は英語で uniform distribution といいます。

\[ X\sim U(a,b) \]

パラメータは、 区間の両端を表す \(a\) と \(b\) です。

期待値
\[ E[X]=\frac{a+b}{2} \]
分散
\[ V[X]=\frac{(b-a)^2}{12} \]

期待値が \(\frac{a+b}{2}\) になるのは、 一様な長方形のちょうど中央が 分布の中心になると考えると分かりやすいでしょう。

ここがポイント
一様分布の高さが \(\frac{1}{b-a}\) なのは、 幅 \(b-a\) の長方形の面積を1にするため
STEP 03

正規分布を理解する

次に見るのが、 統計学で非常に重要な 正規分布です。

正規分布は英語で normal distribution といいます。

多数の小さなランダムな影響が積み重なるような現象では、 正規分布に近い形が現れることがあります。

また、後で学ぶ中心極限定理によって、 一定の条件のもとでは、 多数の確率変数の和や平均の分布が 正規分布に近づいていくことが知られています。

正規分布の基本形
μ
平均 \(\mu\) を中心に左右対称

正規分布の形を決めるのは、 平均 \(\mu\)分散 \(\sigma^2\) の2つです。

まず、 平均 \(\mu\) を変えるとどうなるでしょうか。

平均 \(\mu\) を変える
μ₁ μ₂
平均が変わると、分布の形はそのまま左右へ移動する

一方、 分散 \(\sigma^2\) を変えると、 分布の広がりが変化します。

分散 \(\sigma^2\) を変える
μ
分散が小さい → 細く高い
分散が大きい → 広く低い
平均 \(\mu\)
分布の中心を決める
分散 \(\sigma^2\)
分布の広がりを決める
\[ X\sim N(\mu,\sigma^2) \]
正規分布の確率密度関数
\[ f(x) = \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left\{ -\frac{(x-\mu)^2}{2\sigma^2} \right\} \]

この式をそのまま暗記する必要はありません。

重要なのは、 分布ごとに変化するパラメータが \(\mu\) と \(\sigma^2\) だということです。

期待値
\(E[X]=\mu\)
分散
\(V[X]=\sigma^2\)
ここがポイント
平均 \(\mu\) は中心を動かし、 分散 \(\sigma^2\) は広がりを変える
STEP 04

標準正規分布へ変換する

正規分布の中でも、 特に重要なのが 標準正規分布です。

標準正規分布とは、 平均0、分散1 の正規分布です。

\[ Z\sim N(0,1) \]

一般の正規分布 \(X\sim N(\mu,\sigma^2)\) は、次の変換によって標準正規分布へ変えることができます。

標準化
\[ Z=\frac{X-\mu}{\sigma} \]
標準化の前
μ
平均 \(\mu\)、標準偏差 \(\sigma\)
平均を引く
標準偏差で割る
標準化の後
0
平均0、標準偏差1

まず、 \(X\) から平均 \(\mu\) を引くことで、 分布の中心を0へ移します。

平均を引く
\(X-\mu\)
中心:\(\mu\rightarrow0\)

次に、 標準偏差 \(\sigma\) で割ることで、 ばらつきの尺度を1へそろえます。

標準偏差で割る
\(\dfrac{X-\mu}{\sigma}\)
標準偏差:\(\sigma\rightarrow1\)

実際に期待値を確認すると、

\[ E[Z] = \frac{E[X]-\mu}{\sigma} = 0 \]

また、標準偏差は

\[ SD(Z) = \frac{\sigma}{\sigma} = 1 \]

なので、分散も

\[ V[Z]=1^2=1 \]

となります。

標準化の合言葉
平均を引く

標準偏差で割る

この標準化は、 このあとの区間推定や仮説検定でも 繰り返し使う重要な考え方です。

ここがポイント
\(Z=(X-\mu)/\sigma\)
中心を0、標準偏差を1へそろえる
STEP 05

指数分布を理解する

最後に見るのが、 指数分布です。

指数分布は、 ある事象が一定の割合で発生するとき、 次の発生までどれくらい時間がかかるか を表す分布です。

ここで思い出したいのが、 前のレクチャーで学んだ ポアソン分布です。

同じ発生現象を違う視点で見る
一定期間に
「何回起こった?」
ポアソン分布
次に起こるまで
「どれくらい待った?」
指数分布

ポアソン分布では 発生回数を数えましたが、 指数分布では 発生までの待ち時間を考えます。

\(\lambda\) は、 単位時間あたりの平均発生回数 を表します。

指数分布の確率密度関数
\[ f(x)=\lambda e^{-\lambda x}, \qquad x\ge0 \]

指数分布は英語で exponential distribution といいます。

\[ X\sim\mathrm{Exp}(\lambda) \]

たとえば、 \(\lambda=0.5\) の指数分布は 次のような形になります。

\(\lambda=0.5\) の指数分布
0 λ 待ち時間 x
0付近で確率密度が高く、
待ち時間が長くなるほどなめらかに減少する

\(x=0\) のとき、 確率密度は

\[ f(0)=\lambda \]

となります。

つまり、 待ち時間が短いところほど確率密度が高く、 待ち時間が長くなるほど確率密度は小さくなる という形です。

「\(X=0\) の確率が最大」ではありません
指数分布は連続型なので、 \(P(X=0)=0\) です
\(x=0\) 付近の確率密度が最も高いと考えます

また、 指数分布は前に学んだ 幾何分布とも似た役割を持っています。

幾何分布
初成功までの「試行回数」
離散的な待ち
指数分布
次の発生までの「時間」
連続的な待ち

指数分布の期待値と分散は、

期待値
\[ E[X]=\frac1\lambda \]
分散
\[ V[X]=\frac1{\lambda^2} \]

たとえば、 1時間に平均2回発生するなら、 \(\lambda=2\) なので、 次の発生までの平均待ち時間は \(\frac12\) 時間です。

ここがポイント
ポアソン分布は「発生回数」、 指数分布は「次の発生までの待ち時間」
STEP 06

3つの連続型確率分布を整理する

最後に、 今回学んだ3つの分布を 何を表しているのか という視点で整理しましょう。

一様分布
区間内で確率密度が一定
\(X\sim U(a,b)\)
正規分布
平均を中心とする左右対称な分布
\(X\sim N(\mu,\sigma^2)\)
指数分布
次の発生までの待ち時間
\(X\sim\mathrm{Exp}(\lambda)\)
特に重要
\(X\sim N(\mu,\sigma^2)\)

平均を引く

標準偏差で割る

\(Z\sim N(0,1)\)
ここがポイント
正規分布を見たら、 \(Z=(X-\mu)/\sigma\) による標準化をセットで思い出す
SUMMARY

連続型確率分布を整理する

一様分布
表記:\(U(a,b)\)
特徴:区間内で確率密度が一定
期待値:\(\dfrac{a+b}{2}\)
分散:\(\dfrac{(b-a)^2}{12}\)
正規分布
表記:\(N(\mu,\sigma^2)\)
特徴:平均を中心に左右対称
期待値:\(\mu\)
分散:\(\sigma^2\)
指数分布
表記:\(\mathrm{Exp}(\lambda)\)
特徴:次の発生までの待ち時間
期待値:\(\dfrac1\lambda\)
分散:\(\dfrac1{\lambda^2}\)
標準正規分布への変換
\[ Z=\frac{X-\mu}{\sigma} \]
平均を引く

標準偏差で割る

平均0・分散1
これまでの分布とのつながり
ポアソン分布 → 一定期間の発生回数
指数分布 → 次の発生までの待ち時間

幾何分布 → 離散的な待ち回数
指数分布 → 連続的な待ち時間
最後に
連続型では「確率密度」と「面積」を意識する
特に正規分布の標準化 \(Z=(X-\mu)/\sigma\) は重要
NEXT STEP

次のステップ:統計検定®2級を目指す

このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。

統計検定®2級対策講座【ベストセラー版】

約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。

約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ

記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。

統計学ベーシック講座を見る →