スマホで統計学

22

2つの確率変数の計算

ここでは、2つの確率変数 \(X,Y\) を同時に考えます。和や差の期待値・分散はどのように計算するのか。そして、2つの変数の関係を表す共分散・相関係数とは何か。特に、分散の計算に共分散が現れる理由を整理していきます。
このページのゴール

2つの確率変数の和・差について期待値と分散を計算し、共分散・相関係数・独立性の関係を説明できるようになる

STEP 01

2つの確率変数をイメージする

ここでは、 2つの確率変数 \(X,Y\) を同時に考えます。

たとえば、 次の2つの確率変数があるとします。

\(X\sim N(0,1)\)
平均0・分散1
\(Y\sim N(1,4)\)
平均1・分散4
X Y 平均0 平均1

今回考えるのは、 この2つから作った \(X+Y\) や \(X-Y\) です。

\(X\)
平均0
分散1
\(Y\)
平均1
分散4
\(X+Y\) や \(X-Y\)
の期待値・分散を考える

ここで重要なのが、 それぞれの性質だけでなく、 2つがどのように関係しているか も見ることです。

それぞれを見る
期待値・分散
2つの関係を見る
共分散・相関係数・独立性
ここがポイント
2つの確率変数では、 「それぞれ」と「2つの関係」の両方を見る
STEP 02

和と差の期待値を計算する

まずは、 2つの確率変数の 期待値です。

期待値は、 分布の 中心 と考えることができます。

そこで、 \(X\) と \(Y\) の中心を 足し合わせるイメージで考えてみましょう。

\(X\) の中心
0
\(Y\) の中心
1
\(X+Y\) の中心
1

数式では、

\[ E[X+Y] = E[X]+E[Y] \]

なので、

\[ E[X+Y] = 0+1 = 1 \]

となります。

差の場合も同じです。

\(X\) の中心
0
\(Y\) の中心
1
\(X-Y\) の中心
−1
\[ E[X-Y] = E[X]-E[Y] = -1 \]

期待値では、 \(X\) と \(Y\) が独立かどうかを 気にする必要はありません。

中心を足せば、中心も足される
中心を引けば、中心も引かれる
一般にはどう表す?

期待値には 線形性があります。

\[ E[aX+bY] = aE[X]+bE[Y] \]

この性質には、 \(X\) と \(Y\) の独立性は必要ありません。

ここがポイント
期待値は「分布の中心」
\(E[X\pm Y]=E[X]\pm E[Y]\)
STEP 03

和と差の分散を計算する

次は、 分散です。

期待値とは違い、 分散では \(X\) と \(Y\) の 一緒に動く度合い が効いてきます。

\(X\uparrow\) \(Y\uparrow\)
足す

動きが重なる

ばらつきが大きくなる
\(X\uparrow\) \(Y\uparrow\)
引く

動きが打ち消される

ばらつきが小さくなる

この 「一緒に動く度合い」 を表すのが、 共分散です。

\[ V[X+Y] = V[X]+V[Y] +2\operatorname{Cov}(X,Y) \]
\[ V[X-Y] = V[X]+V[Y] -2\operatorname{Cov}(X,Y) \]

数字を入れて、 この意味を確認してみましょう。

STEP01では、

\[ V[X]=1,\qquad V[Y]=4 \]

でした。

まず、 たとえば

\[ \operatorname{Cov}(X,Y)=1 \]

とします。

\(\operatorname{Cov}(X,Y)=1\) のとき
\(X-Y\)
3
\(X+Y\)
7

共分散が正のとき、 \(X\) と \(Y\) は同じ方向に動きやすいため、 和ではばらつきが大きくなり、 差ではばらつきが小さくなります

一方、 共分散が0なら、

\(\operatorname{Cov}(X,Y)=0\) のとき
\(X-Y\)
5
\(X+Y\)
5

この場合は、 共分散の項がなくなるので、

\[ V[X+Y]=1+4=5 \] \[ V[X-Y]=1+4=5 \]

となります。

つまり、 \(X\) と \(Y\) それぞれの分散が同じでも、 共分散の値によって、 和や差のばらつきは変わる ということです。

差でも \(V[X]-V[Y]\) にはなりません
\(Y\) の符号を反転させても、 \(Y\) 自身のばらつきの大きさは変わらないため、 \(V[Y]\) は足されます
和の分散の公式を導出する
\[ V[X+Y] = E[ \{(X-E[X])+(Y-E[Y])\}^2 ] \]

二乗を展開すると、

\[ = E[(X-E[X])^2] + E[(Y-E[Y])^2] + 2E[(X-E[X])(Y-E[Y])] \]

それぞれが分散と共分散なので、

\[ V[X+Y] = V[X]+V[Y] +2\operatorname{Cov}(X,Y) \]
一般の \(aX+bY\) では?
\[ V[aX+bY] = a^2V[X] + b^2V[Y] + 2ab\operatorname{Cov}(X,Y) \]

\(X-Y\) の場合は、 \(a=1,\;b=-1\) です。

\[ (-1)^2V[Y]=V[Y] \]

そのため、 \(V[Y]\) はプラスのままです。

一方で、 共分散の項には \(2ab\) があるので、 \(b=-1\) とすると符号がマイナスになります。

ここがポイント
分散では、 それぞれのばらつきだけでなく 「一緒に動く度合い」も考える
STEP 04

共分散を理解する

STEP03で登場した 共分散を、 もう少し詳しく見ていきましょう。

共分散は、 記述統計でも一度登場しました。

記述統計での共分散
実際のデータについて、
「xの偏差 × yの偏差」を平均したもの
確率変数での共分散
確率変数について、
「Xの偏差 × Yの偏差」の期待値をとる
\[ \operatorname{Cov}(X,Y) = E[(X-\mu_X)(Y-\mu_Y)] \]
\(\mu_X=E[X]\)、\(\mu_Y=E[Y]\) です。

見た目は少し変わりましたが、 考え方は記述統計の共分散と同じです。

\(X-\mu_X\) は \(X\) の平均からの偏差、 \(Y-\mu_Y\) は \(Y\) の平均からの偏差です。

そして重要なのが、 2つの偏差の 符号の組み合わせです。

4象限で見る「偏差の積」の符号
\(X-\mu_X\)(−)
×
\(Y-\mu_Y\)(+)
共分散をマイナスへ
\(X-\mu_X\)(+)
×
\(Y-\mu_Y\)(+)
共分散をプラスへ
\(X-\mu_X\)(−)
×
\(Y-\mu_Y\)(−)
共分散をプラスへ
\(X-\mu_X\)(+)
×
\(Y-\mu_Y\)(−)
共分散をマイナスへ
2つの偏差の符号が同じなら積はプラス、 符号が異なれば積はマイナスになります。

つまり、 \(X\) と \(Y\) が平均から 同じ方向にずれることが多ければ、 共分散は正になりやすくなります。

反対に、 一方が平均より大きいときに もう一方が平均より小さくなることが多ければ、 共分散は負になりやすくなります。

正の共分散
Xが大きいとき
Yも大きい傾向
負の共分散
Xが大きいとき
Yは小さい傾向

また、 プラスとマイナスの偏差の積が 全体として打ち消し合えば、 共分散は0に近づきます。

同じ方向のずれが優勢 → 共分散は正
反対方向のずれが優勢 → 共分散は負
全体として打ち消し合う → 共分散は0付近

共分散には、 計算でよく使うもう1つの公式があります。

\[ \operatorname{Cov}(X,Y) = E[XY]-E[X]E[Y] \]
「積の期待値 − 期待値の積」と覚えると整理しやすい式です。
なぜ \(\operatorname{Cov}(X,Y)=E[XY]-E[X]E[Y]\) になる?

共分散の定義から始めます。

\[ \operatorname{Cov}(X,Y) = E[(X-\mu_X)(Y-\mu_Y)] \]

カッコの中を展開すると、

\[ = E[ XY-\mu_YX-\mu_XY+\mu_X\mu_Y ] \]

期待値の線形性を使うと、

\[ = E[XY] -\mu_YE[X] -\mu_XE[Y] +\mu_X\mu_Y \]

\(E[X]=\mu_X,\;E[Y]=\mu_Y\) なので、

\[ \operatorname{Cov}(X,Y) = E[XY]-E[X]E[Y] \]
\(X\) と \(X\) 自身の共分散は?

\(Y\) を \(X\) に置き換えると、

\[ \operatorname{Cov}(X,X) = E[(X-\mu_X)^2] \]

これは分散の定義そのものなので、

\[ \operatorname{Cov}(X,X) = V[X] \]

となります。

ここがポイント
記述統計でも確率変数でも考え方は同じ
共分散は「2つの偏差の積」を平均したもの
STEP 05

相関係数を理解する

共分散は、 2つの確率変数が 一緒に動く方向を表します。

ただし、 共分散の大きさは 変数の単位や尺度 の影響を受けます。

共分散
単位や尺度の影響を受ける
\(X\) の標準偏差で割る
\(Y\) の標準偏差で割る
相関係数
\[ \rho_{XY} = \frac{ \operatorname{Cov}(X,Y) }{ \sigma_X\sigma_Y } \]

標準化することで、 相関係数は \(-1\) から \(1\) の範囲に収まります。

−1
0
+1
反対方向
無相関
同じ方向

つまり、 相関係数は 共分散を共通のモノサシに乗せたもの と考えるとよいでしょう。

\[ \operatorname{Cov}(X,Y)=0 \Longleftrightarrow \rho_{XY}=0 \]

相関係数が0の状態を 無相関 といいます。

相関係数0は「何の関係もない」という意味ではありません
表しているのは、 線形的な相関がないということです
ここがポイント
相関係数は、 共分散を標準化して \(-1\)〜\(1\) のモノサシにしたもの
STEP 06

独立な確率変数を整理する

最後に、 2つの確率変数の 独立性 を整理します。

\(X\) と \(Y\) が独立なら、 積の期待値について

\[ E[XY]=E[X]E[Y] \]

が成り立ちます。

ここから、 独立と共分散・相関係数の関係を 一続きで見ることができます。

独立
\(E[XY]=E[X]E[Y]\)
\(\operatorname{Cov}(X,Y)=0\)
無相関
矢印は一方向です

独立 \(\Rightarrow\) 無相関
無相関 \(\not\Rightarrow\) 独立

そして、 共分散が0になるので、 STEP03の分散の公式も簡単になります。

独立
\(\operatorname{Cov}(X,Y)=0\)
\(V[X+Y]=V[X]+V[Y]\)
\(V[X-Y]=V[X]+V[Y]\)

STEP01の例なら、

\[ V[X]=1,\qquad V[Y]=4 \]

なので、 \(X\) と \(Y\) が独立なら

\[ V[X+Y]=1+4=5 \] \[ V[X-Y]=1+4=5 \]
「共分散を考えない」のではなく
「共分散が0だから消えている」

問題文に 「互いに独立」と書かれているときも、 目には見えない 共分散0 が入っていると考えると整理しやすくなります。

ここがポイント
独立なら共分散0
だから和でも差でも分散をそのまま足せる
SUMMARY

2つの確率変数の計算を整理する

期待値
分布の中心をそのまま足し引きする
分散
それぞれのばらつきに加えて共分散も考える
共分散
2つの偏差が同じ方向か反対方向かを見る
相関係数
共分散を標準化して −1〜1で表す
独立
独立なら\(\operatorname{Cov}(X,Y)=0\)
重要公式
\[ E[X\pm Y] = E[X]\pm E[Y] \]
\[ V[X\pm Y] = V[X]+V[Y] \pm2\operatorname{Cov}(X,Y) \]
\[ \operatorname{Cov}(X,Y) = E[XY]-E[X]E[Y] \]
独立 ⇒ 無相関 は成り立ちますが、 無相関 ⇒ 独立 は一般には成り立ちません
最後に
期待値は「中心」を足し引きする
分散では「一緒に動く度合い」を忘れない
NEXT STEP

次のステップ:統計検定®2級を目指す

このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。

統計検定®2級対策講座【ベストセラー版】

約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。

約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ

記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。

統計学ベーシック講座を見る →