50
一元配置分散分析の概要
一元配置分散分析のデータ構造と、平方和の分解を理解する。
一元配置分散分析は「1つの質的変数」の影響を見る
このレクチャーでは、 一元配置分散分析 の全体像を確認します。
一元配置分散分析では、 1つの質的変数が、 被説明変数 \(y\) をどの程度説明できるかを考えます。
どれくらい説明できるか
そして、 質的変数がとるそれぞれの値を、 分散分析では 水準 と呼びます。
まずは一元配置データの記号を確認する
一元配置分散分析では、 独特な添え字を使ってデータを表すことがあります。
まずは、 記号の意味を整理しておきましょう。
| 水準 | データの大きさ | 観測値 | 平均 |
|---|---|---|---|
| \(A_1\) | \(n_1\) | \(y_{11},y_{12},\ldots,y_{1n_1}\) | \(\bar y_{1\cdot}\) |
| \(A_2\) | \(n_2\) | \(y_{21},y_{22},\ldots,y_{2n_2}\) | \(\bar y_{2\cdot}\) |
| ⋮ | ⋮ | ⋮ | ⋮ |
| \(A_a\) | \(n_a\) | \(y_{a1},y_{a2},\ldots,y_{an_a}\) | \(\bar y_{a\cdot}\) |
| 全体平均 | \(\bar y_{\cdot\cdot}\) | ||
水準は \(A_1,A_2,\ldots,A_a\) と表し、 全部で \(a\) 個の水準があると考えます。
また、 水準 \(A_j\) に含まれるデータ数を \(n_j\) と表します。
各水準のデータ数 \(n_1,n_2,\ldots,n_a\) は、 必ずしも同じである必要はありません。
\(y_{ji}\) の2つの添え字を読む
一元配置分散分析では、 各観測値を
と表します。
このレクチャーでは、 2つの添え字を次のように使います。
どの水準か
その水準の何番目のデータか
3番目の観測値
このレクチャーでは、 \(j\) を水準番号、\(i\) を水準内のデータ番号 としています。
ただし、教科書によっては、 \(i\) を水準番号、\(j\) をデータ番号として 逆の順番で表すこともあります。
そのため、 問題文やテキストの冒頭で、 添え字が何を表しているかを確認するようにしましょう。
\(i\) = その水準内のデータ番号
ドットは「その添え字を全部まとめる」イメージ
平均には、 ドット \(\cdot\) が入った記号が登場します。
\(i\) の部分を全部まとめる
水準 \(j\) の平均
全データの平均
たとえば、
賃貸住宅の例に置き換えてみる
記号だけではイメージしづらいので、 賃貸住宅を例に考えてみましょう。
ここでは、 被説明変数 \(y\) を 家賃 とします。
そして、 家賃を説明する質的変数として 部屋の向き を考えます。
部屋の向き
「東・西・南・北」がそれぞれの水準です。
記号と賃貸住宅の例を対応させる
| 記号 | 意味 | 賃貸住宅の例 |
|---|---|---|
| \(A_j\) | 水準 | 東・西・南・北 |
| \(n_j\) | 水準 \(j\) のデータ数 | その向きの部屋数 |
| \(y_{ji}\) | 水準 \(j\) の \(i\) 番目の観測値 | 各部屋の家賃 |
| \(\bar y_{j\cdot}\) | 水準 \(j\) の平均 | その向きの平均家賃 |
| \(\bar y_{\cdot\cdot}\) | 全体平均 | 全部屋の平均家賃 |
ここまで対応関係を整理できれば、 一元配置分散分析のデータ構造がかなり見やすくなります。
一元配置分散分析では「ばらつき」を分解する
ここからが、 一元配置分散分析の中心です。
まず、 各部屋の家賃 \(y_{ji}\) は、 全体平均 \(\bar y_{\cdot\cdot}\) からずれています。
この 全体平均からのズレ を、 2つのズレに分けて考えます。
この分解が、 このあと平方和を分解する考え方のもとになります。
総平方和 \(S_T\):もともとの \(y\) 全体のばらつき
まず、 すべての観測値について 全体平均からのズレを二乗して足したものが、 総平方和 です。
家賃 \(y\) 全体が、
全体平均家賃からどれくらいばらついているか
水準間平方和 \(S_A\):水準によって説明できるばらつき
次に、 各水準の平均と 全体平均の差に注目します。
各水準の平均が 全体平均から大きく離れているほど、 \(S_A\) は大きくなります。
水準の違いによって
どれくらい \(y\) の違いを説明できるか
賃貸住宅の例なら、 部屋の向きによって平均家賃がどれくらい違うか を表す平方和です。
水準内平方和 \(S_e\):水準では説明できなかったばらつき
同じ水準の中でも、 個々の観測値は 水準平均と完全には一致しません。
その水準内に残ったばらつきを表すのが、 水準内平方和 です。
同じ水準の中に残っているばらつき
= 水準では説明できなかったばらつき
回帰分析でいう 残差平方和 に対応するイメージです。
総平方和は「水準間+水準内」に分解できる
ここまでの3つの平方和をまとめると、
したがって、 一元配置分散分析では、 \(S_A\) が大きいほど、 水準の違いによって \(y\) を説明できている と考えます。
一元配置分散分析のモデルを確認する
最後に、 一元配置分散分析が前提としているモデルを確認します。
それぞれの項の意味は、
一般平均
水準 \(j\) の効果
モデルで説明できずに残る誤差
誤差には正規性・独立性・共通の分散を仮定する
一元配置分散分析では、 モデルの誤差 \(\varepsilon_{ji}\) について、
と考えます。
誤差が一方向に偏らない
誤差の確率分布を正規分布として考える
どの水準でも誤差のばらつきは同じと考える
ある観測値の誤差が、別の観測値の誤差に影響しない
この誤差の仮定を土台として、 次のレクチャーでは、 水準による効果が本当に認められるかを 仮説検定していきます。
一元配置分散分析の全体像を整理する
賃貸住宅の例なら、 東向き・西向き・南向き・北向き。
① 水準は質的変数のカテゴリを表す
② 全体のばらつきは、水準間と水準内に分解できる
③ 一元配置モデルでは、誤差に正規性・独立性・共通分散を仮定する
「\(y\) 全体のばらつきのうち、 水準の違いによってどれだけ説明できるか」
を考えることです。
次のステップ:統計検定®2級を目指す
このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。
統計検定®2級対策講座【ベストセラー版】
約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。
記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。
統計学ベーシック講座を見る →