スマホで統計学

28

調査研究手法

母集団について正しく推測するためには、どのようにデータを集めるかが重要です。このレクチャーでは、実験研究におけるフィッシャーの3原則と、標本調査における代表的な抽出方法を、「偏り」と「ばらつき」という視点から整理します。
このページのゴール

無作為化・繰り返し・局所管理の役割を区別し、単純無作為抽出・系統抽出・層化無作為抽出・多段抽出・クラスター抽出の違いを模式図から説明できるようになる。

STEP 01

調査では「偏り」と「ばらつき」を考える

母集団について正しく推測するためには、 どのようにデータを集めるのか が重要です。

そのときに意識したいのが、 偏りばらつきです。

偏り
特定の方向にずれていないか?
バイアス・系統誤差
ばらつき
偶然によって結果が変動していないか?
変動・分散・偶然誤差
偏りがある
一方向にずれる
ばらつきが大きい
あちこちに散らばる

調査研究では、この偏りやばらつきをできるだけ小さくしたり、 その大きさを把握したりすることが重要になります。

ここがポイント
調査研究では「偏りを抑えること」と 「偶然のばらつきを把握すること」の両方が重要。
STEP 02

実験研究では2つの群を比べる

実験研究では、 対象を実験群と対照群に分け、 その結果の差を比較します。

実験群には、薬の投与などの 処理・介入を行います。

実験対象
↓ 分ける
実験群
処理・介入
対照群
比較対象
2つの群の差を測定する

ただし、単に2つの群を作るだけでは、 その差が本当に処理によるものなのか判断できません。

そこで重要になるのが、 フィッシャーの3原則です。

① 無作為化
② 繰り返し
③ 局所管理
ここがポイント
実験研究では「処理以外の違い」をできるだけ取り除くことが重要。
STEP 03

無作為化で偏りを抑える

フィッシャーの3原則の1つ目が、 無作為化です。

無作為化の目的は、 処理以外の条件による偏りを抑えること です。

悪い例:性別で割り付ける
男性
新薬
女性
既存薬
薬の違いと性別の違いが混ざってしまう
無作為化:ランダムに割り付ける
男性・女性・年代などを区別せず
対象者
新薬
既存薬
ランダムに割り付ける
処理以外の条件が特定の群に偏りにくい
バイアス・系統誤差を抑える
ここがポイント
無作為化のねらいは、不要な「偏り」を抑えること。
STEP 04

繰り返しで偶然のばらつきを見積もる

2つ目の原則が、 繰り返しです。

実験結果には、 処理の効果とは関係なく、 偶然によるばらつきも生じます。

1人ずつしか調べない
新薬
効果 8
既存薬
効果 5
この差は薬の効果?
それとも、その人に偶然起きただけ?
複数人で繰り返す
新薬
8・6・9・7・5
既存薬
5・4・7・3・6
結果がどの程度ばらつくのかも見えてくる
実験を繰り返す
偶然によるデータのばらつきが見える
偶然誤差の大きさを見積もれる

偶然のばらつきがどの程度あるのかがわかれば、 それを超える差が処理によって生じているのかを判断しやすくなります。

ここがポイント
繰り返しのねらいは、偶然による「ばらつき」を見積もること。
STEP 05

局所管理で余計な違いを小さくする

3つ目の原則が、 局所管理です。

処理以外にも結果へ影響しそうな条件がある場合、 その条件が似た対象どうしを ブロックにまとめます。

投与環境が違う場合
病院
新薬
既存薬
自宅
新薬
既存薬

このように、 投与環境が同じ対象どうしで比較することで、 環境の違いによる影響を小さくできます。

条件が似た対象でブロックを作る
ブロック内で処理を比較する
処理以外の違いを小さくする
ここがポイント
局所管理のねらいは、 処理効果以外の「偏り」をなるべく小さくすること。
STEP 06

フィッシャーの3原則を整理する

ここまでの3つを、 何を目的としているのかで整理しておきましょう。

無作為化
不要な偏りを抑える
繰り返し
偶然によるばらつきを見積もる
局所管理
処理以外による偏りを小さくする
系統誤差
特定方向への偏り
偶然誤差
ランダムな変動

この「偏り」と「ばらつき」を区別する考え方は、 統計学だけでなく、機械学習などでも重要になります。

ここがポイント
無作為化と局所管理は「偏り」へ、 繰り返しは「ばらつき」へ働きかける。
STEP 07

標本調査ではどうやって抽出する?

次は、 標本調査です。

標本調査では、 母集団から一部の標本を抽出して、 その標本から母集団について推測します。

母集団
↓ 標本抽出
標本
母集団を推測

代表的な標本抽出法には、 次の5つがあります。

単純無作為抽出
系統抽出
層化無作為抽出
多段抽出
クラスター抽出
STEP 08

単純無作為抽出と系統抽出

まず、 単純無作為抽出は、 母集団から完全にランダムに標本を選ぶ方法です。

単純無作為抽出
どの対象もランダムに選ばれる

理論的にはわかりやすい方法ですが、 母集団が大きいと、実際に完全なランダム抽出を行うのは 労力や費用の面で難しい場合があります。

そこで使われる方法の1つが、 系統抽出です。

系統抽出
1 2 3 4 5 6 7 8 9 10
最初の対象をランダムに決め、
その後は一定間隔で抽出
ここがポイント
単純無作為抽出は「完全ランダム」。 系統抽出は「最初だけランダム、その後は等間隔」。
STEP 09

層に分けてからランダムに抽出する

層化無作為抽出では、 母集団をいくつかのに分け、 それぞれの層からランダムに標本を抽出します。

20代
30代
↓ 各層から抽出
どの層も標本に含まれる

たとえば性別や年代などで層を分けておけば、 特定の層だけが標本から抜け落ちるのを防ぎやすくなります。

また、似た特徴をもつ対象を同じ層にまとめることで、 層内のばらつきを小さくし、 推定精度を高められる場合があります。

ここがポイント
層化無作為抽出は「層に分けて、各層からランダム抽出」。
STEP 10

多段抽出とクラスター抽出を区別する

最後に、 多段抽出クラスター抽出を見ていきます。

多段抽出

多段抽出では、 ランダムな標本抽出を 何段階かに分けて行います。

全国
↓ 市区町村を抽出
A市 B市
↓ 高校を抽出
高校1 高校2
↓ 生徒を抽出
調査対象

調査対象を段階的に絞れるため、 全国に散らばった対象を1人ずつ探すより、 調査を効率化できます。

ただし、段階を重ねるほど、 最終的な標本に含まれない地域や集団も増えるため、 推定精度とのバランスが重要です。

クラスター抽出

クラスター抽出では、 母集団を小集団に分け、 抽出したクラスターの中は全数調査します。

高校A
○ ○ ○
○ ○ ○
高校B
● ● ●
● ● ●
高校C
○ ○ ○
○ ○ ○
↓ 高校Bを抽出
高校Bの全生徒を調査

クラスター単位で調査できるため便利ですが、 抽出するクラスターが少ないと、 特定のクラスターの特徴に結果が左右されやすくなります。

多段抽出
各段階で
さらに抽出する
クラスター抽出
抽出した集団は
全数調査する
ここがポイント
多段抽出は「何段階も抽出」。 クラスター抽出は「選んだクラスターを全数調査」。
SUMMARY

調査研究手法を整理する

無作為化
不要な偏りを抑える
繰り返し
偶然のばらつきを見積もる
局所管理
処理以外の違いを小さくする
無作為・系統
個体をランダムまたは等間隔に抽出
層化・多段・集落
母集団の構造を利用して効率よく抽出
調査研究で考える2つのこと
偏りを抑える
ばらつきを把握する
最後に
「どう分析するか」の前に、 「どうデータを集めたか」を考える。
良い推測は、良い調査設計から始まる。
NEXT STEP

次のステップ:統計検定®2級を目指す

このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。

統計検定®2級対策講座【ベストセラー版】

約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。

約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ

記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。

統計学ベーシック講座を見る →