統計学
Statistics
このシリーズについて
統計学はデータから情報を抽出し、不確実性のもとで意思決定を行うための学問である。本シリーズでは、記述統計の基礎から始めて、推測統計、最尤推定、ベイズ統計まで段階的に学習する。
統計学は科学研究、ビジネス分析、機械学習など、データを扱うあらゆる分野で必須の知識となっている。
レベル別学習
学習の流れ
主な学習内容
記述統計
データの整理、代表値、散布度、相関など、データを要約する技法。
推測統計
標本から母集団の特性を推測する、区間推定と仮説検定。
回帰分析
変数間の関係をモデル化し、予測に活用する手法。
ベイズ統計
事前知識とデータを組み合わせて推論を行うベイズ的アプローチ。
個別トピック
GMM(混合ガウスモデル)とは? EMアルゴリズムの完全導出
GMM(Gaussian Mixture Model)の定義・仕組み・応用分野を解説し、EMアルゴリズムによる平均・分散共分散行列・混合比の推定を途中計算を省略せず完全導出する。
前提知識
よくある質問
統計学を学ぶにはどのような前提知識が必要ですか?
入門レベルは、高校数学程度の予備知識(数式の読み方、基本的なグラフの読み方)があれば始められる。初級以上では、連続確率分布の確率密度関数や期待値を積分で扱うため、微分積分の基礎があると望ましい。中級以上では多変量解析のために線形代数も使う。
頻度論的統計とベイズ統計の違いは何ですか?
頻度論的統計では、母数を固定された未知の値として扱い、標本を繰り返し得るという考え方のもとで推定や検定を行う(信頼区間、p 値)。ベイズ統計では、未知の母数についての不確実性を確率分布で表し、事前分布をデータで更新して事後分布を求める(信用区間、事後確率)。違いは「確率」と「未知の母数」の扱い方にあり、「頻度論は客観的でベイズは主観的」という対比ではない。頻度論でもモデルや検定手法・有意水準の選択には分析者の判断が入り、ベイズにも客観ベイズや弱情報事前分布といった考え方がある。
統計学の学習はどの順番で進めるべきですか?
入門(記述統計、データの可視化)→ 初級(確率分布、正規分布、中心極限定理、点推定・区間推定、仮説検定)→ 中級(最尤推定、回帰分析、分散分析、多変量解析)→ 上級(ベイズ統計、漸近理論、EM アルゴリズム、モデル選択)の順に進めるのが効果的である。各レベルは前のレベルの知識を前提としている。