Skip to the content.

最終更新日:2026年9月23日

G検定トップ > ナイーブベイズとは?条件付き独立と分類【G検定対策】

まず結論

ナイーブベイズ(Naive Bayes)は、ベイズの定理を使って、入力データがどのクラスに属しやすいかを計算する教師あり分類手法です。

「ナイーブ」と呼ばれる理由は、

クラスが分かれば、各特徴量は互いに条件付き独立である

という強い単純化を置くためです。

G検定では、ベイズの定理+条件付き独立+分類をセットで覚えます。

直感的な説明

迷惑メール判定で考えます。

メールに、

  • 「無料」
  • 「当選」
  • 「クリック」

などの語が含まれているとします。

ナイーブベイズは、各語が迷惑メールで現れやすい確率と、迷惑メール自体の事前確率を組み合わせて、このメールが迷惑メールである確率が高いかを判断します。

定義・仕組み

ベイズの定理を分類に使うと、考え方は大まかに、

事後確率 ∝ 事前確率 × 尤度

と整理できます。

  • 事前確率:そのクラスがもともとどれくらい出やすいか
  • 尤度:そのクラスなら、観測された特徴がどれくらい出やすいか
  • 事後確率:特徴を見たあと、そのクラスである確率

ナイーブベイズでは、クラスが与えられた条件のもとで各特徴量を独立とみなし、計算を単純化します。

代表的な種類

種類 主な特徴量の想定 代表例
Gaussian Naive Bayes 連続値をガウス分布で扱う センサー値など
Multinomial Naive Bayes 出現回数・頻度 文書中の単語カウント
Bernoulli Naive Bayes 0/1の二値特徴 単語が出た / 出ない

特にMultinomial Naive Bayesは、単語頻度を使う文書分類でよく使われます。

ゼロ頻度と平滑化

学習データで一度も出ていない特徴があると、その確率を0として掛け合わせた結果、全体が0になる問題が起こり得ます。

この対策として、加法平滑化(Laplace smoothingなど)を使うことがあります。

いつ使う?(得意・不得意)

向いている例

  • 文書・メール分類
  • 単語出現など高次元で疎な特徴
  • 確率的にクラスを判断したい

注意点

実際の特徴量は完全に独立とは限りません。

たとえば文章中の単語には強い関係があります。それでも、単純な仮定によって計算が軽く、実用上有効な場合があります。

G検定ひっかけポイント

特徴量は完全に独立?

❌ データ全体で各特徴量が無条件に独立
クラスが与えられたとき条件付き独立と仮定する

ナイーブベイズ=教師なし?

❌ ラベルなしで確率分布を見つける
クラスラベルを使う教師あり分類

Multinomial Naive Bayes

❌ 連続値を必ず正規分布として扱う
カウント・頻度データに対応し、テキスト分類で代表的

ベイズ最適化と同じ?

ベイズ最適化の分類版
ナイーブベイズは確率的分類、ベイズ最適化は目的関数の探索・最適化

まとめ(試験直前用)

  • ナイーブベイズ=ベイズの定理を使う分類手法
  • 特徴量を条件付き独立と仮定
  • Gaussian=連続値
  • Multinomial=カウント・頻度
  • Bernoulli=0/1特徴
  • ゼロ頻度には平滑化を使うことがある
  • ベイズ最適化とは別物

参考資料

© 2024-2026 stemtazoo. All rights reserved.