最終更新日:2026年9月23日
gk machine_learning supervised_learning
G検定トップ
> 決定木とは?条件分岐・Gini不純度・過学習【G検定対策】
まず結論
決定木(Decision Tree)は、「特徴量がしきい値以上か?」のような条件分岐を繰り返して、分類・回帰を行う教師あり学習です。
G検定では、
- 条件分岐
- Gini不純度 / エントロピー
- 過学習
- 剪定
- Random Forestの基本学習器
を押さえます。
直感的な説明
質問を順番に繰り返すフローチャートのイメージです。
たとえば、
- 温度 > 80?
- Yesなら振動 > 5?
- さらにYesなら異常
のように条件を分けていきます。
複雑な非線形関係も、複数の条件分岐で表現できます。
定義・仕組み
分類木
データを分けたときに、各ノードのクラスがなるべく混ざらないように分割します。
代表的な指標:
- Gini不純度
- エントロピー / 情報利得
回帰木
各葉で連続値を予測します。
分割後の二乗誤差などが小さくなるように分割を選びます。
過学習
木を深くしすぎると、訓練データの細かな違いまで覚えてしまうことがあります。
対策には、
- 最大深さを制限
- 葉の最小サンプル数
- 剪定(Pruning)
などがあります。
いつ使う?(得意・不得意)
決定木は、
- 非線形な関係
- 特徴量の相互作用
- 条件分岐を説明したい
場面で使いやすいモデルです。
距離や内積ではなく特徴量のしきい値で分割するため、通常は標準化が必須ではありません。
G検定ひっかけポイント
決定木=分類専用?
❌ 分類しかできない
⭕ 回帰木もある
標準化
❌ SVMと同様に必ず必要
⭕ 通常はしきい値分割なので必須ではない
深いほど良い?
❌ 木を深くすれば必ず汎化性能が上がる
⭕ 過学習しやすくなる
Random Forestとの違い
- 決定木 → 1本の木
- Random Forest → 多数の決定木を統合
まとめ(試験直前用)
- 決定木=条件分岐
- 分類・回帰の両方
- Gini不純度・エントロピー
- 深すぎると過学習
- 剪定などで複雑さを調整
- Random Forestは多数の木