最終更新日:2026年9月23日
gk machine_learning
まず結論
特徴量選択(Feature Selection)は、元の特徴量の中から必要な特徴量を選んで残す前処理です。
G検定では、まず次を切り分けます。
- 元の特徴量から選ぶ → 特徴量選択
- 元の特徴量を組み合わせて新しい軸へ変換 → PCAなどの次元削減
さらに特徴量選択は、
- Filter法
- Wrapper法
- Embedded法
の3つで整理すると覚えやすくなります。
直感的な説明
特徴量が100個あるとき、
100個を別の10軸へ作り直す
のが次元削減です。
一方、
元の100個から、本当に役立つ10個を選ぶ
のが特徴量選択です。
元の特徴名を残しやすいため、解釈性を保ちたいときにも役立ちます。
定義・仕組み
Filter法
モデルを学習する前に、統計量などを使って特徴量を評価します。
例:
- 相互情報量
- 相関
- 分散
相互情報量は、非線形な依存関係も捉えられる代表的な評価尺度です。
Wrapper法
特徴量の組合せごとにモデルを学習し、実際の予測性能を使って特徴量集合を評価します。
代表例には、
- 前進選択
- 後退消去
- Recursive Feature Elimination(RFE)
などがあります。
モデルを何度も学習するため、Filter法より計算量が大きくなりやすい点に注意します。
Embedded法
モデルの学習そのものに特徴量選択の仕組みが組み込まれています。
例:
- L1正則化で一部の係数を0に近づける
- 決定木系モデルの分割で利用される特徴量
「学習の外で選ぶ」のではなく、モデル学習と同時に選択されるのがポイントです。
いつ使う?(得意・不得意)
特徴量選択は、
- 不要・冗長な特徴量が多い
- サンプル数に対して特徴量数が多い
- モデルを軽量化したい
- 解釈しやすい特徴量を残したい
- 次元の呪いを緩和したい
場面で使われます。
ただし、特徴量を減らせば必ず精度が上がるわけではありません。重要な情報まで捨てると性能が下がります。
G検定ひっかけポイント
特徴量選択=PCA?
❌ 元の特徴を混ぜて新しい軸を作る
⭕ 元の特徴量から必要なものを選ぶ
Filter法
❌ モデルを何度も学習して性能比較
⭕ 統計量などでモデルとは独立に評価
Wrapper法
❌ 学習とは無関係な統計量だけで選ぶ
⭕ 特徴量集合ごとにモデル性能を評価
Embedded法
❌ 前処理として完全に独立して選ぶ
⭕ モデル学習の中に選択が組み込まれる
まとめ(試験直前用)
- 特徴量選択=元の特徴から選ぶ
- Filter=統計量で選ぶ
- Wrapper=モデル性能で選ぶ
- Embedded=モデル学習の中で選ぶ
- PCA=新しい軸へ変換する次元削減
- 高次元対策では特徴量選択と次元削減を使い分ける