Skip to the content.

最終更新日:2026年8月26日

G検定トップ > ε-greedy方策(epsilon-greedy policy)とは?【G検定対策】

まず結論

ε-greedy方策は、

  • 確率 ε でランダムに行動する → 探索
  • 確率 1−ε で現在もっとも価値が高い行動を選ぶ → 活用

というシンプルな探索戦略です。

G検定では、εと1−εを逆にしないことが最優先です。

直感的な説明

「基本は一番よさそうな選択をする。でも、ときどき別の選択も試す」という考え方です。

いつも同じ行動だけでは、まだ試していない良い行動を見逃すかもしれません。一方で、いつもランダムでは、分かったことを活用できません。

そこでε-greedyは、普段は活用し、εの確率だけ探索することで両者を両立します。

定義・仕組み

ε-greedyは、強化学習や多腕バンディットで使われる行動選択の方法です。

  1. 乱数を使って探索するか活用するか決める
  2. 探索ならランダムな行動を選ぶ
  3. 活用なら現在もっとも価値が高い行動を選ぶ

εは固定する場合もあれば、学習初期は大きく、学習が進むにつれて小さくする場合もあります。

重要なのは、ε-greedy自体がQ値の更新方法ではなく、どの行動を選ぶかという探索戦略だという点です。

いつ使う?(得意・不得意)

  • Q学習などで探索を加えたい
  • 多腕バンディットで探索と活用を両立したい
  • 単純で分かりやすい探索戦略を使いたい

ただし、探索時は候補の不確実性を考慮せずランダムに選ぶため、UCBのような方法より探索効率が悪い場合があります。

G検定ひっかけポイント

  • ❌「εの確率で最良行動を選ぶ」→ 基本形では逆
  • ❌「試行回数が少ない行動を不確実性込みで優先する」→ UCB
  • ❌「ε-greedyはQ値の更新式」→ 行動選択の戦略
  • ⭕「εでランダム探索」→ ε-greedy
  • ⭕「1−εで現在の最良行動を活用」→ ε-greedy

まとめ(試験直前用)

  • ε-greedy=探索と活用を確率で切り替える
  • ε → ランダム探索
  • 1−ε → 現在の最良行動を活用
  • UCBは不確実性も使う
  • 「εで探索」が最重要の判断基準

© 2024-2026 stemtazoo. All rights reserved.