最終更新日:2026年8月26日
gk reinforcement_learning
G検定トップ
> Noisy Netsとは?重みにノイズを入れて探索する強化学習手法【G検定】
まず結論
Noisy Netsは、ニューラルネットワークの重みやバイアスにパラメータ化されたノイズを加え、強化学習の探索を促す手法です。
G検定では、どこにランダム性を入れるかで切り分けます。
| 手法 | ランダム性を加える場所 | 主な目的 |
|---|---|---|
| Noisy Nets | モデルの重み・バイアス | 探索を促す |
| ε-greedy | 選択する行動 | 一定確率で探索する |
| データ拡張 | 入力データ | 汎化性能を高める |
| Dropout | ユニットの出力 | 過学習を抑える |
直感的な説明
ε-greedyは、
「一定確率でランダムな行動を選ぶ」
方法です。
Noisy Netsはそうではなく、
行動価値を計算するネットワーク自体を少し揺らす
ことで、選ばれる行動に変化を生みます。
つまり、探索のランダム性を行動選択ルールの外側から足すのではなく、ネットワーク内部へ組み込むのが特徴です。
定義・仕組み
Noisy Netsでは、全結合層などのパラメータを、決定的な成分とノイズ成分に分けて扱います。
- 重みやバイアスへノイズを加える
- ノイズの大きさに関するパラメータも学習する
- Q値などの出力が変化し、結果として探索行動が生まれる
このため、DQN系で明示的なε-greedyの代わりに利用されることがある手法です。
「探索と活用を必ず最適に自動調整する」「どんな環境でもε-greedyより優れる」という意味ではありません。
Rainbowとの関係
Noisy Netsは、DQNの複数の改良を組み合わせたRainbowの構成要素の1つです。
RainbowではNoisy Netsが主に探索を担当し、Double DQNやPrioritized Experience Replayなどは別の弱点を改善します。
いつ使う?(得意・不得意)
主に次のような場面で使われます。
- DQN系の深層強化学習
- 探索方法をネットワーク内部に組み込みたい場合
- RainbowのようなDQN改良手法
注意点として、Noisy Netsは教師あり学習の一般的な正則化手法ではなく、入力データにノイズを加えるデータ拡張でもありません。
G検定ひっかけポイント
ε-greedyとの違い
- ε-greedy → 行動を一定確率でランダムに選ぶ
- Noisy Nets → ネットワークのパラメータにノイズを加える
他のDQN改良との違い
- Q値の過大評価を抑える → Double DQN
- 状態価値と行動の優位性を分ける → Dueling Network
- 重要な経験を優先して再生 → Prioritized Experience Replay
- パラメータにノイズを入れて探索 → Noisy Nets
選択肢の判断基準
- 「重み・バイアスにノイズ」→ Noisy Nets
- 「一定確率でランダム行動」→ ε-greedy
- 「入力画像にノイズ」→ データ拡張
- 「Rainbowの探索を担う構成要素」→ Noisy Nets
まとめ(試験直前用)
- Noisy Netsは強化学習の探索手法
- 重み・バイアスへノイズを加える
- ノイズに関するパラメータも学習する
- ε-greedyとはランダム性を入れる場所が違う
- Rainbowの構成要素の1つ