Skip to the content.

最終更新日:2026年8月26日

G検定トップ > Noisy Netsとは?重みにノイズを入れて探索する強化学習手法【G検定】

まず結論

Noisy Netsは、ニューラルネットワークの重みやバイアスにパラメータ化されたノイズを加え、強化学習の探索を促す手法です。

G検定では、どこにランダム性を入れるかで切り分けます。

手法 ランダム性を加える場所 主な目的
Noisy Nets モデルの重み・バイアス 探索を促す
ε-greedy 選択する行動 一定確率で探索する
データ拡張 入力データ 汎化性能を高める
Dropout ユニットの出力 過学習を抑える

直感的な説明

ε-greedyは、

「一定確率でランダムな行動を選ぶ」

方法です。

Noisy Netsはそうではなく、

行動価値を計算するネットワーク自体を少し揺らす

ことで、選ばれる行動に変化を生みます。

つまり、探索のランダム性を行動選択ルールの外側から足すのではなく、ネットワーク内部へ組み込むのが特徴です。

定義・仕組み

Noisy Netsでは、全結合層などのパラメータを、決定的な成分とノイズ成分に分けて扱います。

  • 重みやバイアスへノイズを加える
  • ノイズの大きさに関するパラメータも学習する
  • Q値などの出力が変化し、結果として探索行動が生まれる

このため、DQN系で明示的なε-greedyの代わりに利用されることがある手法です。

「探索と活用を必ず最適に自動調整する」「どんな環境でもε-greedyより優れる」という意味ではありません。

Rainbowとの関係

Noisy Netsは、DQNの複数の改良を組み合わせたRainbowの構成要素の1つです。

RainbowではNoisy Netsが主に探索を担当し、Double DQNやPrioritized Experience Replayなどは別の弱点を改善します。

いつ使う?(得意・不得意)

主に次のような場面で使われます。

  • DQN系の深層強化学習
  • 探索方法をネットワーク内部に組み込みたい場合
  • RainbowのようなDQN改良手法

注意点として、Noisy Netsは教師あり学習の一般的な正則化手法ではなく、入力データにノイズを加えるデータ拡張でもありません。

G検定ひっかけポイント

ε-greedyとの違い

  • ε-greedy → 行動を一定確率でランダムに選ぶ
  • Noisy Nets → ネットワークのパラメータにノイズを加える

他のDQN改良との違い

  • Q値の過大評価を抑える → Double DQN
  • 状態価値と行動の優位性を分ける → Dueling Network
  • 重要な経験を優先して再生 → Prioritized Experience Replay
  • パラメータにノイズを入れて探索 → Noisy Nets

選択肢の判断基準

  • 「重み・バイアスにノイズ」→ Noisy Nets
  • 「一定確率でランダム行動」→ ε-greedy
  • 「入力画像にノイズ」→ データ拡張
  • 「Rainbowの探索を担う構成要素」→ Noisy Nets

関連: DQN / Rainbow / DQN発展手法

まとめ(試験直前用)

  • Noisy Netsは強化学習の探索手法
  • 重み・バイアスへノイズを加える
  • ノイズに関するパラメータも学習する
  • ε-greedyとはランダム性を入れる場所が違う
  • Rainbowの構成要素の1つ

© 2024-2026 stemtazoo. All rights reserved.