Skip to the content.

最終更新日:2026年9月25日

まず結論

Backdoor Poisoningは、モデルへ特定のトリガーに反応する隠れた挙動を埋め込むPoisoning攻撃です。

通常の入力では正常に見えても、

特定のパターンが入った入力だけ、攻撃者が狙った出力をさせる

ことを目的とします。

直感的な説明

普段のテストでは正常に動くモデルへ、

特定のマークが付いたときだけ別のクラスとして判定する

という秘密の条件を学習させるイメージです。

通常性能が高いままでも、トリガー入力だけ異常挙動する可能性があるため発見が難しい場合があります。

定義・仕組み

NISTではBackdoor Poisoningを、特定のbackdoor patternを含む入力に対して、攻撃者が選んだ挙動を起こすようモデルを汚染するPoisoning攻撃として整理しています。

代表的には、

  • 一部の学習例へトリガーパターンを追加
  • 攻撃者が望むラベル・挙動と結び付ける
  • モデルにその対応を学習させる

という形です。

いつ使う?(得意・不得意)

リスクを考える場面は、

  • 外部から学習データを集める
  • 事前学習済みモデルを第三者から取得する
  • 学習パイプラインの供給網を信頼しきれない

場合です。

対策では、データ・モデルの出所確認、完全性検証、異常なパターンの検査などが重要になります。

G検定ひっかけポイント

Backdoor=通常のPoisoningと完全に同じ目的?

❌ 必ず全体性能を下げる
⭕ 通常時は正常に見せ、トリガー時だけ標的挙動を狙う場合がある

Evasionとの違い

  • Backdoor Poisoning → 学習段階でトリガー挙動を仕込む
  • Evasion → 学習済みモデルへの推論入力を細工する

トリガー

❌ どんな入力でも攻撃挙動
⭕ 特定パターンで攻撃者指定の挙動

まとめ(試験直前用)

  • Backdoor=Poisoningの一種
  • 特定トリガーに反応
  • 通常入力では正常な場合がある
  • 学習段階で仕込む
  • 推論時だけ細工するEvasionとは別
  • トリガー+標的挙動が判断キーワード

参考資料

© 2024-2026 stemtazoo. All rights reserved.