Data Poisoning
Data Poisoning
Data Poisoning(データポイズニング(学習データ汚染))とは
ひとことで
機械学習モデルの学習データに不正なデータや細工したデータを混ぜ込み、モデルの判断を誤らせたり、特定の条件で攻撃者の意図した動作をさせたりする攻撃。
たとえると
料理の見習いに渡す「レシピ集」に、こっそり間違ったレシピを混ぜておくようなものです。見習いはそれを正しいと信じて覚えてしまうため、後からどれだけ丁寧に作っても、間違った味付けになってしまいます。
現場ではこう使う
あるメールセキュリティ製品は、利用者から報告されたメールをもとに、迷惑メールの判定モデルを定期的に学習し直していました。攻撃者は大量のアカウントを使い、自分たちのフィッシングメールを「迷惑メールではない」と繰り返し報告しました。その結果、モデルが攻撃者のメールを通すようになったため、学習データの出所の確認と、不自然な報告を除外する仕組みを導入しました。
試験のポイント
EXAM POINT「学習データを汚染」「モデルの判断を意図的に誤らせる」と出てきたらデータポイズニングです。モデルを作る(学習する)段階を狙う攻撃で、利用時の入力でAIを操るプロンプトインジェクションと区別しましょう。対策として、学習データの出所の管理と検証、データの完全性の確保、モデルの挙動の継続的な監視が問われます。
混同しやすい用語との違い
- Prompt Injection利用時の入力に指示を紛れ込ませてAIを操る。モデル自体は変えない
- Hallucination攻撃がなくても、AIがもっともらしい誤った内容を出力してしまう現象