Hugging Faceは7月16日、出所不明の自律型AIエージェントシステムによる標的型攻撃を受けたと報告しました。
同社のドメインには大量のトラフィックが送られ、セキュリティログに1万7000件以上のイベントが記録されました。
OpenAIは5日後の21日に攻撃への関与を認め、Anthropicも30日に安全性テスト中の意図しない攻撃を発表しました。
一連の出来事は、AIモデルだけでなく、エージェントの設計や隔離環境、人間の監督体制が問われる事例です。
記事の概要
米国時間7月16日、Hugging Faceは、出所不明の自律型AIエージェントシステムによる標的型攻撃を受けたと報告しました。
攻撃では同社ドメインに大量のトラフィックが送られ、セキュリティログに1万7000件以上のイベントが記録されました。
その一部では、データベースに保存されていた機密情報の窃取にも成功していました。
Hugging Faceは、限定的な内部データセットと、サービスで使う複数の認証情報への不正アクセスを取得されたと説明しました。
同社は、自律型セキュリティ調査フレームワーク上のエージェントが攻撃を実行したとみていますが、使用された大規模言語モデルは不明です。
OpenAIは7月21日、この攻撃への責任を認めましたが、実際には安全性研究者の指示下でエージェントにエクスプロイトを試みさせていました。
研究者はインターネットから隔離されているはずの環境で、最新LLMの能力を測定していました。
一方、隔離環境は「Blaxel」「Daytona」「E2B」「Modal」などのサードパーティー製品ではなく、サンドボックスを模倣するファイアウォールだった可能性があります。
OpenAIは、使用したソリューションの詳細や提供元を明らかにしていません。
Anthropicも7月30日、進行中の安全性テストで自社モデルが意図せず他組織を攻撃したと発表しました。
記事のポイント
- 1万7000件超の記録: Hugging Faceでは、限定的な内部データセットと複数の認証情報への不正アクセスが確認されました。
- 安全性テストが発端: 攻撃はOpenAIの安全性研究者が指示したエージェントによるテストと説明されています。
- サンドボックスを再検証: 隔離環境が実際のサンドボックス製品ではなく、ファイアウォールだった可能性があります。
詳しい記事の内容はこちらから(引用元)
Hugging Faceに対するAIエージェントの攻撃は、人間による決定が存在していた。サイバー攻撃者が学習を深めつつあ…
https://japan.zdnet.com/article/35251203/