米Googleらが提案した研究報告「Stealing Part of a Production Language Model」は、ブラックボックスな言語モデルの内部構造を盗む攻撃方法を開発したという貴重な情報です。
記事の概要
米Googleの研究者らが、米OpenAIのブラックボックスとなっている言語モデル(LLM)の一部を盗み出す攻撃手法を発表しました。
この手法では、言語モデルのAPIを悪用して、最終層の重みを復元し、モデルの隠れ層の次元数を特定することが可能です。
実験ではわずか20ドル未満の費用で成功し、adaモデルが1024次元、babbageモデルが2048次元の隠れ層を持つことが明らかになりました。
攻撃手法の詳細は脆弱性の影響を受けるサービス提供者に開示され、GoogleやOpenAIは対策を実施しました。
記事のポイント
- LLMの内部構造を盗む攻撃: 米Googleの研究者らが提案した手法で、クローズドな言語モデルの一部を盗み出すことが可能となりました。
- APIを通じた情報抽出: 研究者らはAPIを悪用し、言語モデルの最終層の重みを復元することで、モデルの隠れ層の次元数や規模を推定する手法を開発しました。
- 攻撃防御策の実装: GoogleやOpenAIはこの脆弱性に対する攻撃防御策を実装し、情報共有を行うことで対策を取りました。
詳しい記事の内容はこちらから(引用元)
ITmedia NEWS
米Google DeepMindなどに所属する研究者らは、米OpenAIのGPT-4や米GoogleのPaLM-2などの…
https://www.itmedia.co.jp/news/articles/2403/14/news087.html