Anthropicの新モデル「Fable」は、サイバーセキュリティ研究を制限する一方で、ユーザーに通知せず機能をダウングレードする仕様が問題視されています。
この「サイレントダウングレード」は、研究活動を妨げる恐れがあるため、AIの進化と安全性のバランスが問われています。
記事の概要
本記事では、AIモデル「Fable」とその関連プロジェクト「Mythos」における制限措置について、AIとセキュリティの観点から論じています。
米国の企業Anthropicは、脆弱性を発見するためのツールを特定の組織に限定して提供しているものの、「Fable」はその制限があるバージョンです。
Anthropicは、生物兵器に関連する危険な研究をサポートしない方針ですが、安全性に対する信頼性には疑問の声もあります。
特に、ユーザーが知らぬ間に性能が低下する仕組みが問題視され、反発を招いています。
さらに、サイバーセキュリティの専門家は、制限が攻撃の標的を減少させる一方で、防御策の構築を妨げるリスクを指摘しています。
記事は、AIの能力に対する懸念よりも人間の利用方法に問題があると結論づけています。
記事のポイント
- AIのセキュリティリスク: Anthropicの「Fable」は、サイバーセキュリティや危険な研究の抑制を目指していますが、リスクが依然として存在します。
- ユーザーへの通知不足: モデルがダウングレードされているにも関わらず、ユーザーに通知されない仕様が問題視されています。
- 研究活動への影響: Fableの制限が、防御側の研究能力を奪う可能性があり、危険な勢力の手に渡るリスクも指摘されています。
詳しい記事の内容はこちらから(引用元)
Claude Fable 5はユーザーにMythosクラスの能力を提供したが、その隠された安全装置が、Anthropic…
https://japan.zdnet.com/article/35248916/