OpenAIは9月3日、AIモデル「GPT-6 Astra」を発表しました。
未知の環境を探索し、ルールや目的を推測して攻略する能力を評価するARC-AGI-3で、99.9%を記録しました。
ChatGPT Plus、Pro、Business、Enterprise、APIへ今後数日で展開します。
記事の概要
GPT-6 Astraは、ゲームのような課題で未知の環境を探索し、計画を立てて攻略する能力を備えています。
ARC-AGI-3では、人間がクリアした際の中央値より少ない操作回数で96%のステージを解きました。
平均操作回数も人間より51.7%少ない結果でした。
ただし、99.9%のスコアは推論状態を保持するOpenAI向けの「Provider Adapter」を使った評価です。
共通条件のStandard harnessでは最高62.7%で、ARC PrizeもAGI達成の証明ではないとしています。
ソフトウェア開発などを測るTerminal-Bench 4.0では57.9%を記録し、Claude Fable 5.1の55.8%、GPT-5.6 Solの37.3%を上回りました。
Terminal-Bench Science 0.1では64.6%、FrontierMath Tier 4では97.6%、ExploitBenchでは100%を記録しました。
OpenAIは、AstraがAGIを達成したわけではないとしつつ、複雑なタスクへの対応力と人間による制御が今後の焦点になるとしています。
記事のポイント
- 未知環境の攻略: ARC-AGI-3で99.9%を記録し、人間の中央値より少ない操作回数で96%のステージを解きました。
- 評価条件に制約: Provider Adapter使用時の数値であり、共通条件のStandard harnessでは最高62.7%でした。
- 安全面の対応: ExploitBenchで100%に達したため、OpenAIは高度な攻撃につながる要求を制限します。
このニュースがもたらす影響
- 導入を検討する企業: 未知の業務環境を試行しながら進める用途では、操作回数や失敗時の制御を含めた実運用評価を、提供開始後早期に検証する必要がありそうです。
- 同業のモデル提供者: ARC-AGI-3の評価条件で結果に差が出たため、今後は単一スコアだけでなく、共通条件での再現性や推論状態の扱いまで示すことが求められそうです。
- AIを管理する企業・組織: サイバー能力が高い水準に達したとされることから、高度な攻撃につながる利用を想定し、権限管理や要求制限を導入前から設計する必要がありそうです。
このニュースの背景
GPT-6 Astraは、説明のない環境でルールや目的を推測し、計画しながら課題を攻略する能力を評価するモデルとして登場しました。
ARC-AGI-3では高い数値を記録した一方、推論状態を保持するProvider Adapterと、共通条件のStandard harnessで結果が分かれています。
ソフトウェア開発や科学研究、数学、サイバー能力を測る複数のベンチマークでも結果が示され、用途別の性能を確認できる形になっています。
ChatGPTの有料プランや企業向けプラン、APIへの展開が予定される一方、OpenAIは高度な攻撃につながる要求を制限するとしています。
関連するニュース
- OpenAIは次世代モデルAstraを近日公開し、能力制限や検査システムを導入します。
- OpenAIはGPT-5.6 Solを最大14倍高速化するUltrafastを企業向けAPIで限定提供します。
- OpenAIがChatGPT無料版の標準モデルをGPT-5.6 Lunaへ変更し、有料版も更新します。
詳しい記事の内容はこちらから(引用元)
OpenAIは9月3日、最新AIモデル「GPT-6 Astra」を発表。「ARC-AGI-3」では99.9%を記録し、人…
https://ascii.jp/elem/000/004/432/4432209/