Googleは10月1日、最新AIモデル「Gemini 4 Argon」を発表しました。
長時間の推論やコーディング、知識労働、サイバーセキュリティを強化したフロンティアモデルです。
現時点では一般提供せず、一部の専門家や初期テスターに段階的に展開します。
Googleの評価では一部ベンチマークでGPT-6 AstraやClaude Opus 5.5を上回りました。
記事の概要
Gemini 4 Argonは、長時間の推論やコーディング、知識労働、サイバーセキュリティを強化したモデルです。
Googleが公開した知識労働向けの「Vals Index」では、68.9%を記録しました。
同スコアはGPT-6 Astraの63.1%、Claude Opus 5.5の67.0%を上回りました。
長い文脈の処理性能を測る「GraphWalks」でも、256k〜100万トークンで84.2%を記録しました。
同評価ではGPT-6 Astraが71.8%、Claude Opus 5.5が66.8%でした。
一方、「FrontierSWE v2」ではGemini 4 Argonが55.0%で、GPT-6 Astraの65.5%を下回りました。
今回の評価結果はGoogle自身が公開したもので、第三者機関による独立比較ではありません。
一般提供や第三者評価、実利用での結果が今後の位置づけを左右しそうです。
記事のポイント
- 専門家から段階展開: Gemini 4 Argonは現時点で一般提供せず、一部の専門家や初期テスターから展開します。
- 一部評価で首位: Vals IndexとGraphWalksでは、GPT-6 AstraやClaude Opus 5.5を上回るスコアを記録しました。
- 独立評価は未実施: 公開スコアはGoogle独自の評価結果で、すべてのベンチマークで首位ではありません。
このニュースがもたらす影響
- 導入を検討する企業: 専門家や初期テスターへの段階展開にとどまるため、導入企業は長文脈処理や知識労働など自社業務での適性を限定的に検証し、一般提供まで本格採用を見極める必要がありそうです。
- AIモデル提供各社: 知識労働や長文脈の評価で優位性を示した一方、コーディング評価では下回っており、各社は用途別の性能差を示す評価と、第三者が検証できる比較材料の提示を求められそうです。
- AI導入を進める業界: Google独自評価での優位性だけでは採用判断を確定しにくく、今後は第三者評価や実利用の結果、さらに一般提供の時期を確認してモデル選定を更新する流れになりそうです。
このニュースの背景
Gemini 4 Argonは、長時間の推論やコーディング、知識労働、サイバーセキュリティを強化したモデルとして登場しました。
現時点では一般提供されず、一部の専門家や初期テスターへの段階展開にとどまっています。
Googleの評価では知識労働と長文脈処理で競合モデルを上回る一方、コーディング評価では下回りました。
公開されたスコアはGoogle自身によるもので、第三者機関による独立比較や実利用での結果はまだ示されていません。
関連するニュース
- Googleは最上位モデルGemini 4 Argonを発表し、出力上限を100万トークンに拡大しました。
- Googleは、Gemini 3.8 Flashを公開し、開発支援やエージェント機能を強化しました。
- AnthropicがClaude Opus 5.5を発表し、コストとAPI料金を引き下げました。
詳しい記事の内容はこちらから(引用元)
Googleは10月1日、最新AIモデル「Gemini 4 Argon」を発表した。長時間の推論やコーディング、知識労働…
https://ascii.jp/elem/000/004/439/4439067/