OpenAIは米国時間9月22日、主要モデル「GPT-6 Sol」と「GPT-6 Luna」の一般提供を始めたと発表しました。
GPT-6 Solは前モデル比で間違いの発生率を約半分にし、GPT-6 Lunaは前世代の高負荷処理と同等の性能を約100分の1のコストで実現したとしています。
複数のベンチマークでは、Anthropicの「Claude」シリーズなどとの性能差や、タスク当たりのコストも示されました。
記事の概要
GPT-6 Solの間違いの発生率は、前モデルから約半分に減少したとOpenAIは説明しています。
GPT-6 Lunaは、前世代の「GPT-5.6 Sol」と同等の高負荷処理性能を約100分の1のコストで実現したとしています。
前世代のGPT-5.6 SolおよびLunaは7月にリリースされており、約3カ月で標準モデルの正確性を改善した形です。
「AutomationBench」では、GPT-6 LunaがGPT-5.6を5.4%上回り、タスク当たりのコストを58%削減しました。
GPT-6 SolはAnthropicの「Claude Opus 5」を6.3%上回り、タスク当たりのコストを9%に抑えたとされています。
「DeepSWE 1.1」では、GPT-6 Solが「Claude Fable 5」の最高スコアに1.1ポイント差まで迫り、コストを約80%削減しました。
同じ評価でGPT-6 Lunaは中程度の作業において、Opus 5やFable 5と同等のスコアを記録したとしています。
一方、「Agents' Last Exam」や「FrontierCode」では、比較結果の具体的な数値は公開されていません。
記事のポイント
- 正確性を約2倍に改善: GPT-6 Solは前モデルに比べて間違いの発生率を約半分にしたとOpenAIは説明しています。
- 低価格モデルが競争軸: GPT-6 Lunaは複数の評価で旧世代モデルや競合モデルに近い性能を低コストで示しています。
- 比較データに限界: 一部のベンチマークでは具体的な数値がなく、評価結果の検証には公表範囲の確認が必要です。
このニュースがもたらす影響
- 導入検討企業: 用途ごとに高性能モデルを固定で使うのではなく、正確性が重要な処理とコスト重視の処理でモデルを振り分ける設計が求められそうです。
- 同業のサービス提供者: 性能だけでなく、タスク単価や誤りの発生率まで含めた比較が選定材料になり、競合各社には再現可能な評価データの開示が求められる可能性があります。
- AI開発者・SIer: 低コストモデルの性能向上を前提に、従来は費用面で見送った処理の自動化や、複数モデルを組み合わせた業務フローを再設計する余地が広がりそうです。
このニュースの背景
前世代のGPT-5.6 SolおよびLunaは7月にリリースされており、今回の更新は約3カ月後に行われました。
発表では、標準モデルの正確性向上と、低価格モデルによる高負荷処理のコスト削減が主要な評価軸として示されています。
一方で、一部のベンチマークでは比較結果の具体的な数値が公開されておらず、性能差や費用差の確認には公表範囲を踏まえた検証が必要です。
関連するニュース
- OpenAIがGPT-6 SolとLunaを発表し、API料金をGPT-5.6シリーズから50%引き下げました。
- AnthropicがClaude Opus 5.5を発表し、コストとAPI料金を引き下げました。
- OpenAIはGPT‑6 Astraを発表し、ブラウザ操作や科学研究などの業務代行機能を一部組織向けに提供開始しました。
詳しい記事の内容はこちらから(引用元)
「GPT-5.6」から3カ月に経たないうち「GPT-6 Sol/Luna」が登場した。精度の大幅な向上、コストの劇的な削…
https://japan.zdnet.com/article/35252857/