SpaceXAIは9月21日、コーディングやナレッジワーク向けのAIモデル「Grok 4.7」を公開しました。
同社の最高モデルと位置づけ、同等モデルと比べて処理速度2倍、価格半額を掲げています。
CursorやGrok Buildのほか、API、コーディングハーネス、クラウドプラットフォームなどで利用できます。
記事の概要
Grok 4.7は、難易度の高いタスクでも長時間処理を継続できるモデルです。
自身の作業を検証し、長いコンテキストを管理する能力を高めています。
長時間のコーディングタスクを評価するCursorBench 4.0では、46.3%を記録しました。
同ベンチマークでGPT-5.6 Solは41.7%、Fable 5.1は51.8%でした。
DeepSWE v1.1では71%となり、Fable 5.1の70%を上回りました。
EEBenchでは64%となり、GPT-5.6 Solの39.4%、Fable 5.1の56.4%を上回りました。
API料金は100万トークン当たり入力2ドル、出力6ドルからです。
サイバーセキュリティや生物学的研究などのデュアルユース分野では、安全な拒否と有用性の両立を目指しています。
記事のポイント
- 長時間処理を強化: Grok 4.7は長時間のコーディングタスクで作業を検証し、長いコンテキストを管理する能力を高めています。
- 性能と価格を提示: CursorBench 4.0で46.3%を記録し、API料金は入力2ドル、出力6ドルからです。
- 安全対策も更新: サイバーセキュリティや生物学的研究で、無害な依頼への有用性と危険な依頼の拒否を強化しています。
このニュースがもたらす影響
- 導入を検討する企業: 長時間のコーディングや専門業務では、処理の継続性や自己検証が成果に直結するため、単発の精度だけでなく自社タスクでの完遂率と監督負担を確かめる必要がありそうです。
- 開発支援サービス提供者: APIに加えてコーディングハーネスやモデルルーターでも使えるため、既存サービスに組み込む際は、速度と価格を生かした振り分けや、利用量に応じた採算設計を検討しやすくなります。
- AI導入のリスク管理部門: サイバーセキュリティや生物学的研究では、有用な依頼への対応と危険な依頼の拒否を両立できるかが選定条件になります。用途別の検証手順を先に整える必要がありそうです。
このニュースの背景
Grok 4.7は、より大規模な新しいベースモデルを採用し、長時間の処理で自身の作業を検証しながら長いコンテキストを管理する方向で性能を高めています。
コーディング向けの複数のベンチマークでは、GPT-5.6 SolやFable 5.1を上回る項目が示され、長時間タスクや専門的な作業への対応力が比較されています。
API料金は入力が100万トークン当たり2ドル、出力が6ドルからとされ、処理速度と価格の両面でコスト競争力を打ち出しています。
サイバーセキュリティや生物学的研究のようなデュアルユース分野では、安全な拒否と無害な依頼への有用性を両立する方針が示されています。
関連するニュース
- MicrosoftはCopilotのWord、Excel、PowerPointにGrokを追加し、管理者設定を伴うプレビュー提供を始めました。
- OpenAIは次世代モデルAstraを近日公開し、能力制限や検査システムを導入します。
詳しい記事の内容はこちらから(引用元)
SpaceXAIは21日(米国時間)、最新のAIモデルとなる「Grok 4.7」を公開した。コーディングやナレッジワーク…
https://www.watch.impress.co.jp/docs/news/2142588.html