NVIDIAは8月24日、インタラクティブAI推論アクセラレーター「NVIDIA Groq 3 LPX」の量産開始を発表しました。
同製品は、NVIDIA Vera Rubinプラットフォームを拡張し、エージェント型AIのトークン生成を高速化します。
Artificial Analysisのベンチマークでは、Gemma 4 31Bで毎秒3,400トークンを記録しました。
記事の概要
NVIDIA Groq 3 LPXは、エージェント型AI向けに設計した推論アクセラレーターです。
エージェント型システムは、数百から数千の推論ステップで大量のトークンを生成します。
同製品は、エージェントがリアルタイムで推論や行動を行う際の生成速度向上に重点を置いています。
Artificial Analysisのベンチマークでは、オープンソースのエージェント型モデル「Gemma 4 31B」を実行しました。
10万トークンのコンテキスト条件で毎秒3,400トークンを記録し、同モデルで過去最速の性能としています。
NVIDIAによると、Vera Rubin NVL72との組み合わせで、近い代替プラットフォームより最大4倍高速です。
コード生成、テスト、ツール呼び出し、結果検証を繰り返すワークロードの応答性向上を狙います。
NVIDIA BlueField-4 DPUやVera CPU、Spectrum-6 SPX Ethernetとも連携し、推論レイテンシの低減とスループット向上を図ります。
記事のポイント
- 毎秒3,400トークン: Gemma 4 31Bを10万トークンのコンテキストで実行し、毎秒3,400トークンを記録しました。
- 最大4倍の応答速度: Vera Rubin NVL72と組み合わせ、エージェント型コーディングなどで最大4倍の速度を示します。
- マルチエージェント対応: BlueField-4 DPUやVera CPUなどと連携し、推論レイテンシとスループットの改善を図ります。
このニュースがもたらす影響
- 導入検討企業: コード生成やテスト、ツール呼び出しを反復する業務では、モデルの精度だけでなくトークン生成速度を基準に、推論基盤の選定を見直す必要が生じそうです。
- クラウド事業者: エージェント型AIの応答性を訴求するには、アクセラレーター単体の性能だけでなく、CPUやDPU、ネットワークを含む構成全体で差別化することが求められそうです。
- AIアプリ企業: 数百から数千の推論ステップを要するサービスでは、生成速度の向上が利用体験や処理可能なタスク量に直結し、マルチエージェント化を検討しやすくなる可能性があります。
このニュースの背景
エージェント型システムは、推論や行動、結果検証を数百から数千のステップで繰り返すため、1回の応答だけでなく連続生成の速度が課題になります。
今回のアクセラレーターは、10万トークンのコンテキストを扱うGemma 4 31Bで毎秒3,400トークンを記録し、大規模コンテキストと低レイテンシのうち生成速度に重点を置いています。
Vera Rubin NVL72に加え、DPUやCPU、Ethernetと連携する構成が示されており、エージェント処理では個別チップの性能だけでなく基盤全体の処理効率が重視される流れがうかがえます。
関連するニュース
- NVIDIAは、エージェント型AI向け推論アクセラレーターGroq 3 LPXの量産を開始し、Nebiusが初期採用を予定しています。
- SpaceXAIはNVIDIA Vera CPUとVera Rubinを採用し、地上から軌道上までAI基盤を拡張します。
- QuantumCoreが7,530億パラメータのLLMをDGX Spark 1台に搭載し、オンプレミス生成AIとして提供開始します。
詳しい記事の内容はこちらから(引用元)
NVIDIAは8月24日、インタラクティブAI推論アクセラレーター「NVIDIA Groq 3 LPX」の量産開始を発表…
https://www.watch.impress.co.jp/docs/news/2135283.html