KandaQuantumは、AIエージェント開発基盤「Fuga v2 – Ryusei」で、Terminal-Bench 2.1の全89課題を実行しました。
約800体のエージェントを協調させ、正答率82.0%を記録しました。
同社は、Claude Fable 5の公式掲載値と同級の水準と説明しています。
実行費用は、API従量課金に換算した場合の約1割でした。
記事の概要
Fuga v2 – Ryuseiは、複数のAIエージェントを群れとして協調させる開発基盤です。
今回の計測では、89課題を10課題前後ずつまとめて並列処理しました。
1課題あたり複数のエージェントを割り当て、合計約800体を動かしました。
Terminal-Bench 2.1での正答率は82.0%で、Claude Fable 5の80.5〜83.8%と同級です。
約18億トークンの実行費用は、API従量課金では約475ドルと試算しました。
実際の費用は定額プランの1日分に相当する約47ドルで、API換算の約1割でした。
Fuga v2 – Ryuseiは現在クローズド・リリース中で、一般公開は今後の予定です。
記事のポイント
- 約800体で並列処理: Fuga v2は約80体ずつのエージェントで課題を分担し、合計約800体で89課題を処理しました。
- API費用の約1/10: 約18億トークンの実行費用は、API従量課金の約475ドルに対し、約47ドルでした。
- 測定条件に違い: 82.0%は自社計測で、公式リーダーボードの各数値とは実行条件が異なります。
このニュースがもたらす影響
- 導入を検討する企業: 開発業務で多数のエージェントを使う場合、単体モデルの性能だけでなく、課題分担や仕上げの確認を含む運用設計と実コストを比較する必要が出てきそうです。
- 同業のサービス提供者: ベンチマークの正答率だけでなく、異なるモデルをどう振り分け、どの規模まで協調させ、いくらで再現できるかが競争軸として問われる可能性があります。
- AI運用担当者: エージェントを大量投入する構想では、定額プランによる費用差を検討材料にできますが、測定条件の違いや提出物の確認漏れまで含めた評価基準が求められそうです。
このニュースの背景
エージェントの数を増やすと、低コストモデルへの分担による費用抑制と、品質・協調の安定維持を両立しにくくなります。
今回の計測では、複数のエージェントを課題ごとに割り当て、89課題を並列処理する構成が取られています。
費用はAPI従量課金と定額プランのどちらを基準にするかで大きく変わるため、導入判断では比較条件の確認が必要です。
正答率は自社計測であり、公式リーダーボードの数値とは実行条件が異なります。また、基盤は現時点でクローズド・リリースです。
関連するニュース
- KandaQuantumは、1,285体のAIエージェントを管理する基盤「Fuga」をクローズド提供します。
- KandaQuantumは、最大2,000体超のAIエージェントを指揮するFuga新版を限定提供しました。
- AnthropicがClaude Opus 5.5を発表し、コストとAPI料金を引き下げました。
詳しい記事の内容はこちらから(引用元)
株式会社KandaQuantumのプレスリリース(2026年9月27日 19時55分)スウォームAI「Fuga v2」、…
https://prtimes.jp/main/html/rd/p/000000156.000082094.html