FlashLabsは9月21日、AI推論ゲートウェイ「OrcaRouter」のモデルリーダーボードを更新しました。
独自指標「Composite Index」で、OpenAIの「GPT-5.4 Pro」が82.3を獲得し、総合1位になりました。
上位4位のうち3つをOpenAIのモデルが占め、価格や実測値も同じ画面で比較できます。
記事の概要
今回の更新では、「GPT-5.4 Pro」が前回首位の「GPT-5.6 Luna」と順位を入れ替えました。
2位は「DeepSeek V4.1 Flash」の77.8、3位は「GPT-6 Astra」の76.5です。
4位は「GPT-5.6 Luna」の74.9、5位は「Claude Opus 5」の73.4です。
Composite Indexは、人間の選好40%、独立ベンチマーク30%で構成されます。
さらに、OrcaRouter本番実績20%、エコシステム採用度10%を固定の重みで統合します。
スコアは実測値に基づき、新モデルは公開から48時間以内にリーダーボードへ追加されます。
総合2位の「DeepSeek V4.1 Flash」は、入力100万トークンあたり0.15米ドルです。
OrcaRouterは200以上のLLM・生成AIモデルを、単一のゲートウェイから利用できるサービスです。
記事のポイント
- GPT-5.4 Proが首位: GPT-5.4 ProがComposite Indexで82.3を獲得し、前回首位のGPT-5.6 Lunaを上回りました。
- 4要素を固定比率で統合: 人間の選好、独立ベンチマーク、本番実績、採用度を40・30・20・10%で統合します。
- 性能と価格を比較: DeepSeek V4.1 Flashは入力0.15米ドルで、GPT-5.4 Proの60.00米ドルより安価です。
このニュースがもたらす影響
- 導入を検討する企業: 性能だけでなく価格、応答速度、成功率などを同じ画面で比較できるため、用途別にモデルを選び、固定利用を見直す判断材料になりそうです。
- AIサービス提供者: 公開後48時間以内に追加され、実測値で毎日順位が変わる環境では、新モデルの性能だけでなく、早期の実運用実績や価格設計も競争要因になる可能性があります。
- モデル評価業界: 人間の選好や独立ベンチマークに本番実績と採用度を加える設計は、実験環境の性能だけでは測れない導入後の価値を評価する流れを促すと考えられます。
このニュースの背景
AIモデルの順位を、人間の選好や独立ベンチマークだけでなく、ゲートウェイ上の本番実績とエコシステム採用度も含めて評価しています。
Composite Indexは4要素を固定比率で統合し、スコアを実測値に基づいて算出しています。
新モデルは公開から48時間以内に追加され、料金や応答速度、成功率なども同じ画面で確認できる仕組みです。
性能面で上位のモデルでも価格には大きな差があるため、モデル選定でコストと実運用上の指標を同時に見る必要性が高まっています。
関連するニュース
- FlashLabsは、GPT-6 Astraなどの動作指示を取得し、差分比較できるOSSとして公開しました。
- FlashLabsはOrcaRouterでOpenAIのGPT-6 Astraを提供し、長文処理や単一API利用に対応しました。
- FlashLabsはOrcaRouterの無料モデルをGLM 5.3 Flashへ刷新し、1トークン0ドルで提供します。
詳しい記事の内容はこちらから(引用元)
FlashLabs株式会社のプレスリリース(2026年9月23日 16時00分)OrcaRouter、モデルリーダーボー…
https://prtimes.jp/main/html/rd/p/000000093.000138449.html