FlashLabsは9月24日、AIエージェント向けモデル「OrcaSAQ-2 27B」を公開しました。
同モデルは、Qwen3.8-27Bを54GBから12.3GBへ圧縮したモデルです。
圧縮前モデルとの回答一致率は93.2%で、SWE-bench Verifiedは70.0でした。
記事の概要
OrcaSAQ-2 27Bは、270億パラメータ規模のモデルを約4分の1以下に圧縮したモデルです。
ストレージ容量は54GBから12.3GBとなり、77.2%削減されています。
圧縮前モデルとの回答一致率は93.2%で、パープレキシティの差は0.02%でした。
SWE-bench Verifiedは70.0、Terminal-Bench 2.1は58.4を記録しました。
モデルは16GBのGPUで実行でき、vLLMとOrcaSAQ2の連携に対応しています。
MTP有効時の速度は、1ストリームあたり毎秒90.1トークンでした。
コンテキスト長は26万2144トークンで、思考モードやツール呼び出しにも対応しています。
記事のポイント
- 容量を77.2%削減: 27Bモデルのファイルサイズを54GBから12.3GBへ圧縮し、16GBのGPUで実行できるサイズにしています。
- エージェント性能を評価: SWE-bench Verifiedで70.0、Terminal-Bench 2.1で58.4を記録し、長時間作業を意識して評価しています。
- Apache-2.0で公開: 重みはHugging Faceで公開され、Apache-2.0ライセンスで利用できます。実行には対応版vLLMが必要です。
このニュースがもたらす影響
- 導入を検討する企業: 16GBのGPUで動かせるため、エージェントを自社設備で運用する選択肢が広がります。ただし回答一致率93.2%を踏まえ、実業務での判断精度を検証する必要があります。
- 同分野の提供者: モデル容量を抑えながらエージェント性能を測る流れが強まりそうです。今後は、サイズだけでなく長時間作業での性能や実行環境まで含めた比較が求められます。
- AI開発者: Apache-2.0で重みが公開されるため、試作や検証に取り入れやすくなります。一方、対応版vLLMが必要なため、導入時には推論基盤との連携作業を見込む必要があります。
このニュースの背景
27Bクラスのモデルはコーディングやツール操作などに使える一方、圧縮前のBF16形式では54GBのメモリが必要でした。
AIエージェントは計画、実行、結果確認、判断を繰り返すため、途中の小さな判断の違いが長時間の作業で積み重なる可能性があります。
そのため本研究では、モデルを小さくすることだけでなく、圧縮によって何が維持されるのかをエージェント向け指標などで測定しています。
関連するニュース
- FlashLabsはOrcaRouterの無料モデルをGLM 5.3 Flashへ刷新し、1トークン0ドルで提供します。
- FlashLabsは、743B規模のGLM-5.3を約322GBに圧縮し、Mac向けモデルを公開しました。
- FlashLabsが、セキュリティ研究向け320BモデルのGGUF量子化版を4形式で公開しました。
詳しい記事の内容はこちらから(引用元)
FlashLabs株式会社のプレスリリース(2026年9月25日 13時00分)OrcaRouter、27Bのエージェン…
https://prtimes.jp/main/html/rd/p/000000098.000138449.html