FlashLabs、27Bのエージェント向けモデルを12.3GBに圧縮

FlashLabsは9月24日、AIエージェント向けモデル「OrcaSAQ-2 27B」を公開しました。
同モデルは、Qwen3.8-27Bを54GBから12.3GBへ圧縮したモデルです。
圧縮前モデルとの回答一致率は93.2%で、SWE-bench Verifiedは70.0でした。

記事の概要

OrcaSAQ-2 27Bは、270億パラメータ規模のモデルを約4分の1以下に圧縮したモデルです。
ストレージ容量は54GBから12.3GBとなり、77.2%削減されています。
圧縮前モデルとの回答一致率は93.2%で、パープレキシティの差は0.02%でした。
SWE-bench Verifiedは70.0、Terminal-Bench 2.1は58.4を記録しました。
モデルは16GBのGPUで実行でき、vLLMとOrcaSAQ2の連携に対応しています。
MTP有効時の速度は、1ストリームあたり毎秒90.1トークンでした。
コンテキスト長は26万2144トークンで、思考モードやツール呼び出しにも対応しています。

記事のポイント

  1. 容量を77.2%削減: 27Bモデルのファイルサイズを54GBから12.3GBへ圧縮し、16GBのGPUで実行できるサイズにしています。
  2. エージェント性能を評価: SWE-bench Verifiedで70.0、Terminal-Bench 2.1で58.4を記録し、長時間作業を意識して評価しています。
  3. Apache-2.0で公開: 重みはHugging Faceで公開され、Apache-2.0ライセンスで利用できます。実行には対応版vLLMが必要です。

このニュースがもたらす影響

  • 導入を検討する企業: 16GBのGPUで動かせるため、エージェントを自社設備で運用する選択肢が広がります。ただし回答一致率93.2%を踏まえ、実業務での判断精度を検証する必要があります。
  • 同分野の提供者: モデル容量を抑えながらエージェント性能を測る流れが強まりそうです。今後は、サイズだけでなく長時間作業での性能や実行環境まで含めた比較が求められます。
  • AI開発者: Apache-2.0で重みが公開されるため、試作や検証に取り入れやすくなります。一方、対応版vLLMが必要なため、導入時には推論基盤との連携作業を見込む必要があります。

このニュースの背景

27Bクラスのモデルはコーディングやツール操作などに使える一方、圧縮前のBF16形式では54GBのメモリが必要でした。
AIエージェントは計画、実行、結果確認、判断を繰り返すため、途中の小さな判断の違いが長時間の作業で積み重なる可能性があります。
そのため本研究では、モデルを小さくすることだけでなく、圧縮によって何が維持されるのかをエージェント向け指標などで測定しています。

関連するニュース

詳しい記事の内容はこちらから(引用元)

プレスリリース・ニュースリリース配信シェアNo.1|PR TIMES

FlashLabs株式会社のプレスリリース(2026年9月25日 13時00分)OrcaRouter、27Bのエージェン…

OrcaRouter、27Bのエージェント向けAIモデルを4分の1以下に圧縮した「OrcaSAQ-2 27B」を公開
https://prtimes.jp/main/html/rd/p/000000098.000138449.html

最新情報をチェックしよう!
>ビジネスを飛躍させるAIキュレーションメディア「BizAIdea」

ビジネスを飛躍させるAIキュレーションメディア「BizAIdea」

国内外の最新AIに関する記事やサービスリリース情報を、どこよりも早くまとめてお届けします。
日々BizAIdeaに目を通すだけでAIの最新情報を手軽にキャッチアップでき、
AIの進化スピードをあなたのビジネスの強みに変えます。

SNSをフォローして頂くと、最新のAI記事を最速でお届けします!
X: https://twitter.com/BizAIdea
Facebook: https://www.facebook.com/people/Bizaidea/61554218505638/

CTR IMG