Metaは9月2日、エージェントタスクとコーディングタスクを強化したAIモデル「Muse Spark 1.3」の提供を始めました。
同モデルは「Muse Code」と「Meta Model API」で利用でき、一部ベンチマークではAnthropicの「Fable 5」に匹敵する性能を示しています。
8月の「Muse Spark 1.2」公開から約1カ月で、性能とコーディング効率を改良しました。
記事の概要
Metaは9月2日、最新モデル「Muse Spark 1.3」を提供開始しました。
数カ月にわたる「Muse Code」と「Meta Model API」の導入で得た知見を、今回の改良に反映しました。
単一の長いスレッド内で複数のワークフローを同時処理し、長期的な作業を継続できるよう設計しています。
モデルはツールを使い、独自のコンテキストを生成しながら、計画の欠落を先回りして修正します。
曖昧な指示には確認し、行き詰まりや重大なアクションの前にはユーザーへ確認を求めます。
コーディングでは、Muse Spark 1.2と比べてツール呼び出しが約20%、トークン数が約25%減少しました。
DeepSWE v1.1のスコアは75.4で、Muse Spark 1.2の55、GPT-5.6 Solの73、Opus 5の74を上回りました。
追加の安全性テスト後に最大推論モードを提供し、今後は大規模モデルやオープンウェイトも予定しています。
記事のポイント
- エージェント処理を強化: 複数のワークフローを一つの長いスレッドで扱い、計画や学習内容を追跡して成果物までつなげます。
- コーディング効率を改善: Muse Spark 1.2比でツール呼び出しを約20%、トークン数を約25%減らし、冗長性を抑えました。
- ベンチマークで比較: DeepSWE v1.1で75.4を記録し、Muse Spark 1.2やGPT-5.6 Sol、Opus 5の数値を上回りました。
このニュースがもたらす影響
- 導入を検討する企業: 長期・複数工程の開発業務を一つのスレッドで任せられる可能性があり、試験導入では作業範囲と確認が必要な場面を先に切り分けることが求められそうです。
- 同業のモデル提供者: 性能だけでなく、ツール呼び出しやトークン数の削減も比較軸になり、エージェント向けモデルでは処理効率と協働設計を同時に示す必要が強まりそうです。
- 開発部門の責任者: モデル更新の間隔が短く、約1カ月で性能改善が進んだことから、固定したモデルを長期利用するより、評価環境を継続的に更新できる運用が重要になりそうです。
このニュースの背景
Muse Spark 1.2の公開から約1カ月で1.3が提供されており、短期間の更新にはMuse CodeとMeta Model APIの導入で得た知見が反映されています。
今回の改良は、長い作業を継続するエージェント処理とコーディングの効率化に重点が置かれています。
コーディングでは、前世代と比べてツール呼び出しとトークン数が減少しており、性能だけでなく利用時の冗長性を抑える方向が示されています。
最大推論モードの提供には追加の安全性テストが予定されており、高度な推論機能の拡張と安全性確認を並行して進める段階にあります。
関連するニュース
- MetaがコーディングAIモデルとターミナル型エージェントのベータ版を公開しました
- Metaが30BのローカルAIモデルを公開し、LM Studioも対応を発表しました。
- Metaは超知能を個人に広く届ける「パーソナル超知能」を掲げ、オープンモデルと米国主導を推進します。
詳しい記事の内容はこちらから(引用元)
Metaは2日(米国時間)、エージェントタスクやコーディングタスクのパフォーマンスを向上した最新モデル「Muse Spa…
https://www.watch.impress.co.jp/docs/news/2137863.html