Nishikaは、日本語の会議要約AIを評価するベンチマーク「J-MeetEval」をオープンソースで公開しました。
3,000〜11,000字の会議文字起こしに複数の形式・制約指示を与え、遵守できたかを0/1で判定します。
7モデルの評価では、汎用ベンチマークの順位と会議タスクの指示達成率が一致しない結果になりました。
記事の概要
J-MeetEvalは、経済産業省とNEDOが推進するGENIAC第3期の成果です。
197件の合成会議トランスクリプトと52件の指示定義を用い、延べ408指示を16カテゴリで評価します。
入力長の中央値は9,072字で、文体や全角・半角、JSON形式、発言順などの日本語固有の条件を含みます。
4B〜9Bクラスの7モデルを評価した結果、指示達成率はgemma-4-E4B-itの83.3%が最高でした。
Nejumi総合スコアが0.7352で最も高いQwen3.5-4Bは、J-MeetEvalでは72.1%で最下位でした。
両ベンチマークの順位相関はスピアマンのρ=−0.52で、汎用性能と議事録タスクの実力が一致しない傾向を示しました。
会議要約向けに開発した4Bモデルは、ベースモデルから指示達成率を55.4%から74.3%へ改善しました。
評価コードやデータセット、全スコア、判定根拠のドキュメントはGitHubとHugging Faceで公開されています。
記事のポイント
- 形式遵守を0/1で評価: 全角・半角や発言順、JSON形式など、実務上の制約を機械的に判定します。
- 汎用順位との逆転を確認: Qwen3.5-4Bは汎用スコア首位でしたが、会議タスクでは7モデル中最下位でした。
- 4Bモデルで改善を実証: 会議要約向けのタスク特化学習により、指示達成率を18.9ポイント高めました。
このニュースがもたらす影響
- 会議AI導入企業: 汎用ベンチマークの順位だけで製品を選ばず、自社の議事録形式や複数指示を再現した検証を、導入前の評価項目に組み込む必要がありそうです。
- モデル開発者: モデルの規模や汎用スコアを高めるだけでなく、全角・半角、発言順、JSONなどの制約を同時に守るタスク特化学習が、差別化の軸になる可能性があります。
- AI評価研究者: 日本語固有の表記や長文・複合指示を含む評価結果が共有されたことで、汎用性能と業務適性を分けて測る評価設計や、判定根拠の再現性が求められそうです。
このニュースの背景
既存のLLMベンチマークには、文章の巧拙に比べて、指定形式や制約を守れるかを測る枠組みが十分ではありませんでした。
また、短い入力に単一の指示を与える評価が多く、数千〜1万字の会議文字起こしに複数の指示を与える実務との差がありました。
日本語では文体・敬語・全角半角など固有の評価観点も必要で、LLMに別のLLMを採点させる方式には判定の揺れや回答の長さへの偏りが課題としてあります。
関連するニュース
- CAISはAIエージェントの不正行為を測るCheatBenchを開発し、モデル別の不正率を示しました。
- 経済産業省とNEDOが、現場の自律化を目指すロボット基盤モデル研究開発13件を採択しました。
- WHITEがAIエージェントの特則を含む社内向け生成AIガイドライン生成ツールを無料公開しました。
詳しい記事の内容はこちらから(引用元)
Nishika株式会社のプレスリリース(2026年10月5日 15時29分)【GENIAC第3期成果】日本語の会議要約A…
https://prtimes.jp/main/html/rd/p/000000130.000052152.html