イレブンラボジャパンは、音声合成モデル「Eleven v4」の提供を開始しました。
日本語を含む90以上の言語に対応し、文脈に応じた感情や間、声のトーンを表現します。
リアルタイム対話向けには、音声生成開始までの中央値が約100ミリ秒の「Eleven v4 Turbo」も提供します。
記事の概要
「Eleven v4」は、台本の文脈や演出意図を読み取り、声で演じることを重視した音声合成モデルです。
感情、テンポ、間、リアクション、効果音などを、台本内のインラインタグで指定できます。
「[door slams]」や「[rain]」などのタグにより、環境音や効果音も音声演技に組み込めます。
複数話者の会話では、会話全体を一つの文脈として生成し、発言の重なりや間を自然に表現します。
日本語、ブラジルポルトガル語、標準中国語、広東語などでは、発音だけでなくリズムや感情の改善にも取り組みました。
一つの声を保ったまま、台本の言語に合わせて話し方を切り替え、多言語コンテンツを制作できます。
「Eleven v4 Turbo」は「ElevenAgents」とAPIで利用でき、顧客サポート、予約、営業などの音声エージェントを想定しています。
記事のポイント
- 感情表現を台本で指定: インラインタグで感情やテンポ、間、効果音を指定し、場面に応じた話し方を生成できます。
- 低遅延で音声対話: 「Eleven v4 Turbo」は最初の音声が出るまでの推論時間が中央値約100ミリ秒です。
- ボイスクローンも改善: 約10秒の音声から声質や話し方を再現する機能の精度を高め、長尺音声の一貫性も改善しました。
このニュースがもたらす影響
- 導入検討企業: 顧客対応や予約、営業の音声エージェントでは、回答内容だけでなく応答の速さや感情表現も選定軸になりそうです。用途ごとに品質と遅延の許容範囲を検証する必要があります。
- 音声AI提供者: 音声合成の競争は、発音精度や声質だけでなく、台本から感情・間・効果音まで制御できるかへ広がる可能性があります。対話用途では低遅延との両立も問われそうです。
- コンテンツ制作会社: 一つの声を保った多言語展開や長尺音声の制作で、収録・編集・吹き替えの工程を見直せる可能性があります。声の権利確認と品質チェックを制作計画に組み込むことが求められそうです。
このニュースの背景
動画広告やオーディオブック、吹き替えでは、言葉の正確さに加えて声のトーンや間が作品の印象を左右するとされています。
従来は、複数話者の会話で発言の重なりや間が不自然になったり、長尺音声で声質や話し方にばらつきが生じたりする課題がありました。
また、リアルタイムの音声エージェントでは、LLMの回答生成や通信に加えて音声生成の待ち時間を短くする必要があります。
多言語展開では、声の特徴を保ちながら、台本の言語に合った発音や話し方へ切り替えることも課題になっています。
関連するニュース
詳しい記事の内容はこちらから(引用元)
Eleven Labs Japan合同会社のプレスリリース(2026年9月29日 10時30分)イレブンラボ、「演じる」…
https://prtimes.jp/main/html/rd/p/000000070.000160611.html