Googleは、音声生成モデル「Gemini 3.8 Flash TTS」と「Flash-Lite TTS」を発表しました。
自然言語で声質やアクセントを指定でき、30秒の音声サンプルから声を再現できます。
ライブ対話モデルに映像アバターを組み合わせた「Live Avatar」も提供します。
音声生成モデルはGemini APIなどで、Live AvatarはGemini Enterpriseで展開します。
記事の概要
Googleは、音声生成モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表しました。
両モデルは、100以上の言語や方言で役割、アクセント、声質などを指定できます。
演技や話す速度、相づちを指示でき、2,000以上の既成音声も利用できます。
30秒の音声サンプルから声を再現でき、長時間の音声生成や2人の会話生成にも対応します。
Flash-Lite TTSは、大量の吹き替えや音声コンテンツ制作、音声エージェント作成を想定しています。
音声生成モデルはGemini APIとGoogle AI Studioで提供を開始し、今後Gemini Enterpriseにも展開します。
「Gemini 3.8 Live」と映像アバターを組み合わせたLive Avatarは、リアルタイム対話と低遅延の動画配信に対応します。
Live Avatarは97言語間の切り替えや、会話中の非同期ツール呼び出しに対応し、Gemini Enterpriseで利用できます。
記事のポイント
- 自然言語で声を設計: Flash TTSは100以上の言語や方言に対応し、声質や演技、速度、相づちなどを指定できます。
- 声の再現に同意確認: 30秒の音声サンプルから声を再現できますが、本人の同意確認を求め、SynthIDやC2PA情報を付与します。
- アバターが97言語に対応: Live Avatarはリップシンクや表情を保ちながら、97言語間の切り替えと非同期処理に対応します。
このニュースがもたらす影響
- 導入を検討する企業: 顧客対応や音声コンテンツ制作では、声質・言語・演技を業務に合わせて設計し、多言語対応やアバター導入の効果を検証する必要が生じそうです。
- 同業のサービス提供者: 音声エージェントや対話型アバターでは、低遅延の会話、言語切り替え、会話中の情報取得まで含めた体験設計が競争軸になる可能性があります。
- 導入企業の法務部門: 本人の同意確認やSynthID・C2PA情報の付与を前提に、声の再現範囲、生成物の表示、利用記録を運用へ組み込むことが求められそうです。
このニュースの背景
自然言語で声質やアクセント、演技、話す速度などを指定でき、100以上の言語や方言に対応する音声生成機能が示されました。
30秒の音声サンプルから声を再現できる一方、本人の同意確認や生成物へのSynthID・C2PA情報の付与も組み込まれています。
Live Avatarはリアルタイム対話と低遅延の動画配信を組み合わせ、97言語間の切り替えや会話中の非同期ツール呼び出しに対応します。
音声生成モデルはGemini APIとGoogle AI Studioから提供され、Live AvatarはGemini Enterpriseで展開されるため、開発者向け利用と企業導入の両面が想定されています。
関連するニュース
- Googleが視覚対話や多段階推論に対応するGemini新モデルを提供します。
- Googleが動画生成モデル「Gemini Omni 1.1 Flash」を発表し、延長生成や360pプレビューを追加しました。
- GoogleがGemini Notebookを音声会話や録音、インタラクティブなレポート作成に対応させます。
詳しい記事の内容はこちらから(引用元)
Googleは、音声生成モデル「Gemini 3.8 Flash TTS」「Gemini 3.8 Flash-Lite …
https://www.watch.impress.co.jp/docs/news/2143265.html