Googleは8月26日、音声文字変換モデル「Gemini 3.5 Transcribe」を発表しました。
背景ノイズを抑え、間投詞や自己修正を処理しながら、音声を洗練されたテキストに変換します。
今後はGemini APIやGemini Enterprise Agent Platformでも利用できる予定です。
記事の概要
Gemini 3.5 Transcribeは、自然な話し方やユーザーの意図、独自の語彙を認識できる音声文字変換モデルです。
「えー」「あー」などの間投詞を除去し、自己修正を処理して、テキストを自動的にフォーマットします。
関数呼び出しにより、画像生成やファイル分析などのタスクを他のGeminiモデルへ委任できます。
Artificial Analysisの測定では、ワードエラー率(WER)はストリーミングで4.0%、非ストリーミングで2.6%です。
85以上の言語を自動検出し、地域のアクセントや多様な方言にも対応します。
事前録音音声では、最大3人の話者をタイムスタンプ付きで識別できますが、3人を超える話者への対応はテスト段階です。
従来モデル「Chirp 3」と比べ、新機能や単語誤り率の改善に加え、遅延も短縮しています。
記事のポイント
- 高精度な音声変換: 背景ノイズを抑え、注文IDや郵便番号などの英数字も正確に認識します。
- 複数話者を識別: 事前録音音声では、最大3人の発言をタイムスタンプ付きで特定します。
- APIなどへ提供拡大: 今後はGemini APIとGemini Enterprise Agent Platformで利用できる予定です。
このニュースがもたらす影響
- 導入を検討する企業: 会議・問い合わせ・現場記録をテキスト化する際、話者分離や専門語の補正を前提に業務設計を見直せそうです。API提供後は自社データで精度と運用負荷を検証する必要があります。
- 音声サービス提供者: 音声入力を組み込むサービス提供者は、単なる文字起こしではなく、発話からファイル分析などへつなぐ処理まで設計しやすくなります。3人を超える会話への対応は、なお検証が必要です。
- AI基盤の選定担当: 多言語や方言を含む音声処理を複数の業務へ展開する企業では、個別モデルを組み合わせる構成から、Geminiを軸に機能を連携させる構成へ見直す可能性があります。
このニュースの背景
Gemini 3.5 Transcribeは、GeminiアプリやAndroidなどGoogle製品の音声機能に先行して組み込まれています。
今後はGemini APIとGemini Enterprise Agent Platformから利用できる予定で、企業が自社の業務システムへ組み込む選択肢が広がります。
間投詞や自己修正の処理、カスタム語彙、話者識別に加え、他のGeminiモデルへタスクを委任する関数呼び出しにも対応しています。
Artificial Analysisの測定では、ワードエラー率はストリーミングで4.0%、非ストリーミングで2.6%とされています。
関連するニュース
- GoogleがmacOS版Geminiに音声機能を追加し、文章処理や画像生成に対応しました。
- OpenAIがリアルタイムと録音向けの音声文字起こしモデルをAPIで提供開始しました。
- SUPERNOVAがStella AIとStella AI for BizでGemini 3.7 Flashの提供を始めます
詳しい記事の内容はこちらから(引用元)
Googleは26日(米国時間)、新しい高精度な音声文字変換モデル「Gemini 3.5 Transcribe」を発表し…
https://www.watch.impress.co.jp/docs/news/2136424.html