Google、ライブ対話モデル「Gemini 3.8 Live」を提供

Googleは9月15日、最新のライブ対話モデル「Gemini 3.8 Live」を発表しました。
推論を強化した上位モデル「Gemini 3.8 Live Extended Thinking」も同時に発表しました。
音声と視覚情報を組み合わせた対話や、エージェントによるタスク遂行に対応します。

記事の概要

Googleは9月15日、ライブ対話モデル「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」を発表しました。
両モデルは音声だけでなく、視覚的な入力を含む対話に対応します。
Gemini 3.8 Liveは、スケーラビリティとコスト効率を重視して構築されています。
Extended Thinkingは多段階の推論に対応し、より複雑なタスクを処理できます。
Gemini 3.8 Liveは15日から、全ユーザー向けにGemini Liveで提供されています。
開発者向けにはGemini APIとGoogle AI Studioで、企業向けにはGemini Enterpriseのプライベートプレビューで展開します。
Extended Thinkingは、Artificial AnalysisのSpeech to Speech Quality Indexで総合1位となる82.6を獲得しました。

記事のポイント

  1. 非同期のツール呼び出し: Gemini 3.8 Liveは、音声応答を続けながら、バックグラウンドでAPIやツールを非同期に呼び出せます。
  2. 視覚情報と多言語対応: リアルタイムの視覚入力を会話に反映し、97以上の言語でアクセントの一貫性を保って応答できます。
  3. 推論モデルの評価: Extended Thinkingは多段階推論に対応し、Speech to Speech Quality Indexで総合1位の82.6を獲得しました。

このニュースがもたらす影響

  • 導入を検討する企業: 音声で応答しながら裏側でAPIやツールを動かせるため、問い合わせ対応にとどまらず、確認や手続きまで担わせる業務設計を検討しやすくなります。
  • 音声AI開発者: Gemini APIとGoogle AI Studioで利用できるため、視覚入力・多言語音声・非同期処理を組み合わせたエージェントの試作と、コストを意識した大規模展開の検証が進みそうです。
  • 同業のAIベンダー: リアルタイムの視覚対話や多段階推論、97以上の言語への対応が示されたことで、音声品質だけでなく、タスク遂行力や導入コストを含む比較が求められそうです。

このニュースの背景

音声だけでなく視覚情報も扱うライブ対話モデルが、一般ユーザー向けから開発者向け、企業向けへと展開されています。
Gemini 3.8 Liveは、音声応答を続けながらバックグラウンドでAPIやツールを呼び出せる設計です。
上位版のExtended Thinkingは多段階推論に対応し、音声エージェントによる複雑なタスク遂行を想定しています。
一方で、通常版はスケーラビリティとコスト効率を重視しており、異なる用途に向けた2モデルが用意されています。

関連するニュース

詳しい記事の内容はこちらから(引用元)

Impress Watch

Googleは15日(米国時間)、最新のライブ対話モデルとなる「Gemini 3.8 Live」と「Gemini 3.8…

グーグル、新ライブ対話モデル「Gemini 3.8 Live」 推論強化の上位版も – Impress Watch
https://www.watch.impress.co.jp/docs/news/2141266.html

最新情報をチェックしよう!
>ビジネスを飛躍させるAIキュレーションメディア「BizAIdea」

ビジネスを飛躍させるAIキュレーションメディア「BizAIdea」

国内外の最新AIに関する記事やサービスリリース情報を、どこよりも早くまとめてお届けします。
日々BizAIdeaに目を通すだけでAIの最新情報を手軽にキャッチアップでき、
AIの進化スピードをあなたのビジネスの強みに変えます。

SNSをフォローして頂くと、最新のAI記事を最速でお届けします!
X: https://twitter.com/BizAIdea
Facebook: https://www.facebook.com/people/Bizaidea/61554218505638/

CTR IMG