米Tavusは10月1日、音声と映像を同時に理解する対話モデル「Griffin」を発表しました。
研究プレビュー版との1分間のビデオ通話で、参加者の48%が相手を実在の人間だと判断しました。
Griffinは、会話中の間や相づち、表情、視線などをリアルタイムに生成する設計です。
現時点では初期テスターに限って提供し、一般公開には安全対策が必要としています。
記事の概要
Tavusが発表したGriffinは、音声と映像を同時に理解して応答する対話モデルです。
同社はGriffinを、人間との相互作用に特化した「Human Interaction Model(HIM)」と位置付けています。
社内試験では、研究プレビュー版「Griffin-Lite」と1分間通話した54人のうち26人が、相手を人間と判断しました。
参加者は米国と欧州から募集され、相手が別の参加者だと伝えられたうえで試験に参加しました。
Griffinは相手が話し終えるまで待たず、1秒未満の間隔で話す、待つ、相づちを打つ判断を繰り返します。
表情や視線、身振りも会話の流れに合わせて生成し、リアルタイムの対話を目指しています。
Tavusによると、従来システムの判定通過率は3%未満で、GriffinはNVIDIAのフルデュプレックスAIビデオベンチマークで首位です。
同社はAIであることを示す機能などの安全対策を進め、課題への対応後に一般提供する方針です。
記事のポイント
- 人間と判断した参加者: 54人中26人がGriffin-Liteを人間と判断し、判定率は48%に達しました。
- 1秒未満で応答を判断: 音声や映像を確認しながら、発話や沈黙、相づちを1秒未満で判断します。
- 一般提供は安全対策後: AIであることを示す機能などを整備し、初期テスター以外への提供は見送っています。
このニュースがもたらす影響
- 導入を検討する企業: 顧客対応に使う場合、回答精度だけでなく、会話の間や視線まで含む自然さと、AIであることを示す仕組みを導入条件として確認する必要がありそうです。
- 同領域のサービス提供者: 従来システムとの差別化は、応答内容だけでなく、発話の重なりや沈黙、表情まで含めたリアルタイム性に移る可能性があります。一方、安全対策も競争条件になりそうです。
- 顧客対応の設計担当: 利用者が相手を人間と誤認する可能性を踏まえ、AIであることの表示や説明を会話体験にどう組み込むか、一般提供前から検討することが求められそうです。
このニュースの背景
Griffinは音声と映像を同時に理解し、相手の発話を待ち切らずに話す、待つ、相づちを打つ判断を1秒未満で繰り返す設計です。
社内試験では、米国と欧州から募った54人のうち26人が、1分間のビデオ通話相手を実在の人間だと判断しました。
人間と見分けにくい対話を実現する一方、TavusはAIであることを示す機能などの安全対策が必要だとして、一般提供を見送っています。
関連するニュース
- OpenAIが画像生成モデルImages 2.5を提供し、編集性能と生成速度を高めました。
- ナレッジホールディングスがAI利用者306人を調査し、79.1%が回答の誤りを経験したと発表しました。
- 株式会社ファーストが生成AI利用者760人を調査し、対話による幸福感や人間関係への影響を明らかにしました。
詳しい記事の内容はこちらから(引用元)
1分間話した参加者のほぼ半数が人間だと思った話し相手はAIだった──。米Tavus社は10月1日、音声と映像を同時に理解…
https://ascii.jp/elem/000/004/439/4439453/