Google、Geminiの動画解析を動的化しトークン88%削減

Googleは9月1日(米国時間)、Geminiの動画解析機能「Agentic video understanding」を発表しました。
質問や目的に応じて、確認する場面やフレームレート、情報の種類をGeminiが判断します。
従来方式と比べ、トークン消費量を最大88%、コストを最大66%削減し、精度を最大7%向上できるとしています。

記事の概要

対象モデルはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteです。
動画アップロードとYouTube動画を対象に、Google AI StudioのGemini APIとGemini Enterprise Agent Platformで利用できます。
従来は動画を固定フレームレートで取り込み、映像全体を静的に処理していました。
Agentic video understandingでは、映像フレーム、音声、文字起こしから必要な情報を動的に検索、スキャン、検査します。
1秒未満の場面検索、長尺動画の情報検索、異常検知、動作や物体のカウントに対応します。
ベンチマークでは、対応する3モデルすべてで効率改善が確認されています。
利用時はGemini APIの設定で動画処理を「agentic」に指定し、追加料金なしで通常のトークン料金を利用できます。

記事のポイント

  1. 解析対象を動的選択: Geminiが質問や目的に応じ、確認箇所やフレームレート、映像・音声・文字起こしを選びます。
  2. コストと精度を改善: 従来方式と比べ、トークン消費量を最大88%、コストを最大66%削減し、精度を最大7%向上できます。
  3. 製品への展開も予定: 今後数カ月以内に、YouTubeの視聴ページで使える「Ask YouTube」への導入を予定しています。

このニュースがもたらす影響

  • 導入検討企業: 長尺動画の検索や異常検知を組み込む企業は、処理対象を一律に増やす設計から、質問ごとに映像・音声・文字起こしを使い分ける構成へ見直す余地があり、導入前の精度検証が求められそうです。
  • 動画分析事業者: 同じ領域のサービス提供者は、解析精度だけでなく、トークン消費量とコストを抑えながら1秒未満の変化を扱えるかが比較軸になり、料金設計やベンチマークの示し方を再考する可能性があります。
  • 動画サービス事業者: 動画サービス事業者は、視聴者の質問に対して長尺動画から必要箇所を返す機能を、APIの通常料金で利用できる条件も踏まえて検討しやすくなり、検索・視聴体験の差別化を急ぐことになりそうです。

このニュースの背景

従来の動画解析は、動画全体を固定フレームレートで処理するため、長尺動画ほどトークン消費量やコストが大きくなりやすい方式でした。
また、1秒未満の状態変化や細かなカットの境目を捉えにくく、重要な場面を見落とす可能性がありました。
今回の機能は、映像フレーム、音声、文字起こしから、質問や目的に応じて必要な情報だけを動的に確認する仕組みです。
追加の機能料金はなく、通常のGemini APIのトークン料金で利用できる設計です。

関連するニュース

詳しい記事の内容はこちらから(引用元)

Impress Watch

Googleは9月1日(米国時間)、Geminiの動画解析機能「Agentic video understanding」…

Geminiの動画解析が進化 “見逃し”減らしトークンも88%削減 – Impress Watch
https://www.watch.impress.co.jp/docs/news/2137587.html

最新情報をチェックしよう!
>ビジネスを飛躍させるAIキュレーションメディア「BizAIdea」

ビジネスを飛躍させるAIキュレーションメディア「BizAIdea」

国内外の最新AIに関する記事やサービスリリース情報を、どこよりも早くまとめてお届けします。
日々BizAIdeaに目を通すだけでAIの最新情報を手軽にキャッチアップでき、
AIの進化スピードをあなたのビジネスの強みに変えます。

SNSをフォローして頂くと、最新のAI記事を最速でお届けします!
X: https://twitter.com/BizAIdea
Facebook: https://www.facebook.com/people/Bizaidea/61554218505638/

CTR IMG