Googleは9月1日、Gemini 3.7 Flash・3.6 Flash・3.5 Flash-Liteの3モデルに、動画を自律的に解析する新機能「Agentic Video Understanding(エージェント型動画理解)」を導入したと発表した。従来の動画解析は動画を一定間隔でサンプリングし常に全フレームを処理する固定フレームレート方式が中心だったが、新方式ではモデル自身がGeminiのネイティブな動画ツールを使い、必要な区間を動的にスキャンして解析対象を選び取る。
Google公式の発表によれば、この方式変更により長尺動画を扱う際のトークン消費量を最大88%、解析コストを最大66%削減できるとしている。同時に精度も最大7%向上するとしており、瞬間的な出来事を秒単位で検索する「モーメント検索」や、より正確な異常検知、精密なカウントなど、これまで長尺動画では処理コストの高さから実用が難しかった用途にも道を開くという。
現時点ではGoogle AI StudioやGemini Enterprise Agent Platform経由のGemini APIから、動画アップロードおよびYouTube動画を対象に利用可能。一般消費者向けのGeminiアプリへの提供は「近日中」としており、YouTubeの「Ask YouTube」機能への搭載は数カ月後を見込むとしている。
出典: officechai



