Google は 2026 年 9 月 1 日 (現地時間)、長時間の動画を扱う際のトークン消費量とコストを大幅に抑えながら、分析精度を高められる Gemini API 向け動画分析機能「エージェント型動画理解 (Agentic video understanding)」を発表しました。
この機能は Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite の 3 モデルに導入されており、Google AI Studio および Gemini Enterprise Agent Platform の Gemini API を通じて、動画ファイルのアップロードおよび YouTube 動画の分析に利用できます。
固定フレームレート処理からの転換
従来の動画分析では、動画を一定のフレームレート (デフォルトで 1 FPS、API で調整可能) で機械的に処理する「静的処理」が採用されていました。この方式では、開発者はトークンコストの増大か、コストを抑えて細部を見落とすリスクのいずれかを選ぶ必要がありました。
エージェント型動画理解では、AI モデル自身が動画のどの部分を、どの速度で、どのモダリティ (映像フレーム、音声、字幕) を通じて確認するかを能動的に判断します。
必要な場面や情報だけを動的に検索・走査・精査し、これまで開発者が手動で行っていた作業を Gemini がエージェントとして自動で処理できるようになりました。


標準的な動画分析ベンチマークにおいて、エージェント型動画理解を有効にした Gemini モデルは、分析コストを最大 66%、トークン消費量を最大 88% 削減しつつ、精度を最大 7% 向上させています。
効果は 10 分程度のハウツー動画から 90 分の講義、数時間に及ぶ録画まで、長時間の動画ほど顕著に表れるとしています。
Google によれば、3 モデルの中でも Gemini 3.7 Flash はエージェント型動画理解で最も高い精度を示し、コストと精度のバランスにおいても最良の結果を出しているとしています。
実現できる分析例
Google は、エージェント型動画理解によって、以下のような分析が可能になるとしています。
- サブ秒単位のモーメント検索 : 1 FPS では見落とされがちな一瞬の状態変化やカット境界を正確に特定
- 長時間動画からの検索 : 数時間に及ぶ動画に対しても、大量のトークンを消費せず複雑な質問に回答
- 異常検知 : 気になる時間帯を高い FPS で再サンプリングし、素早い動きや微細な視覚的異常を検査
- 動作・物体のカウント : 繰り返される物理的な動きや複数の物体を時系列で正確に追跡
例えば、素早い動きを伴う作業を分析する場合、必要な区間だけを高いフレームレートで見直すことで、通常の処理では取りこぼしやすい動作を正確に数えられます。
また、数時間規模の録画から特定の場面を探す用途でも、動画全体を均一に処理する必要がないため、少ないトークン消費で複雑な質問に答えられます。
提供状況と今後の展開
現時点では Google AI Studio および Gemini Enterprise Agent Platform の Gemini API を通じて、開発者向けに提供されています。
料金は既存の Gemini API の標準トークン料金がそのまま適用されるため追加料金は発生せず、API 設定でプロセッシング方式を「agentic」に指定するだけで利用できます。
Google は、この機能を Gemini アプリのユーザーにも段階的に展開する予定で、Flash および Flash-Lite モデルで近く利用可能になります。
また、今後数か月のうちに、YouTube の「YouTube に質問する」機能にもエージェント型動画理解が組み込まれる予定です。











