1時間の説明動画を見終えた後で、「あの設定を変えていた場面、どこだったっけ」となる。再生バーを動かし、少し戻し、また行き過ぎる。欲しいのは20秒なのに、探すだけで10分が消えていく。
動画をAIに渡す価値は、要約してもらうことだけではない。見たかった一瞬へ、言葉でたどり着けること。Geminiの新しい動画理解と、Twelve LabsやAmazonの動画検索を並べると、その変化が見えてくる。
たった0.2秒の表示を、見つけにいく
Google Developer ExpertのJimmyLiao氏は、Gemini 3.7 Flashの新旧の動画処理を比べる検証を公開した。画面録画に一瞬出る読み込み表示を探す課題では、新しいagentic処理が約0.2秒の表示を捉えた一方、従来のstatic処理は別の長い表示場面を選んだという。JimmyLiao氏の24回の検証
アプリを使っていて「一瞬だけ画面がおかしかった」と思っても、どこで起きたか説明できないことがある。そんな場面の候補をAIが指してくれれば、動画全体を何度も見返さなくて済む。これは、その検証から私が考える実用場面だ。バグを自動で診断できたという実証とは分けておきたい。
動画の内容を大ざっぱに分かることと、短い出来事を取り逃がさないこと。その間には、思った以上に距離がある。
Geminiは、質問を聞いてから見る場所を決める
Googleが2026年9月1日に発表したagentic video understandingは、モデルが自ら、どこを、どんな速さで、映像・音声・文字起こしのどれを使って見るかを選ぶ仕組みだ。気になる場所を詳しく見直す処理を、APIの内部で行える。Googleの発表
たとえるなら、動画を一定間隔で写真にして全部渡す方法から、目的を聞いた助手が、必要な場所で立ち止まって見直す方法へ近づいた。もちろん助手は比喩であり、人と同じ注意の仕組みだという意味ではない。
「講演全体の主張を知りたい」と「画面のボタンが一瞬消えた場所を探したい」では、必要な見方が違う。後者なら、該当しそうな数秒を細かく確認する意味がある。前者なら、発話を軸に全体を把握したほうが効率的かもしれない。
9月7日に確認した開発者向け文書では、3.8 Flash、3.7 Flash、3.6 Flash、3.5 Flash-Liteが対応モデルとして挙げられている。一般向けGeminiアプリへの展開予定と、開発者がAPIで使える状態は同じではない。本稿で扱う実測は3.7 Flashのものだ。現在のAPI仕様
他の動画AIとは、何が違うのか
ここで「Geminiが動画検索を発明した」と捉えると、選び方を間違える。既に、膨大な映像を検索できるようにする別の仕組みがある。
| 仕組み | 動画をどう扱うか | 仕事への当てはめ方 |
|---|---|---|
| Geminiのagentic動画理解 | 質問に合わせて、動画の必要な部分を読み込み直す | 届いた録画について、その場で詳しく質問する |
| Twelve Labs Marengo 3.0 | 映像・音声などを、意味で検索できる表現へ変換する | 大量の映像から、場面や動作の候補を探す |
| Amazon Nova Multimodal Embeddingsを使う検索構成 | 映像・音声の意味検索と、発話等の検索を組み合わせる | 社内の映像庫を、自社の検索システムへ組み込む |
同じ条件での性能順位ではなく、公式仕様・構成例から整理した用途の比較です。導入方法や料金体系も異なります。
Marengo 3.0は、文章だけでなく画像と文章を組み合わせた検索にも対応する。たとえば、選手の画像に動作の条件を添え、試合映像から該当する場面を探す。名前が実況で呼ばれていない瞬間も、映像側の情報が手掛かりになる。Marengo 3.0の技術説明
Amazonが公開する構成例では、動画を場面ごとに区切り、映像・音声から検索用の情報を作る。発話はAmazon Transcribeで文字にし、意味の近さと単語の一致を組み合わせる。返ってくる結果には、場面の開始・終了時刻が付く。AWSの動画検索実装例
一度だけ調べたい会議録画と、何度も探し直す何千本の映像庫。前もって検索の下ごしらえをする価値は、同じではない。「最強の動画AI」を一つ決めるより、持っている動画と仕事の関係を見たほうが選びやすい。
放送局では、「眠っていた映像」を次の作品に使う
韓国の放送局SBSについて、Twelve Labsは、アーカイブからVFX用の参照映像や再利用できる場面を探す取り組みを紹介している。資料に挙がるのはMarengo 2.7と、分析・短尺要約の段階で使うPegasus 1.2だ。先ほど比較した3.0の導入実績ではない。SBSの事例
ベンダーによる事例紹介ではあるが、用途は具体的だ。新しい映像を作るために、過去の映像をもう一度使えるようにする。AIが作品を全部生成することだけが、制作の革新ではない。
この発想は小さな現場にも持ち込める。何年分もの製品デモから特定の操作を探す。スポーツの練習録画から、同じ動作を繰り返した場面を集める。インタビューから、ある問いに答えた部分を候補として出してもらう。これらは応用のアイデアで、すべてを本稿で実測したわけではない。それでも、手元の録画の見え方は変わるはずだ。
詳しく見直すぶん、高くなることもある
冒頭の検証は、素材2本に計4課題を設定し、2モードを各3回、計24回比較したものだ。長い講演の要約では、新方式が使うトークンの中央値は1,394、従来方式は57,610だった。一方、短い画面録画の動き検出では34,038対10,559と逆転した。各条件3回の小規模検証であり、普遍的な性能差ではない。
見直す回数が増えれば、処理も増えうる。速く安く済む場合もあれば、細部を探すために時間と費用を使う場合もある。「新モードだから全部安い」ではないわけだ。
別の小規模な公開検証でも、短い出来事を拾う改善と、広い範囲の抽出や出力形式での失敗が併存していた。こちらは合成素材を使った投稿者自身のテストで、独立した追試とは区別する。開発者フォーラムの検証報告
まず、戻って確かめられる答えをもらう
試すなら、長大な仕組みを先に作るより、探し直すのが面倒だった録画を一本選ぶところからでよい。私なら、こんな聞き方をする。
この説明動画で、保存先の設定を変更している場面を探して。開始時刻と終了時刻、その場面に映っている操作を短く書いて。似た場面が複数あれば、候補を分けて。見つからなければ、見つからないと伝えて。
編集部による質問例です。このプロンプトの実行結果を示すものではありません。
時刻が返ってきたら、その前後を再生する。候補を探す長い手間をAIへ渡し、合っているかを確かめる短い時間を人が持つ。見落とせない検査では、それだけに依存せず、全体確認の工程も残す。
録画は、保存しただけでは使える知識にならない。「あの場面へ戻れる」が増えるほど、過去に撮った時間を、これからの仕事で使い直せる。動画AIの進歩で私が楽しみにしているのは、そこだ。


