Gemini Agentic Video Understanding 最適合「從長影片找特定事件」,不代表所有影片分析都該立刻改用。 它讓模型依問題動態搜尋時間軸,需要時才載入影格、聲音或逐字稿;傳統 Static 模式則固定以 1 FPS 取樣並一次放進 context。長講座、會議錄影和多小時素材可能因此少用 Token,但短片、低延遲與完整逐格檢查仍有保留 Static 的理由。
Google 已在 2026 年 9 月 1 日把這項功能開放給 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite,可透過 Gemini API 分析上傳影片或公開 YouTube 影片。Gemini app 的普及和 Ask YouTube 整合仍是後續推出項目,現在能直接使用的是 API 與 Gemini Enterprise Agent Platform,兩者不要混為一談。
Agentic Video 和 Static 差在哪?
Static 像是先把影片按固定頻率截圖,再讓模型一次閱讀所有取樣結果。Agentic 則會先理解問題,反覆決定要看哪個時間區段、用較高或較低 FPS 重看,或改讀聲音與逐字稿。這裡的「Agentic」專指影片檢索策略,不包含自動剪片或生成新影片;要製作新畫面,應看 AI 影片生成工具比較。
- 90 分鐘演講中找三個公告:先測 Agentic。問題範圍窄,不必平均處理整支影片。
- 找快速出現的異常或精確剪輯點:先測 Agentic。它可回到可疑區段,以不同 FPS 再檢查。
- 3 分鐘短片摘要且要求低延遲:先測 Static。Agentic 的內部搜尋可能增加首字延遲。
- 全片逐格品管或法遵封存:使用 Static 加專用工具。這類任務需要可證明的完整覆蓋,不能只依模型選片。
- 完整逐字稿:使用語音轉文字工具。Agentic 只載入回答所需內容,無法保證逐字轉錄。
Google 文件建議長影片或尋找特定片段時用 Agentic;5 分鐘內、延遲敏感或需要全片 frame-level precision 時可用 Static。若任務涉及安全、醫療、事故調查或合約證據,我不建議只依 Agentic 回答下結論,仍要回到原始時間碼與畫面人工覆核。
怎麼啟用 Gemini Agentic Video?
使用 Interactions API 時,在影片輸入加入 "processing": "agentic"。文字問題應放在影片項目之後,讓模型先取得媒體角色再處理任務。
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": video_file.uri,
"mime_type": video_file.mime_type,
"processing": "agentic",
},
{
"type": "text",
"text": "列出三項主要公告,附 MM:SS 時間戳與畫面或語音證據。",
},
],
)
公開 YouTube 影片可直接放 URL,但官方目前只支援 public,不支援 private 或 unlisted。自己的長影片可先用 File API 上傳;付費方案單檔上限為 20GB,免費方案為 2GB。支援格式包含 MP4、MOV、AVI、WebM、WMV、MPEG 與 3GPP。
提示詞不要只寫「摘要這支影片」。比較可驗收的寫法是指定時間範圍、要找的事件、證據格式與不確定時的處理,例如要求每個答案附 MM:SS、可見畫面或原句,找不到就寫「未找到」,不要補猜。這也符合 多模態 AI 驗證方法的基本原則。
30 分鐘影片大約多少 Token?
官方文件估算 Static 低媒體解析度約每秒 100 Token,高解析度約每秒 300 Token。因此 30 分鐘影片的純影片輸入基準約為:
| Static 設定 | 粗估輸入 Token | 以 3.7 Flash 促銷輸入價計算 |
|---|---|---|
| 低媒體解析度 | 約 180,000 | 約 0.135 美元 |
| 高媒體解析度 | 約 540,000 | 約 0.405 美元 |
這只是影片輸入的粗估,不含文字提示、輸出、thinking、快取或其他費用。Gemini 3.7 Flash 在 2026 年 12 月 31 日前的標準付費輸入價為每百萬 Token 0.75 美元,輸出含 thinking 為 3.75 美元;2027 年起官方已列出較高價格,正式部署應再查當時價格。
Agentic 的 Token 不能用固定秒數直接推算,因為模型會依內容與問題選擇工具。官方把探索時的推理記在 total_thought_tokens,載入的影格、聲音與逐字稿則記在 total_tool_use_tokens。部署時應讀取每次回應的 usage metadata,不要拿「最多省 88%」直接乘上預算。更完整的成本觀念可搭配 Token 效率指南。
可以把它當成值得測試的上限,不能當成保證。Google 表示在自家長影片 benchmark 中,Agentic 最多減少 88% Token、降低 66% 分析成本並提高 7% 準確度;這些數字由功能供應商公布,頁面沒有提供每個任務都能重現的承諾。
獨立研究也提醒,Agentic 影片理解仍很難。2026 年 8 月提出的 VideoGAIA 包含 271 個多輪、可呼叫工具的影片任務,每題由三位人類專家驗證;論文表示當時受測的前沿模型都低於 60% 準確率。這項研究沒有測 Google 9 月 1 日新推出的 Gemini Agentic 模式,因此不能拿來證明它表現差;它能證明的是「會自己找片段」仍不等於穩定理解所有影片。
上線前怎麼做 A/B 測試?
先挑一組真實影片與固定問題,同一模型各跑 Static 和 Agentic。每題記錄五項資料:答案是否命中、是否漏掉關鍵事件、時間戳是否正確、總 Token 與首字延遲。測試集至少要同時包含短片、長片、快速動作、只有聲音線索及畫面與逐字稿衝突的案例。
若 Agentic 只在平均 Token 勝出,卻常漏掉罕見事件,就不該直接取代既有流程。可以把它放在第一輪檢索,再讓 Static、專用偵測器或人工只檢查候選區段。評分方式可參考 AI benchmark 實務解讀,敏感影片上傳前則先依 AI 隱私檢查表移除不必要的人臉、個資與中繼資料。
常見問題
Gemini Agentic Video Understanding 是影片生成工具嗎?
不是。它分析既有影片,依問題動態尋找相關影格、聲音與逐字稿;不會因為開啟 Agentic 就自動生成或剪輯新影片。
哪些 Gemini 模型支援 Agentic Video?
截至 2026 年 9 月 2 日,官方文件列出 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite。其他模型仍可處理影片,但不一定支援 processing: "agentic"。
Agentic 模式一定比 Static 便宜嗎?
不一定。長影片與特定片段查詢較可能省 Token;短片可能因內部推理和工具往返增加首字延遲。應以自己的同片同題測試與 usage metadata 判斷。
可以直接分析私人 YouTube 影片嗎?
不能直接用 YouTube URL。官方文件目前只支援 public 影片,不支援 private 或 unlisted;有權處理的自有影片可改走 File API,並先確認資料政策與存取權限。
結論:先把 Agentic 當成可量測的檢索策略
Gemini Agentic Video 的實際價值,在於把固定取樣改成依問題選擇證據。對長講座、會議、教學影片與罕見事件搜尋,它可能同時降低 context 壓力和漏掉瞬間畫面的機率;對短片、全片覆蓋或高風險判斷,Static 與人工驗證仍不可省。
最穩的導入方式,是先選一個低風險長影片任務,以 Static 建立答案與成本基準,再開 Agentic 比較命中率、Token 和延遲。只有品質不退步且成本真的下降,才逐步擴大,不要用官方最大節省值替代自己的驗收。
參考來源
- Google:Introducing agentic video understanding with Gemini(2026-09-01)
- Google AI for Developers:Video understanding(2026-09-01)
- Google AI for Developers:Gemini Developer API pricing(2026-09-01)
- Google AI for Developers:What’s new in Gemini 3.7 Flash(2026-09-01)
- Zhang 等人:VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding(2026-08-12)