DC娱乐网

AI看长视频,开始自己找重点了? 让 AI 看一场 90 分钟发布会,传统做法往

AI看长视频,开始自己找重点了?
让 AI 看一场 90 分钟发布会,传统做法往往是固定抽帧:默认每秒取 1 帧,再把大量画面塞进上下文。问题是,静止镜头浪费 token,转瞬即逝的动作又可能刚好漏掉。

Google 9 月 1 日发布的 Gemini“智能体式视频理解”,换了一个思路:模型不再被动吞完整段固定帧率素材,而是根据问题主动决定看哪里、看多快,以及该读画面、听音频还是查转写。发现可疑片段时,它还能提高帧率和分辨率重看;找到证据后再组织答案。

这不是简单的“少抽几帧”。它把视频理解变成一个循环:先判断需要什么证据,再调用内部视频工具加载相关时间段,检查结果后继续搜索或输出。于是,同一段长视频里,“找发布会的三项新品”和“数清十秒内做了几次动作”,会走不同的观看路径。

Google 公布的标准视频分析基准显示,开启该模式后,token 消耗最高减少 88%,成本最高降低 66%,准确率最高提升 7%。注意三个数字都是“最高”,不是每个任务都能复现。当前支持 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash Lite;上传视频及公开 YouTube 视频都可用,API 中把 processing 设为 agentic 即可。

准备接入时,收藏这份四步判断:
1)长视频、找特定时刻、异常检测或动作计数,优先试 agentic;
2)5 分钟以下且追求最低延迟,或必须全片逐帧覆盖,保留 static 对照;
3)验收别只看答案,要同时记录准确率、总 token、成本和延迟;
4)检查返回步骤是否出现 processing_call 与 processing_result,确认模型真的动态导航过视频。

真正值得关注的变化,不是 AI “看得更多”,而是它开始学会把注意力花在最有信息量的片段上。长视频应用的竞争点,也会从上下文能塞多大,转向证据找得准不准、过程能不能验。

一手 Gemini 视频理解 开发者