过去让多模态模型理解一段视频,常见做法是按固定频率抽帧,再把画面、音频和字幕一起送进模型。方法简单,却有一个明显缺陷:无论问题落在第十秒还是第二小时,系统都要先为整段素材付费。Google在9月1日为Gemini推出的代理式视频理解,试图把这个顺序倒过来——模型先判断应该去哪里找,再对目标片段加密采样和反复检查。
这项能力已经用于上传视频和YouTube视频,覆盖Gemini 3.7 Flash、3.6 Flash与3.5 Flash-Lite,可通过Gemini API、Google AI Studio以及Gemini Enterprise Agent Platform调用。Google同时给出了明确边界:Gemini应用中的普及将“很快”开始,YouTube里的Ask功能则要等未来几个月,因此它不是所有消费者今天都能直接使用的统一升级。
官方测试称,相比默认每秒一帧的处理方式,新方法最多可减少88%的视频Token、降低66%的成本,并在部分评测上把回答质量提高最多7%。这些数字描述的是Google选定任务和设置下的结果,不能直接推导为每个视频都能省下同样比例。真正值得关注的是,视频理解第一次更像一次带搜索策略的调查,而不是一次从头到尾的机械扫描。
模型先搜索、再定位、最后复核,长视频不必全部展开
代理式处理的核心,是让模型在“搜索—扫描—检查”的循环中自主选择工具。当用户问某个动作何时发生,模型可以先读取字幕、音频线索和稀疏画面,缩小时间范围;找到候选片段后,再提高抽帧密度,逐帧确认物体、人物和动作关系。如果证据不足,它可以换一个时间段继续找,而不是基于第一次采样立即作答。
这种差异在长视频里尤其明显。两小时的会议录像中,用户也许只想知道某位发言人何时承诺交付;体育录像中,问题可能只是一次犯规之前发生了什么;工业巡检视频则可能要定位几帧异常火花。固定抽帧会把大量无关画面都编码进去,低频采样又可能刚好漏掉关键瞬间。动态策略把算力集中到“值得看”的位置,既减少上下文占用,也让模型有机会回到原始证据复核。
Google列出的适用任务包括亚秒级时刻检索、长片段中的“针尖”搜索、异常检测和计数。这里不能把“能搜索”误写成“永不漏检”。视频压缩、字幕错误、镜头切换、遮挡以及事件持续时间过短,仍可能让第一轮搜索得到错误候选。代理会使用更多步骤,也意味着延迟和调用轨迹比一次性推理更复杂。省下的主要是无关视频Token,不代表每一次请求都会更快。
对开发者而言,另一个变化是可观察性。过去的失败通常只表现为答案错误,很难知道模型是没看到关键帧,还是看到了却理解错。带工具的流程可以留下搜索区间、重新采样位置和复核步骤,团队由此能把评测拆成“找得准不准”和“看懂没有”两部分。若Google在生产接口中持续提供足够的过程记录,视频应用的调试会比纯黑箱问答更可控。
成本下降会打开新场景,但权限、证据和评测不能跟着变松
Google称这项能力沿用标准Token价格,没有额外功能费。对需要处理海量素材的团队,这比单次演示更重要。客服可以在录屏中定位操作失败的瞬间,媒体机构可以在授权素材库中寻找某段发言,制造企业可以先让系统筛出少量可疑时段,再交给人工复核。过去因为整段编码太贵而无法常态化运行的任务,可能开始具备经济性。
但成本降低也会放大治理问题。视频往往同时包含人脸、声音、位置、屏幕内容和旁观者信息,搜索效率提高并不自动带来处理权限。企业必须明确哪些素材允许上传、保存多久、谁能查询以及结果能否用于人事、安全或合规判断。尤其在监控和医疗场景,模型给出的时间点应该被视为候选证据,而不是未经复核的事实结论。
评测方式也要改变。只统计最终答案正确率,会掩盖系统恰好猜对却找错片段的情况。更可靠的测试至少要分别检查定位区间、关键帧覆盖、回答依据和不确定性表达,还要加入没有目标事件的视频,观察模型会不会为了完成任务而虚构一个时间点。对于计数任务,应测试遮挡、重复出现和镜头切换;对于异常检测,则要看低照度、噪声和不同摄像头下的稳定性。
这次更新没有让Gemini“看完所有视频”,而是让它学会有选择地看。对AI产品而言,这是一条更现实的扩展路径:不是不断扩大上下文,把所有素材一股脑塞给模型,而是让模型先制定取证路线,再把昂贵的视觉计算用在少数关键位置。省Token只是表层收益,真正的转折是视频理解从一次推理变成了可以检查、迭代和约束的工作流。

