谷歌为Gemini模型引入智能体视频理解,成本降66%准确率升7%
摘要
谷歌宣布在Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite中推出智能体视频理解功能,通过动态搜索视觉帧、音频和转录文本,降低视频分析成本最高66%,Token消耗减少88%,准确率提升7%,且不额外收费。
谷歌于今日宣布,在最新发布的Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite模型中,正式推出智能体视频理解(agentic video understanding)功能。该功能旨在优化视频分析流程,通过动态筛选关键信息,显著提升模型在视频理解任务中的表现,同时大幅削减资源消耗。
与传统的静态处理方式不同——即模型按固定帧率(默认1 FPS,可调)读取视频流——智能体视频理解将核心推理能力与原生视频工具结合,使模型能够主动在视觉帧、音频轨道和转录文本中搜索、扫描并检查目标片段。这种按需取用的模式,避免了处理冗余帧带来的开销。
根据谷歌公布的基准测试数据,在标准视频分析任务中,启用该功能的Gemini模型可将分析成本降低最高66%,Token消耗量减少最高88%,同时准确率提升最高7%。效率增益在长视频场景中尤为突出,因为静态处理常迫使开发者在高额Token成本与细节丢失之间权衡。
谷歌特别指出,Gemini 3.7 Flash配合智能体视频理解,在整体质量与成本效率之间实现了最佳平衡,位于准确率与成本的帕累托最优前沿。该功能采用标准Gemini API Token定价,不收取额外功能费用,降低了开发者的采用门槛。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗