快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

论文 今天 · 星期三 · 09-02 01:16 约 1 分钟读完

谷歌为Gemini模型引入智能体视频理解,成本降66%准确率升7%

摘要

谷歌宣布在Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite中推出智能体视频理解功能,通过动态搜索视觉帧、音频和转录文本,降低视频分析成本最高66%,Token消耗减少88%,准确率提升7%,且不额外收费。

谷歌于今日宣布,在最新发布的Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite模型中,正式推出智能体视频理解(agentic video understanding)功能。该功能旨在优化视频分析流程,通过动态筛选关键信息,显著提升模型在视频理解任务中的表现,同时大幅削减资源消耗。

与传统的静态处理方式不同——即模型按固定帧率(默认1 FPS,可调)读取视频流——智能体视频理解将核心推理能力与原生视频工具结合,使模型能够主动在视觉帧、音频轨道和转录文本中搜索、扫描并检查目标片段。这种按需取用的模式,避免了处理冗余帧带来的开销。

根据谷歌公布的基准测试数据,在标准视频分析任务中,启用该功能的Gemini模型可将分析成本降低最高66%,Token消耗量减少最高88%,同时准确率提升最高7%。效率增益在长视频场景中尤为突出,因为静态处理常迫使开发者在高额Token成本与细节丢失之间权衡。

谷歌特别指出,Gemini 3.7 Flash配合智能体视频理解,在整体质量与成本效率之间实现了最佳平衡,位于准确率与成本的帕累托最优前沿。该功能采用标准Gemini API Token定价,不收取额外功能费用,降低了开发者的采用门槛。

谷歌Gemini智能体视频理解AI成本优化
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词