DeepMind 为 Gemini 系列新增智能视频解析,token 消耗最高降 88%
摘要
Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 agentic 视频理解功能,模型可动态扫描视频片段,相比固定帧率处理,token 消耗最多降低 88%,成本最多降低 66%,准确率最多提升 7%。
今日,Google DeepMind 宣布为其 Gemini 系列模型(3.7 Flash、3.6 Flash 和 3.5 Flash-Lite)推出全新的 agentic 视频理解能力。该功能旨在优化视频分析任务中的计算效率与准确性,为开发者提供更经济的多模态处理方案。
与传统的固定帧率采样不同,该功能采用动态扫描机制:模型会根据视频内容的重要性自动选择关键片段进行深度分析,而非均匀抽取所有帧。这种策略显著减少了冗余计算,在保持高准确率的同时大幅压缩了 token 消耗。
据官方数据,相比固定帧率处理,新方法的 token 消耗最多可降低 88%,成本最多可降低 66%,而准确率最多可提升 7%。这意味着在处理长视频或高频监控场景时,开发者能以更低的资源成本获得更精准的结果。
此次更新延续了 DeepMind 在高效 AI 推理上的技术路线,也反映了视频理解领域从“全量处理”向“选择性聚焦”的转变。对于依赖视频分析的行业,如自动驾驶、内容审核和智能安防,该功能有望显著降低云端计算开支并提升响应速度。
目前,该功能已面向 Gemini 系列 API 用户开放,开发者可通过官方文档获取集成指南。DeepMind 表示,未来将进一步优化动态扫描算法,以支持更复杂的多模态推理任务。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗