谷歌为 Gemini 推出智能体视频理解功能,分析成本最高降低 66%
谷歌宣布为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能。不同于以固定帧率处理整段视频的传统方式,该功能可动态搜索视频画面、音频和转录文本,仅分析与任务相关的片段。谷歌表示,在标准视频基准测试中,该功能可将分析成本最高降低 66%、Token 消耗量最高降低 88%,同时将准确率提升最多 7%。它可用于亚秒级片段检索、长视频查询、异常检测,以及动作和物体计数。目前该功能已通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 提供,开发者将处理模式设置为“agentic”即可启用。谷歌计划未来将其扩展到 Gemini 应用和 YouTube 的“Ask YouTube”功能。
本文来源:IT之家,仅供学习参考,版权归原作者所有。