谷歌推出智能体视频理解功能:提升 Gemini 模型视频分析准确率,大幅降本减耗
IT之家 9 月 2 日消息,谷歌今日宣布在最新的 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中,推出 智能体视频理解(agentic video understanding)功能。该新功能可提升视频分析准确率,同时大幅减少视频分析过程中的 Token 使用量和成本。该功能使用标准 Gemini API Token 定价,不收取额外功能费用。与现有“静态”处理方式(模型按固定帧率读取视频,默认 1 FPS,可通过 API 调整)不同,智能体视频理解将模型核心推理与原生视频工具结合,可在视觉帧、音频和转录文本中动态搜索、扫描和检查目标视频片段。在标准视频分析基准测试中,搭载智能体视频理解的 Gemini 模型可将分析成本降低最高 66%,Token 消耗量降低最高 88%,同时将准确率提升最高 7%。这类效率提升在长视频场景中尤为明显,因为传
原文:IT之家