谷歌今日宣布在最新的 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中,推出功能。该新功能可提升分析准确率,同时大幅减少分析过程中的 Token 使用量和成本。
与现有“静态”处理方式不同,智能体理解将模型核心推理与原生工具结合,可在
在标准分析基准测试中,搭载智能体理解的 Gemini 模型可将分析成本降低最高 66%,Token 消耗量降低最高 88%,同时将准确率提升最高 7%。这类效率提升在长场景中尤为明显,因为传统静态处理会让开发者不得不在高 Token 成本和丢失关键细节之间做取舍。
谷歌指出,Gemini 3.7 Flash 搭配智能体理解可实现最佳的整体质量,同时在质量和成本效率间达到最优平衡,在理解任务中,位于准确率与成本的帕累托最优前沿。
不同于静态处理中模型按固定帧率读取媒体流,智能体理解让 Gemini 可以主动、有目标地决定观看哪些内容、以何种速度观看、通过哪种模态获取信息,仅提取所需的片段和信号。此前开发者只能手动完成这类操作,而借助智能体理解,Gemini 可通过智能循环完成,调用内部工具加载相关部分,大幅减少开发工作量。
谷歌还计划将这项能力推广到旗下更多面向普通用户的产品,该功能很快就会向 Gemini 应用中所有 Flash 和 Flash-Lite 模型用户推送;未来几个月内,智能体理解还为 YouTube 观看页的“Ask YouTube”功能提供支持,借助 Gemini 提供基于画面的更高质量回答。










