Google 已为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型推出“代理式视频理解”(agentic video understanding)功能。该系统不再以固定帧率从头到尾处理视频,而是在视觉帧、音频和转录文本之间进行动态搜索,只分析必要的片段。这种方法在提高分析准确性的同时,可将 token 消耗降低最多 88%,成本降低最多 66%,准确率最高提升 7%。
该功能支持查找亚秒级瞬间、更精准的异常检测以及精确计数等能力。其目标尤其是提高长视频的处理效率,涵盖从 10 分钟的教程、90 分钟的课程到数小时的录制内容。在受支持的模型中,Gemini 3.7 Flash 在整体质量以及质量与成本的平衡方面表现最佳。
在现有的静态处理模式下,模型默认以每秒 1 帧的速度扫描视频;这一速度可以通过 API 调整。而在代理式处理方式中,模型会自行决定观看什么内容、以何种速度观看以及通过哪个渠道观看,并借助内部工具加载相关视频片段。这样一来,开发者无需手动搭建这些处理流程。系统可以以不同帧率重新扫描快速运动,也可以用更少的 token 找到视频中的特定信息。
该功能可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 中用于视频上传内容及 YouTube 视频。要启用该功能,需要在 API 配置中将处理类型设置为“agentic”;标准 Gemini API token 定价适用,且不收取额外功能费用。
Google 很快将向 Gemini 应用中使用 Flash 和 Flash-Lite 模型的所有用户提供效率和质量改进。未来几个月内,这项技术还将集成到 YouTube 观看页面上的“Ask YouTube”功能中。
为何重要
这一变化减轻了处理长视频存档的开发者在分析过程中的技术负担;由模型自行确定要检查哪些片段和数据渠道,减少了构建自定义扫描逻辑的必要性。更低的 token 使用量和成本,尤其有助于在数小时的录制内容上进行详细搜索、计数和异常检查,并将这些操作控制在现有 API 定价范围内。不过,要利用这一功能,开发者还需要在 API 配置中单独将处理类型选择为 agentic;因此,标准视频处理流程不会自动发生变化。目前来看,访问权限似乎仅限于通过 API 使用 Google AI Studio 和 Gemini Enterprise Agent Platform,而面向 Gemini 应用和 YouTube 的使用何时完成所公布的推广,尚未明确。
术语:帧率
帧率是每秒绘制的图像数量;帧率越高,动作看起来就越流畅。