谷歌DeepMind为Gemini系列模型推出了名为agentic video understanding(智能体视频理解)的新功能。该功能允许模型动态扫描视频片段,在提升准确性的同时,将token消耗最高降低88%,成本最高降低66%。
该功能今日起可用,支持Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite三个模型。开发者可在Google AI Studio或Gemini Enterprise Agent Platform中将API配置设置为"agentic"即可使用,支持视频上传和YouTube链接两种方式。
![]()
与静态处理的区别
当前的"静态"处理方式中,模型以固定的每秒帧数(默认1 FPS,可通过API调整)摄取视频。而agentic video understanding将模型的核心推理与原生视频工具结合,动态搜索、扫描并检查目标视频片段,涵盖视觉帧、音频和转录文本。
基准测试结果
在标准视频分析基准上,启用该功能的Gemini模型将分析成本最高降低66%,token消耗最高降低88%,准确性最高提升7%。这些效率提升在长视频场景(从10分钟教程到更长内容)中尤为明显。
新能力
该功能还解锁了新的视频处理能力,包括亚秒级时刻检索(sub-second moment retrieval)、更精准的异常检测、精确计数等。这些能力在静态处理模式下难以实现。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.