谷歌今天给开发者送了个大礼包。在最新的 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中,一项名为“智能体视频理解”的新功能正式上线。它的核心卖点很直接:让 AI 看视频时不再“傻看”,而是学会“挑着看”——结果就是分析成本最高降 66%,Token 消耗最高降 88%,准确率还能提升最高 7%。
这组数字放在长视频场景里尤其诱人。过去开发者处理几小时的视频素材,往往要在“烧掉海量 Token”和“漏掉关键细节”之间做痛苦取舍。现在,谷歌给出的方案是让模型自己决定该看什么、看多快、用哪种方式看。
![]()
从“逐帧扫”到“按需看”
传统静态处理方式很简单粗暴:模型按固定帧率读取视频,默认每秒 1 帧,开发者可以通过 API 调整。这种方式的问题在于,不管视频里有没有重要内容,模型都得从头到尾“扫”一遍,Token 消耗自然居高不下。
智能体视频理解则完全不同。它把模型的核心推理能力与原生视频工具结合起来,让 Gemini 能在视觉帧、音频和转录文本中动态搜索、扫描和检查目标片段。换句话说,模型不再被动接收所有画面,而是主动、有目标地决定:哪些内容值得看、以什么速度看、通过哪种模态获取信息——帧、音频还是转录文本。
这种“按需取用”的逻辑,只提取所需的片段和信号。以前这些精细操作全靠开发者手动完成,现在 Gemini 通过智能循环自动搞定,开发工作量大幅缩减。
四个新能力,专治长视频痛点
谷歌为这项功能总结了四个典型应用场景,每一个都直指长视频处理的传统痛点:
- 亚秒级时刻检索:精准定位在 1 FPS 下容易错过的瞬间状态变化和紧凑剪辑边界,高精度自动化视频编辑成为可能。
- 长视频“大海捞针”搜索:在长达数小时的视频中回答复杂查询,无需消耗数百万 Token。
- 异常检测:对感兴趣的时间窗口以更高帧率重新采样,快速捕捉快速运动和细微视觉伪影。
- 动作与物体计数:随时间精准追踪重复的物理动作和不同物体。
谷歌特别提到,Gemini 3.7 Flash 搭配智能体视频理解能实现最佳整体质量,在质量与成本效率间达到最优平衡,处于视频理解任务中准确率与成本的帕累托最优前沿。
上线即用,价格不额外加收
对开发者来说,最友好的部分在于接入成本。该功能使用标准 Gemini API Token 定价,不收取额外功能费用。目前已在 Google AI Studio 和 Gemini Enterprise Agent Platform 的 Gemini API 中上线,支持视频上传和 YouTube 视频分析。开发者只需在 API 配置中将处理模式设置为“agentic”即可启用。
谷歌的野心不止于开发者。这项能力很快会推向更多面向普通用户的产品:Gemini 应用中所有 Flash 和 Flash-Lite 模型用户即将获得该功能;未来几个月内,它还将为 YouTube 视频观看页的“Ask YouTube”功能提供支持,借助 Gemini 给出基于视频画面的更高质量回答。
从“静态扫帧”到“智能体式检索”,谷歌这次把视频理解的效率天花板又抬高了一截。对于每天和长视频数据打交道的团队来说,这可能是近期最值得试一次的新工具。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.