一条推文,让AI视频理解的成本预期被重新划了一条线。Google DeepMind宣布,其最新的Gemini模型已具备智能体视频理解能力,在更精准分析视频内容的同时,最多可减少88%的Token消耗。这个数字意味着什么?简单说,过去处理一段视频所需的算力成本,现在可能只需要原来的八分之一左右。
Token是AI模型处理文本和图像的基本单位,视频由大量连续帧构成,过去模型理解视频往往需要逐帧分析,Token消耗量巨大。这次更新直接瞄准了这个痛点——用更少的Token完成同样甚至更精准的视频理解任务,对开发者来说,意味着成本结构的直接改变。
![]()
88%的Token削减,为什么值得关注
在AI应用落地过程中,成本往往是比模型能力更现实的瓶颈。一个能看懂视频的模型,如果每次调用都消耗大量Token,商业场景就很难跑通。Gemini新模型把Token消耗压缩到这个量级,等于把视频理解类应用的准入门槛拉低了一大截。
从技术路径看,这大概率不是简单的模型压缩,而是架构层面的优化——让模型更聪明地"看"视频,而不是更费力地"读"每一帧。智能体视频理解这个定位也值得注意,它指向的不只是被动分析,而是让AI能基于视频内容主动做出判断和行动。
智能体视频理解,和普通视频分析有什么不同
普通视频分析解决的是"这段视频里发生了什么",而智能体视频理解要解决的是"基于视频内容,下一步该做什么"。前者是识别,后者是决策。Gemini模型这次升级,等于给AI加上了"看懂画面并采取行动"的能力。
这种能力在实操层面有明确的应用场景:比如让AI根据监控视频自动识别异常并触发告警,或者让AI从教学视频中提取关键步骤并生成操作指引。当Token成本降下来,这些场景从"演示可行"变成"商业上划算",落地速度会明显加快。
Google DeepMind在推文中没有透露具体的技术实现细节,但88%这个数字本身已经足够说明问题——视频理解正在从"昂贵的能力"变成"可负担的基础功能"。对于正在做视频类AI应用的团队来说,这可能是近期最值得跟进的一个更新。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.