Google正在给它的AI Pro订阅服务加码。这次不是简单的功能迭代,而是直接塞进了两个重量级工具:一个叫Google Pics,负责高级图像生成与编辑;另一个是智能体视频理解工具,能对视频内容做深度分析。这两项能力,正在从AI Pro订阅包向更广泛的Google服务扩散。
Pics:让AI图像告别“廉价感”
![]()
Google Pics的核心是Nano Banana模型。它不只是生成一张图那么简单,而是提供了语言翻译选项,以及元素级的编辑能力——你可以在生成后的图像里添加或修改具体元素。Google的意图很明确:消除那种典型的AI生成感,让产出物更精致、更少“一眼假”的通用痕迹。
这种定位直接指向宣传材料的制作场景。过去用AI生成宣传图,经常要反复抽卡才能得到一张能用的,而且风格高度雷同。Pics试图解决的是“可定制性”问题——不是给你一张成品图,而是给你一个可以继续加工的半成品,让你能按需调整到满意为止。
智能体视频理解:更准、更快、更省Token
另一个工具是智能体视频理解,由Gemini模型驱动。它能处理视频输入,识别出画面里呈现的内容、演讲者是谁,还能提取片段中的具体细节。这意味着你丢给它一段视频,它能告诉你里面讲了什么、谁在讲、某个细节出现在哪个位置。
Google特别强调了性能提升:与之前的方法相比,它在响应准确度和速度上都有进步,同时降低了Token消耗。对于需要频繁处理视频内容的用户来说,这三点直接关系到使用成本和效率,不是无关痛痒的优化。
从AI Pro到Gemini App,再到YouTube
这两款工具的扩散路径值得关注。视频理解功能将向所有使用Flash和Flash-Lite模型的Gemini App用户推出,覆盖面比AI Pro订阅用户更广。而Pics则很快会为YouTube视频观看页面的“Ask YouTube”功能提供支持,在用户提问时交付更高质量、基于视觉的答案。
这意味着Google正在把AI能力从独立的订阅服务,嵌入到日常高频使用的产品里。YouTube的“Ask YouTube”一旦接入Pics的图像理解能力,用户对视频内容的提问就不再局限于文字层面的检索,而是能获得基于画面内容的视觉化回应。
我的判断:工具在变,逻辑没变
从产品设计看,Google这两步棋的核心逻辑是一致的:让AI输出更可控、更可用。Pics解决的是“生成结果不可控”的问题,视频理解解决的是“视频内容难检索”的问题。两者都在降低用户的使用门槛,而不是单纯堆砌模型参数。
对普通用户来说,最直接的感知可能是:以后在YouTube看视频时,问“这个演讲者刚才提到的那个数据是什么”,得到的答案会更准确、更具体。而对创作者来说,Pics提供的元素级编辑能力,意味着AI生成图不再是一锤子买卖,而是可以反复调整的生产工具。
这两项功能即将在Gemini App中推出,Pics对“Ask YouTube”的支持也已在路上。Google正在把AI能力从独立的订阅服务,嵌入到日常高频使用的产品里。工具在变,但让AI更实用的逻辑没变。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.