AI数不清鼓掌次数,这事听起来有点离谱,但确实是行业公认的难题。静态处理默认按每秒1帧的速度解析视频,像鼓掌这种瞬间动作,要么被直接漏掉,要么跟打响指、点击声混在一起。Gemini 3.7 Flash最近展示的一项新能力,把这个问题解决了——它能在处理视频时自动调整速度,准确识别并数出每一次鼓掌。
问题出在固定帧率上
![]()
传统AI处理视频时,默认用固定的1 FPS(每秒1帧)进行采样。这个速度对静态画面够用,但遇到快速动作就抓瞎了。一次鼓掌可能只持续零点几秒,在1 FPS的采样下,这一帧可能刚好落在鼓掌前或鼓掌后,动作就整个消失了。更麻烦的是,如果画面里同时有鼓掌、打响指、点击等动作,固定帧率下这些动作在视觉上高度相似,AI很容易把它们混为一谈。
这本质上是个采样率与动作速度不匹配的问题。视频是连续的时间流,但AI按固定间隔取帧,间隔太大就会丢失关键信息。鼓掌这种高频动作,恰恰是固定帧率最容易漏掉的类型。
Gemini 3.7 Flash的解法:动态调整处理速度
Gemini 3.7 Flash这次展示的智能体视频理解能力,核心思路是让AI自己决定该用多快的速度去处理视频。不再死守1 FPS的固定值,而是根据画面内容自动调整处理速度——遇到快速动作时加快采样,确保每个瞬间都被捕捉到;画面相对静止时则放慢速度,避免不必要的计算浪费。
从演示效果看,这个机制确实管用。视频里连续多次鼓掌,Gemini 3.7 Flash每一次都准确识别并计数,没有漏掉任何一次,也没有把其他动作误判成鼓掌。这种自适应处理速度的能力,让AI在理解动态视频时有了更大的灵活性。
对视频理解意味着什么
这项能力的影响范围不止于数鼓掌次数。很多视频理解任务都受限于固定帧率的采样方式——体育动作分析、手势识别、快速变化的场景切换,都可能因为采样间隔太大而丢失关键帧。如果AI能根据内容动态调整处理速度,这些场景的识别准确率都有望提升。
换个角度看,这也是智能体处理视频时的一个新思路:与其用统一的处理流程应对所有内容,不如让AI根据实际需要自主调节。视频里动作快就多采样,动作慢就少采样,把计算资源用在真正需要的地方。
演示之外,还有待验证的部分
目前展示的还只是单个演示场景,数清鼓掌次数是一个具体案例,但这项能力在更复杂、更嘈杂的视频场景下表现如何,还没有更多公开数据。比如多人同时做不同动作、背景有大量干扰信息、或者视频画质较差时,自适应处理速度还能不能保持同样的准确率,这些都需要进一步验证。
不过,从技术方向上看,让AI根据内容动态调整处理速度,确实比固定帧率采样更合理。至少在这个演示里,Gemini 3.7 Flash证明了这条路走得通。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.