网易首页 > 网易号 > 正文 申请入驻

VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

0
分享至



导读:视觉问答模型的准确率不断提高,但高分未必来自视觉理解—— 当基准图像与答案已进入训练语料,模型可能只是复现了记忆。浙江大学等团队提出 ReKey:保留原始真实场景,只更新决定答案的那一小块视觉线索,使每轮评测都面向未见过的内容。

一次人工标注之后,系统可在每轮评测中随机生成新的视觉关键线索,并自动构造对应的问题与答案 —— 不重新生成整张图,也不重建整套基准。



  • 论文:REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation
  • 论文链接:https://arxiv.org/abs/2606.20736
  • 项目主页:https://xxxxxsun.github.io/rekey-vstar/
  • 作者:Tengjie Lin、Yutao Sun、Jingwei Ni、Shuhan Ge、Hao-Xuan Ma、Yanting Miao、Wangyue Lu、Mingshuai Chen、Tiancheng Zhao、Jianwei Yin

不换图,只换问题:高分有多少来自记忆?

V*Bench 是评估细粒度视觉搜索能力的常用基准,包含 191 张高分辨率真实场景图像。它的难点在于,问题往往不指向画面主体,而指向远离图像中心、面积极小、容易被忽略的局部细节 —— 论文把这类真正决定答案的内容称为visual key(视觉关键线索)。正因为答案只取决于这一小块内容,一旦它长期固定不变,模型就有机会靠记忆而非观察答对。

为了检验这一点,研究者设计了诊断实验 Relabel V*:保留原始图像,只重写问题,让新问题指向图中另一个同样小、同样偏离中心的视觉线索。在全部 191 张图像上,8 个受测 VLM 准确率均下降,降幅 9.5–18.8 个百分点。



图像未改动,仅更换问题后,8 个模型的准确率全部落在原始成绩之下,降幅 9.5–18.8 个百分点。

既然图像未变,这一下降只能来自问题与答案组合的更新。它不足以单独证明训练数据污染,但与模型从静态基准中获得记忆收益的假设一致。不过这种做法有个明显的局限:每一轮都要人工重写全部问题,成本无法长期承担。ReKey 要回答的正是这个问题 —— 能否只做一次人工准备,之后让视觉线索自动持续更新?

怎么做到每轮评测都不一样?

ReKey 的思路是把人工投入压缩到一次性的准备工作上,之后交给自动流程反复产出新题。整个流程分四步:先由标注者在图上圈出可以被改动的小块区域(论文称为 edit slot),随后系统随机采样一组新的视觉内容,用图像编辑模型写入该区域,最后依据这次采样的记录直接生成对应的问题和答案。



人工标注只发生在最左侧一次,右侧的采样、编辑与问答构造在每轮评测中自动重复。

标注者需要圈出的区域有两类:Replace slot指向图中已有的目标,用于改变它的颜色;Add slot指向一处合理的空白位置,用于插入原图中不存在的小物体。两类区域都要求紧凑、位置合理,并且在图中具有唯一指代。每轮评测开始时,随机种子决定启用哪个 slot,并采样出新的颜色、物体或位置组合。采样记录既指导图像编辑,也直接确定新问题和标准答案。

这样一来,答案在图像生成之前就由采样过程确定,无需再让另一个模型检查生成结果并重新标注,每道题都能追溯到具体的 slot、随机种子和采样内容。图像编辑由 GPT-Image-2 完成,编辑后的局部区域合成回原图。改动区域只占整张图约 0.1%,且标注者选定的区域与 V*Bench 原始问题所问目标的尺度相当,从而锚定了与原基准接近的视觉搜索难度。



同一场景中只有决定答案的帽子颜色被替换,背景杂乱度与小目标尺度保持不变。

更新 visual key,记忆优势是否消失?

如果此前的差距确实源于记忆,那么更新 visual key 之后,成绩应当回落到人工重写问题的水平。研究者用 3 个随机种子各生成一套 ReKey 实例,在 8 个 VLM 上重复评测:原始 V*Bench 平均准确率 82.1%,ReKey 上降至 72.2%,平均下降 9.9 个百分点,所有模型均出现下降。降幅最大的集中在原始高分模型(Qwen3.6-Plus 下降 14.9 个百分点、Gemini 下降 13.0 个百分点),而原始成绩较低的 MiMo 和 Llama 各只下降 4.4 个百分点,与记忆收益越多、更新后失去也越多的预期一致。



ReKey 上 8 个模型成绩均低于原始 V*Bench,平均下降 9.9 个百分点,整体贴近 Relabel V* 的水平。

Relabel V*(66.9%)提供了另一个参照。Qwen 和 GPT-5.5 几乎正好落在这条基线上(分别高 1.4 和 1.2 个百分点),说明 ReKey 恢复出了与人工重写问题相当的难度;其余模型平均高出 5.3 个百分点,研究者归因于 Relabel 只有一套固定题目,而 ReKey 具备采样多样性。那么会不会只是再生的题目更难?研究者用 LLaVA-1.5-13B 做了校准 —— 它是 V*Bench 原始论文中最强的开源基线,锚定了该基准公布的难度,且污染风险较低,若成绩大幅下滑就意味着任务本身变了。结果它只下降 6.1 个百分点,低于多数前沿模型,位置类问题几乎未变,而空间关系恰是对编辑痕迹最敏感的维度。这些证据指向同一结论:准确率的下降来自记忆优势的消除,而非题目难度的变化。

为什么最关键的一步仍由人完成?

既然除标注之外的环节都已自动化,那能否把最后这步人工也交给模型?研究者试着让 GPT-5.5 自动选择 edit slot,结果并不理想:它给出的 Replace 区域只有 33.6% 能准确覆盖目标;Add 区域虽然多数可用,但面积普遍偏大,约为人工标注的 3 倍 —— 模型明显偏好宽敞、显眼、容易下笔的位置。用这些区域生成的题目系统性偏简单,8 个 VLM 的准确率比人工标注版本高出 8.4–18.5 个百分点。



VLM 选定的区域明显更宽敞显眼,面积约为人工标注的 3 倍,使自动标注版本的准确率高出 8.4–18.5 个百分点。

如果模型已能稳定定位最隐蔽的视觉线索,它可能已具备评测所要测量的感知能力;而让能力不足的模型选题,则容易将自身盲点带入基准。因此 ReKey 只将 slot 选择保留为一次性人工步骤,其余环节均可自动完成。

全部 191 张图像的 slot 标注约需 16 人时,而同一组标注可跨随机种子反复使用。ReKey 的意义不在于发布一次更大的静态数据集,而在于将高质量真实场景转化为可持续更新的评测协议:保留原有视觉搜索环境,只更新真正决定答案的那一小块 —— 只要 visual key 可以持续刷新,靠记忆答对就不再是稳定的策略。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
少林寺新方丈释印乐,上任才10个月,少林寺被曝一下少了800多万

少林寺新方丈释印乐,上任才10个月,少林寺被曝一下少了800多万

大鱼简科
2026-06-10 09:48:18
理想新车官宣:9月2日,正式上市

理想新车官宣:9月2日,正式上市

科技堡垒
2026-09-02 11:40:58
离谱!大叔受不了漏尿,干脆用强力胶把DD封住??医生最终掏出10厘米胶棒...

离谱!大叔受不了漏尿,干脆用强力胶把DD封住??医生最终掏出10厘米胶棒...

英国那些事儿
2026-09-01 00:29:43
泽连斯基警告所有航企不要飞越俄罗斯,普京回应

泽连斯基警告所有航企不要飞越俄罗斯,普京回应

参考消息
2026-09-02 16:00:34
美国人警告菲律宾:中国准备彻底拿下黄岩岛,下一个就轮到巴丹

美国人警告菲律宾:中国准备彻底拿下黄岩岛,下一个就轮到巴丹

小梊搞笑解说
2026-09-01 15:31:07
中国性价比超低的4所211高校,被过度吹捧,实则严重“溢价”!

中国性价比超低的4所211高校,被过度吹捧,实则严重“溢价”!

教育导向分享
2026-09-02 11:55:37
40年最差!皇马名宿暴怒开喷!穆里尼奥重建彻底失败!

40年最差!皇马名宿暴怒开喷!穆里尼奥重建彻底失败!

点点细语
2026-09-02 17:00:29
今晚赛事:9月2日晚19点55,中央电视台CCTV5、CCTV5+ 直播节目单

今晚赛事:9月2日晚19点55,中央电视台CCTV5、CCTV5+ 直播节目单

拾光纪闻
2026-09-02 05:27:55
流落中国的外国公主,如今拒绝回国:我是中国人,中国就是我的家

流落中国的外国公主,如今拒绝回国:我是中国人,中国就是我的家

奇思妙想生活家
2026-08-30 09:33:02
中国把28纳米卖到全球断不了货,日本商社看傻眼:这局谁卡谁?

中国把28纳米卖到全球断不了货,日本商社看傻眼:这局谁卡谁?

乌克兰小静
2026-08-26 01:04:42
催人泪下!吉隆泥石流救援现场出现猴群,来到遭受泥石流侵蚀的区域,下方就是救援人员

催人泪下!吉隆泥石流救援现场出现猴群,来到遭受泥石流侵蚀的区域,下方就是救援人员

火山詩话
2026-09-01 06:14:24
“上大学第一天,儿子就跑回家了,”家长无奈发视频:又得接送4年

“上大学第一天,儿子就跑回家了,”家长无奈发视频:又得接送4年

泽泽先生
2026-09-02 13:36:10
奥拉迪波公开信致联盟各队总经理:请求你们再给我一次机会

奥拉迪波公开信致联盟各队总经理:请求你们再给我一次机会

北青网-北京青年报
2026-09-02 09:06:04
景甜这瓜确实有点大,可没有人知道,她当红那些年谁是她的金主爸爸?

景甜这瓜确实有点大,可没有人知道,她当红那些年谁是她的金主爸爸?

梨莱
2026-08-30 22:56:54
66岁刘雪华独居上海别墅,每天清晨六点,都会准时给远在加拿大的姐姐通话报平安

66岁刘雪华独居上海别墅,每天清晨六点,都会准时给远在加拿大的姐姐通话报平安

音乐时光的娱乐
2026-08-26 02:44:53
官司还没宣判,舆论先炸锅,景甜这件事被胡锡进一语道破

官司还没宣判,舆论先炸锅,景甜这件事被胡锡进一语道破

小徐讲八卦
2026-09-02 15:06:59
因果终会来!潇洒一生的郑少秋, 熬到79岁才"离开" 遗憾终无法填

因果终会来!潇洒一生的郑少秋, 熬到79岁才"离开" 遗憾终无法填

杰丝聊古今
2026-08-30 00:29:06
印度破纪录了,恒河水被洗到“拉丝”,首都或将不再适合人类居住

印度破纪录了,恒河水被洗到“拉丝”,首都或将不再适合人类居住

有牙的兔纸
2026-08-29 18:39:05
三地政府主要领导调整

三地政府主要领导调整

新浪财经
2026-09-01 17:30:51
已确认!星宇启动被调查,常州女首富麻烦了!

已确认!星宇启动被调查,常州女首富麻烦了!

财经要参
2026-09-02 12:00:06
2026-09-02 18:11:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13904文章数 142728关注度
往期回顾 全部

教育要闻

晶采观察·青春华章丨为新质生产力“筑基” 开学季全国进入“科普时间”

头条要闻

尼泊尔用无人机找幸存者 隧道被泥浆"像牙膏一样"塞满

头条要闻

尼泊尔用无人机找幸存者 隧道被泥浆"像牙膏一样"塞满

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

需要重视的全球“资金失衡”

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

汽车要闻

23万级给到激光雷达和900km续航 比亚迪海狮08售22.99万起

态度原创

亲子
数码
旅游
艺术
公开课

亲子要闻

拒学、拖延、叛逆?新学期别再怪孩子“不听话”

数码要闻

万元显卡售后翻车!用户收到变形RTX 5080不敢修:装不进机箱没法用

旅游要闻

韫道启新 合众行远!第十八届孙子文化旅游节9月11日广饶启幕

艺术要闻

273米,10亿!深圳最多“外号”的摩天楼,正式运营!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版