网易首页 > 网易号 > 正文 申请入驻

AI看图说话时的"睁眼说瞎话":如何让机器承认自己在编故事

0
分享至


你有没有遇到过这种情况:给一个AI看一张照片,问它照片里有什么,它煞有介事地告诉你"图中有一只橙色的猫躺在蓝色沙发上",可实际上照片里根本没有猫,沙发也是绿色的。

这不是笑话,这是当下所有大型视觉语言模型都逃不开的通病,学术界给它起了个名字叫"视觉幻觉"。

视觉语言模型(LVLM):能同时理解图片和文字,并用自然语言描述图片内容或回答相关问题的AI模型,比如GPT-4V、Qwen-VL这类产品。

问题是,这些模型编瞎话的方式和人类想象中不太一样。它们不是随机乱说,而是会一本正经地把不存在的物体、颜色、动作,甚至因果关系,都描述得头头是道,细节丰富到让人误以为它真的"看到"了。这就带来一个很现实的麻烦:如果你要做一个自动检测系统去揪出这些谎话,你不仅要知道哪句话是瞎编的,还得知道这句瞎话具体是哪几个字开始编的、编到哪里结束,以及AI自己对这句瞎话的"心虚程度"有多高。

这篇论文要解决的,正是这个听起来简单、做起来极其棘手的任务。

一个两难的选择

这个任务出自一个叫SHROOM-Visions的国际评测比赛,规则很明确:给你一张图、一段提示词、还有AI生成的一段回答文字,你需要标出这段文字里哪些字符区间是幻觉内容,并且给每个判断打一个置信度分数,这个分数要和人类标注员的共识程度做相关性对比。

评测用的核心指标有两个,一个叫IoU,一个叫Pearson相关系数。

IoU(交并比):衡量你预测的幻觉文字范围和真实幻觉范围重合程度的指标,数值越接近1说明你圈的范围越准。

Pearson相关系数:衡量你给出的置信度分数和人类标注共识程度之间线性相关性的统计指标,数值越高说明你的"心虚程度"打分越靠谱。

在这篇论文出现之前,业界基本分成两条路线,而这两条路线都有硬伤,谁也没法通吃。

第一条路是让生成式VLM自己去写结构化的幻觉标注,也就是训练一个大模型,直接输出"第15到32个字符是幻觉"这样的JSON格式答案。这条路的好处是,大模型经过深思熟虑式的推理,能找出比较刁钻的幻觉,召回率高。但代价也很明显:这类模型普遍非常自信,哪怕编造的内容也说得斩钉截铁,置信度分数完全不可信。更麻烦的是速度,论文里给出的数据是,如果开启思维链推理模式,处理一个样本要23秒。

第二条路是用判别式的序列标注器,也就是给每个文字token打分,判断它是不是幻觉。这类模型跑得飞快,一次前向传播就出结果,而且因为训练目标里专门有校准置信度的部分,打分比生成式模型靠谱得多。但它的毛病是保守,很多真正的幻觉它压根检测不出来,漏检严重。

这就好比你雇了两个保安。一个是经验丰富的老侦探,他愿意花大量时间蹲守观察,能抓到很多隐藏很深的可疑分子,但他自信心爆棚,抓错人的时候也一样理直气壮地说"我确定就是他"。另一个是装了传感器的自动门禁系统,反应飞快,报警的时候基本靠谱,可它只认识明显违规的行为,稍微隐蔽一点的可疑举动它直接放过去了。你要真做安保,肯定不会只选一个,你会想办法让这两套系统配合起来干活。

论文的作者们想的就是这个事:能不能把这两条路的优点捏在一起,缺点互相抵消?

融合两套系统的思路

论文提出的方案叫SpanCalib-VLM,它其实是两个系统外加一套融合算法拼出来的。

第一个系统是判别式的多模态序列标注器。它的文字理解部分用的是XLM-RoBERTa-Large,这是一个24层、能处理一百多种语言的预训练文本模型。图像理解部分用的是SigLIP-2视觉编码器,负责把图片切成196个小块,每块提取出特征向量。

XLM-RoBERTa:由Meta开发的多语言预训练语言模型,能同时理解上百种语言的文本,常用作跨语言NLP任务的基座。

SigLIP:一种视觉编码器,通过对比学习的方式把图片切分成小块并提取特征,常用来给多模态模型提供"看图"能力。

这两部分信息怎么融合到一起?论文用的是交叉注意力机制,简单说就是让文字信息去"查阅"图片的每个区域,判断这段描述和图片内容对不对得上号。

交叉注意力:一种神经网络机制,让一种模态的信息(比如文字)主动去关注另一种模态的信息(比如图像的不同区域),从而判断两者是否匹配。

在这套融合表示的基础上,模型接了三个并行的输出头,一个负责判断每个字是不是幻觉,一个负责输出校准后的置信度分数,还有一个负责给幻觉归类,比如是编造物体还是错误描述属性。

这里有个细节值得单独说一下。通常模型的置信度是从生成概率里顺手拿来的,但这篇论文没这么做,它专门加了一个用均方误差损失直接监督的置信度预测头,让模型去拟合人类标注员的共识比例,而不是自己瞎猜的生成概率。

这就好比你考试的时候,老师不光看你答案对不对,还专门让你在每道题后面写"我对这道题有多少把握",然后拿这个把握度和全班同学的实际正确率对比打分。如果没有这个专门的打分训练,模型会像很多考试作弊惯犯一样,明明蒙对的题也写"我百分百确定",这种虚假自信在幻觉检测里是致命的,因为你没法靠这个分数去分辨哪些判断真正可信。

第二个系统就是那个"深思熟虑型侦探",论文对Qwen3.5-4B这个40多亿参数的大模型做了监督微调,专门让它学着输出结构化的JSON格式幻觉标注。这个系统召回率高,但和前面提到的一样,自信心爆棚,分数不能直接用。

真正的创新点在第三步,论文管它叫"联合校准融合"。

具体做法是这样:先从生成式VLM那里拿到它标出的候选幻觉区间,变成一个字符级的二值掩码,标记每个字是不是被它认为是幻觉。然后把判别式标注器输出的逐token概率,通过子词偏移对齐的方式映射回字符级的概率数组。最后用一个加权公式把两边的分数合起来:

最终分数 = 0.55 × 判别器的校准概率 + 0.45 × 生成器的二值掩码

这两个权重不是拍脑袋定的,是在验证集上做网格搜索选出来的。判别器权重稍高一点,是因为它本身的校准表现更好,Pearson相关系数是0.369,而生成器只有0.285。生成器的掩码则被当作"空间提案权重",也就是告诉融合算法"这一片区域值得重点关注",具体这片区域该给多高的置信度,还是听判别器的。

打个比方,这就像餐厅的双人验菜制度。一个厨师(生成式VLM)经验丰富,愿意花时间琢磨菜品有没有问题,能挑出很多细节毛病,但他判断菜品是否真的有问题时经常判断过头,把一些正常但少见的做法也当成问题;另一个质检员(判别式标注器)用标准化流程扫描,判断更稳妥,但只看得出比较明显的问题。餐厅最后的做法是,质检员出具的分数占大头,但厨师标出来的可疑区域会被优先重点复查,两边意见拼在一起,比单独听谁的都靠谱。如果没有这套融合机制,要么漏检严重(只用判别器),要么置信度全靠不住(只用生成器),谁也没法两全。

数据说话:融合之后到底提升了多少

论文在SHROOM-Visions的英文验证集上(379个样本)做了详细对比,结果整理如下。

| 系统 | Pearson相关系数 | 整体IoU | 幻觉区间IoU | 干净样本IoU | 检测准确率 |

| BLIP基线 | 0.124 | 0.210 | 0.082 | 0.650 | 42.1% |

| MiniCPM-V微调 | 0.245 | 0.298 | 0.121 | 0.740 | 51.5% |

| 判别标注器(纯文本,XLM-R Base) | 0.342 | 0.295 | 0.101 | 0.882 | 52.1% |

| 判别标注器(纯文本,XLM-R Large) | 0.368 | 0.312 | 0.115 | 0.901 | 56.4% |

| 判别标注器(多模态,加SigLIP-2) | 0.369 | 0.326 | 0.155 | 0.903 | 58.0% |

| 生成式VLM(Qwen3.5-4B微调) | 0.285 | 0.375 | 0.182 | 0.885 | 68.2% |

| **SpanCalib-VLM(融合系统)** | **0.413** | **0.391** | 0.196 | **0.913** | **70.7%** |

从这张表能看出几个很清楚的规律。判别式标注器在校准分数上一路领先,加了视觉信息之后从0.368提升到0.369虽然涨得不多,但幻觉区间IoU从0.115直接跳到0.155,说明视觉信息确实帮上了忙,能纠正一些纯靠文字模式判断不出来的错误。生成式VLM则在幻觉区间IoU和检测准确率上表现更强,验证了它"深思熟虑找幻觉"这个特长确实存在。而最后融合出来的SpanCalib-VLM,几乎在每一项指标上都超过了单独的两个系统,尤其是Pearson相关系数直接从判别器的0.369跳到0.413,涨幅相当明显。

速度方面差距更悬殊。判别式标注器每秒能处理5.25个样本,标准模式的Qwen4B是1.18个样本每秒,而开启思维链推理的Qwen4B只有0.04个样本每秒,换算下来融合系统比思维链模式快了120倍。

跨语言测试也是这篇论文的一个亮点。研究团队在英语、法语、意大利语、中文四种语言上都做了评测,官方比赛的隐藏测试集结果显示,中文上的表现尤其突出,整体IoU达到0.437,干净样本IoU高达0.958,比基础的Qwen-3.5-4B模型高出0.169。论文给出的解释是,中文字符本身是表意文字,每个字符信息密度高,子词偏移和字符边界天然对得上,不像英语法语这类空格分隔的语言容易在边界处出现偏差。这有点像量体裁衣,衣服(token切分)本来就是按照身材(语言文字特性)做的,量身定制的衣服自然穿着更贴合,而拿现成的均码去套不同身材,边角总会有地方对不上。

论文还做了阈值敏感性测试,发现判断阈值在0.25到0.45这个区间内,IoU结果都稳定在0.391,几乎没有波动。这是因为融合出来的分数分布是双峰的,落在VLM候选区间内的字符分数普遍很高,区间外的普遍很低,卡在决策边界附近的样本本来就不多,所以调阈值调不出什么花样来。

消融实验部分把每个组件的贡献单独拎出来看。用简单的加权平均替代联合校准融合,Pearson掉了0.032;用交集运算替代融合,掉了0.061;去掉那个专门监督置信度的均方误差损失,Pearson直接从0.413掉到0.318,这是所有改动里降幅最大的一项,说明这个专门设计的校准监督机制确实是整个系统里最关键的那块拼图。反倒是去掉视觉编码器,对整体表现影响很小,IoU只掉了0.003,Pearson几乎没变化,这说明视觉信息虽然有用,但不是决定性因素,真正决定系统上限的还是校准机制和融合算法。

这个系统也不是完美无缺。论文的作者们自己列出了好几处短板,值得诚实地摆出来看看。

首先是误报问题。一些复杂但内容完全正确的描述,比如精致的场景细节、成语习语、罕见但真实的视觉元素,反而容易被标注器误判成幻觉,这是因为判别式标注器更多依赖表面的文字分布模式,而不是真正扎根到图像里去核实。

其次是长度限制。整个文本输入被截断到512个token,超出这个长度的内容里如果藏着幻觉,系统压根看不见,这不是判断错误,而是从一开始就没机会判断。

再者,虽然整体校准表现不错,Pearson到了0.413,但幻觉区间本身的IoU只有0.196,说明系统在精确圈定幻觉边界这件事上还有很大提升空间,找得到大致方位,但边界画得不够准。

另外,模型虽然在四种语言的联合数据集上训练,但融合权重和阈值主要是在英文验证集上调优的,跨语言的最优参数其实还没被充分探索过。

最后一点也是最根本的局限,这套融合系统没法检测出两个子系统都漏掉的幻觉。如果判别标注器和生成式VLM同时对某处幻觉视而不见,融合算法再精妙也没有信息可以拼凑,这是双系统方案天生的天花板。

Q&A

Q1:SpanCalib-VLM是什么?

A:SpanCalib-VLM是一个用于检测视觉语言模型幻觉内容的混合系统,它结合了一个判别式多模态序列标注器和一个微调过的生成式VLM,通过联合校准融合算法把两者的优势拼在一起,既能精准圈定幻觉文字范围,又能给出校准良好的置信度分数。

Q2:SpanCalib-VLM相比单独的生成式或判别式模型好在哪里?

A:判别式标注器速度快、置信度打分靠谱但容易漏检,生成式VLM召回率高但打分虚高且速度慢,SpanCalib-VLM把两者融合后,Pearson相关系数达到0.413,整体IoU达到0.391,各项指标都超过单独使用任一系统。

Q3:SpanCalib-VLM还有哪些没解决的问题?

A:它容易把复杂但正确的描述误判成幻觉,输入超过512个token的部分完全检测不到,幻觉区间的定位精度还不够高,融合参数主要针对英文调优,而且两个子系统都漏检的幻觉,这套系统同样无法找出来。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
联想集团股价创历史新高,CFO郑孝明称完全被市场低估

联想集团股价创历史新高,CFO郑孝明称完全被市场低估

IT之家
2026-09-18 13:42:11
全民化债的时代已经来了

全民化债的时代已经来了

细说职场
2026-09-18 16:39:07
知名超市,突然被起诉

知名超市,突然被起诉

中国新闻周刊
2026-09-17 21:45:03
总价至少100亿,全球第4个歼-10C用户将确认:已经启动最后步骤

总价至少100亿,全球第4个歼-10C用户将确认:已经启动最后步骤

巅峰高地
2026-09-17 17:10:29
以色列再获4万枚2000磅钻地弹,伊朗高官们脖子发紧了

以色列再获4万枚2000磅钻地弹,伊朗高官们脖子发紧了

移光幻影
2026-09-17 14:24:25
莫言说:“如果一个人对待家人不耐烦态度差,对外人又很客气和善,不是不孝顺,而是因为这三个原因。”

莫言说:“如果一个人对待家人不耐烦态度差,对外人又很客气和善,不是不孝顺,而是因为这三个原因。”

背包旅行
2026-07-29 18:06:59
重庆2岁幼童18楼坠亡,不是蹊跷,是神秘

重庆2岁幼童18楼坠亡,不是蹊跷,是神秘

小刀66
2026-09-18 07:33:02
WTT球星赛冷门迭爆:国乒小将3-2掀翻世乒赛冠军,薛飞首轮崩盘,方博一轮游

WTT球星赛冷门迭爆:国乒小将3-2掀翻世乒赛冠军,薛飞首轮崩盘,方博一轮游

好乒乓
2026-09-18 00:54:14
挖运河挖出3.15亿方土,换别人愁死,中国直接顺手造1.39万亩良田

挖运河挖出3.15亿方土,换别人愁死,中国直接顺手造1.39万亩良田

故事终将光明磊落
2026-09-17 14:42:50
“嘌呤”不读 piāo líng,不要再读错了,我出过丑

“嘌呤”不读 piāo líng,不要再读错了,我出过丑

语丝纪
2026-09-14 16:07:19
名记:不排除C罗今年要被扫地出门!所以C罗还能进1000球吗?

名记:不排除C罗今年要被扫地出门!所以C罗还能进1000球吗?

历史第一人梅西
2026-09-17 17:20:30
“甲醛白菜”爆料博主再曝“硫磺熏笋”:气味异常刺鼻,不能吃,二氧化硫残留浓度达4860mg/kg;广东清远通报:初步核查情况属实

“甲醛白菜”爆料博主再曝“硫磺熏笋”:气味异常刺鼻,不能吃,二氧化硫残留浓度达4860mg/kg;广东清远通报:初步核查情况属实

云南网络广播电视台
2026-09-18 14:11:05
世界杯经典一幕!凯恩回忆赛后拥抱梅西,由衷称赞他的格局

世界杯经典一幕!凯恩回忆赛后拥抱梅西,由衷称赞他的格局

阿嵀体育评论
2026-09-18 13:52:54
新一轮超长大雨、暴雨强势来袭,或连下9天,冷空气活跃,东北多地迈入冬季,杜鹃已达11级,国庆前还有新台风加入

新一轮超长大雨、暴雨强势来袭,或连下9天,冷空气活跃,东北多地迈入冬季,杜鹃已达11级,国庆前还有新台风加入

老牛讲
2026-09-18 14:09:25
山东男篮揭幕战!全力击败辽宁,班顿上演CBA首秀,央视直播

山东男篮揭幕战!全力击败辽宁,班顿上演CBA首秀,央视直播

体坛瞎白话
2026-09-18 15:01:41
太狂妄!张本智和最新采访表示他和松岛辉空都想和中国队交手

太狂妄!张本智和最新采访表示他和松岛辉空都想和中国队交手

最爱乒乓球
2026-09-18 01:02:20
45个参赛国集体表达不满,日本亚组委回应了!韩国:有史以来最差

45个参赛国集体表达不满,日本亚组委回应了!韩国:有史以来最差

陈博世财经
2026-09-18 09:23:58
2026中秋假期不调休!本来就休3天,9月20日为何补班?

2026中秋假期不调休!本来就休3天,9月20日为何补班?

天津人
2026-09-18 06:12:26
美驻墨西哥使馆以“墨西哥万岁,中国制造”调侃墨西哥国庆,中使馆发表严正声明

美驻墨西哥使馆以“墨西哥万岁,中国制造”调侃墨西哥国庆,中使馆发表严正声明

界面新闻
2026-09-18 07:25:53
何仙姑再追大师兄,修成正果!

何仙姑再追大师兄,修成正果!

八卦疯叔
2026-09-18 10:38:00
2026-09-18 18:04:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9879文章数 568关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

日本亚运会又出乌龙 曲棍球赛前给韩国队演奏朝鲜国歌

头条要闻

日本亚运会又出乌龙 曲棍球赛前给韩国队演奏朝鲜国歌

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

游戏
健康
教育
艺术
时尚

GameNative让两款R星游戏在安卓设备本地运行!

脑动脉瘤的治疗方法,该选哪一种?

教育要闻

北京国际学校推荐怎么选?别只盯藤校offer,美本全员录取率、师生比和课程认证才是硬指标

艺术要闻

15位写实画家,23幅静物作品!

没想到这件事,对我的改变这么大!

无障碍浏览 进入关怀版