网易首页 > 网易号 > 正文 申请入驻

盲人摸象的AI版本:为什么最聪明的模型也记不住一件事的两种说法

0
分享至


盲人摸象的故事你肯定听过。几个盲人摸到大象的不同部位,有人说大象像柱子,有人说像扇子,谁也没说错,但谁也没说全。

这个几千年前的寓言,现在被一群研究者用来问一个很现代的问题:大语言模型是不是也有这个毛病?

先说一个事实,可能和你的直觉不太一样。现在的大模型在回答"珠穆朗玛峰有多高""二战哪年结束"这类常见问题时,已经强到近乎无聊,几乎所有主流模型都能给出一致的标准答案。这本该是件好事,但它也带来一个副作用:这类题目已经测不出模型之间的差距了,大家都对,区分度归零。

于是腾讯优图实验室联合清华大学、华威大学的研究者们换了个思路。他们不去问那些"人人皆知"的事实,反而专门去翻网络上那些质量不高、信息量分散、说法还互相矛盾的边角料内容。这就是这篇论文要讲的ElephantBench,一个专门用来测试模型"记忆完整性"的新基准。

核心问题:模型到底记住了什么,又漏掉了什么

我们平时评价一个模型"懂不懂"某个知识点,通常就是看它能不能说出正确答案。但这篇论文提出了一个更刁钻的问题:如果同一件事,网上有两种不同的、都有据可查的说法,模型能不能把两种说法都想起来?

举个论文里的例子。特蕾莎修女的出生日期,IMDb上写的是1910年8月26日,而另一个网站Poem of Quotes写的是1910年8月27日。这两个说法都不是瞎编的,都有正规来源支撑。那么问题来了,当你直接问一个大模型"特蕾莎修女的生日是哪天",它会给出哪个答案?还是两个都说?

长尾知识:指的是那些在网络语料中出现频率很低、不常被讨论的冷门信息,和"热门知识"相对,是数据分布曲线上那条又长又细的尾巴部分。

知识冲突:指的是同一个事实在不同信息源中被报道出不一致的内容,比如同一件事有两个不同日期、两个不同说法。

以往的研究,不是没碰过这个方向,但都只碰到了一半。研究长尾知识的benchmark,比如Mallen等人2023年提出的相关工作,通常假设每个问题只有一个正确答案,压根没考虑"一个事实有多个版本"这种情况。而专门研究知识冲突的benchmark,比如WikiContradict、ConfRAG这些,又走了另一个极端,它们是开卷考试,直接把冲突的文档喂给模型,测的是模型能不能读懂上下文里的矛盾,而不是模型自己脑子里记住了什么。

ElephantBench想做的是把这两条路合并成一条闭卷考试。不给文档,不给检索工具,直接问,看模型的参数记忆里到底装了什么。

闭卷考试:指的是评测时不提供任何外部资料或检索工具,模型只能依靠自己训练时学到的内在知识来回答,和"开卷"(提供上下文资料)相对。

参数记忆:指的是大模型在训练过程中把知识编码进模型参数(权重)里,形成的一种内在存储,不依赖外部检索。

打造一个知识探针:怎么从垂圾堆里挖出金子

这里有个挺反常识的操作。做数据集的人,通常是拼命把高质量数据筛出来用。这篇论文的研究者反过来,专门去翻那些被质量过滤器筛掉的低质量语料,也就是论文里说的Dlow

具体来说,他们先用一个叫DCLM fastText的质量分类器,给网页语料打分,分数低于某个阈值的那部分内容,就是他们要挖的矿。为什么要用这堆"边角料"?因为高质量语料通常会被反复采样、重点强化训练,里面的知识早就被模型嚼烂了,测不出记忆的漏洞。而这些被过滤掉的低曝光文档里,藏着的知识才是真正考验模型记忆边界的东西。

如果不这么做会怎样?如果继续用高质量语料出题,那基本上又会回到开头说的那个死胡同,所有模型都答对,测不出区别。低曝光语料就像是学校里那些从没被专门复习过的边角知识点,平时不会主动去记,但一旦被问到,恰恰最能看出一个人是死记硬背了考纲重点,还是真的对知识体系有全局把握。

接下来的问题是,怎么从海量的低质量文档里找到"同一件事有两种说法"的案例?如果两两比对所有文档,计算量会爆炸。论文里给出一个具体数字:如果文档数是n,两两比对需要检查n乘(n-1)除以2这么多对,数量级会随着文档增多迅速失控。

他们用了一个两步筛选法。第一步,用大模型给每篇文档打上一个知识点标签,遵循SuperGPQA这个学科分类体系,把讨论同一话题的文档聚到一个簇里,只在簇内做比对。第二步,考虑到同一件事可能被打上不同的知识点标签导致漏网,他们又用命名实体识别技术,把提到同一个人名、地名、事件名的文档也拉到一起做补充比对。

SuperGPQA:指的是一套覆盖285个研究生学科领域的知识分类体系,常用于给内容打学科标签。

命名实体识别(NER):指的是从文本中自动识别出人名、地名、机构名、事件名等专有名词的技术。

这两步筛选之后,再让大模型去判断每一对候选文档之间到底是什么关系:是在说同一件事而且说法一致(支持关系),还是在说同一件事但说法不一致(冲突关系),还是压根不是一件事(无关)。论文里给出的数据是,这套聚类方法比暴力两两比对减少了至少93.4%的计算量,效率提升超过15倍。

这就好比你要在一个巨大的仓库里找出所有互相矛盾的文件对。如果一份一份地把每个文件和其他所有文件都比一遍,时间根本受不了。但如果先按主题把文件分类堆放,你只需要在每一堆里面找矛盾,效率立刻就上来了。如果不做这层分类,别说找矛盾了,光是比对的时间成本就足够让整个项目黄掉。

找到冲突之后,研究者围绕每一对冲突文档,把它们和各自的"支持文档"一起打包成一个小的子图,再用大模型根据这个子图生成问答对。每个问答对包含一个问题,和一组经过验证的答案,答案数量至少是两个,分别对应冲突的两个不同说法。

为了确保这些答案不是模型瞎编出来的,论文设置了三道验证关卡。第一道,让大模型逐字核对每篇原文档,确认每个候选答案都有原文依据。第二道,用一个配备了网页搜索工具的智能体,独立地去互联网上找权威来源(比如维基百科)来交叉验证每个答案。第三道,人工审核,剔除掉实体张冠李戴、答案泄露、问题和事实不匹配的情况。经过这三轮筛选,最初生成的8254个候选问题,最后只留下1094个真正靠谱的问答对。

这个筛选强度其实挺狠的,保留率不到七分之一。但也正是因为筛得这么严,最后留下的每一道题,背后都是真的有两个独立、可信、互相打架的信息源撑着,不是随便凑出来的伪冲突。

考试怎么打分:三个档次,不是简单的对错

评测的时候,模型只拿到问题本身,不给任何背景资料,完全靠自己脑子里的记忆答题。答完之后,由另一个大模型(论文里用的是GPT-5.6-Sol)当裁判,给出三档评分。

完整回忆:指模型的回答包含了全部验证过的正确答案,且没有说错。

部分回忆:指模型的回答里至少包含一个正确答案,但没有覆盖全部答案。

失败回忆:指模型的回答一个正确答案都没提到,或者说错了。

三个档次加起来正好是100%。此外还有一个衍生指标叫条件完整度,专门衡量在那些"至少答对一个"的回答里,有多大比例是"全都答对"的,用来单独衡量记忆的完整性,排除掉那些干脆什么都不知道的情况的干扰。

为了确认这个AI裁判靠不靠谱,研究者又找了三名研究生标注员,人工评判了四个顶级模型的回答,结果发现AI裁判和人工标注的一致率在90%到93%之间,统计学上的一致性系数(Cohen's κ)在0.815到0.877之间,属于相当高的水平。这说明用AI当裁判这件事本身是靠得住的,不是自娱自乐。

结果揭晓:强模型也只能记住一半的完整故事

论文测试了32个模型,涵盖了GPT-5.5、Gemini-3.1-Pro、Claude-Opus-4.8这些顶级闭源模型,以及Qwen、DeepSeek、GLM等一批开源模型。

结果有点出乎意料。表现最好的是开源模型Kimi-K3,完整回忆率是52.38%,紧随其后的是Gemini-3.1-Pro(50.37%)和GPT-5.5(50.18%)。也就是说,即便是这个星球上最强的几个模型,在这类问题上,也只有一半左右的概率能把两个说法全都说出来。

更值得琢磨的是失败回忆率。三个最强模型的失败回忆率只有2.19%到2.65%,意味着它们几乎从来不会完全不知道这件事,总能说出点什么。但同时,它们的部分回忆率却高达45%到47%,几乎和完整回忆率平分秋色。

这两个数字放在一起说明什么问题?说明模型的主要毛病不是"什么都不知道",而是"知道一半,以为知道全部"。它记住了大象的一部分,却把这部分当成了整头大象。这正是论文标题里"认知短视"这个词的意思,模型不是完全失明,而是视野被局限在了某一个片段里,自己却毫无察觉。

规模能不能治好这个病:能,但治不彻底

论文接着测试了模型规模对结果的影响。以Qwen3.5系列为例,从2B参数一路涨到397B,完整回忆率从1.65%涨到32.27%,失败回忆率从81.35%降到8.50%。这个变化确实很明显,说明模型越大,记住这些冷门事实的能力越强。

但同时,部分回忆率也从17.00%涨到了59.23%。换句话说,模型规模变大,确实让它更多地"想起了什么",但这些新想起的记忆里,很大一部分仍然是不完整的。规模能治好"完全失忆",但治不好"选择性失忆"。

这就好比一个学生复习考试,一开始什么都不会,后来复习得越多,能想起的知识点越多,但很多知识点想起来的时候只想起了半句,另外半句怎么也补不上。规模扩大解决的是"记忆容量"的问题,但没有解决"记忆结构性遗漏"的问题,这是两件不同的事。如果只看完整回忆率涨没涨,你会觉得规模是万能药,但如果同时盯着部分回忆率,会发现问题的另一面根本没被治好。

推理会不会有用:看规模,还看模型有没有"想太多"

论文还测试了打开模型的推理模式(也就是让模型多想一会儿再回答)会不会有帮助。结果发现效果因模型而异。对GPT-5.6-Sol和GPT-OSS-120B这类大模型,打开推理能让完整回忆率提升13.99和12.89个百分点,提升相当明显。

但对Qwen3.5系列的小模型,情况反过来了。在2B和4B这两个最小的规模上,打开推理反而让完整回忆率下降了0.64和0.37个百分点。论文里给出了具体的反面案例:一个关于弗雷德里克·道格拉斯出生年份的问题,正确答案有1817和1818两个,不开推理的时候模型能同时说出两个年份,但开了推理之后,模型反而"想通了",觉得1818是"官方公认"的,然后把1817这个说法给排除掉了。

这个现象挺有意思。推理本来是用来帮模型想得更全面的,但对小模型来说,推理有时候变成了一种"过度自信的整理术",它把原本模糊、并存的两种说法,硬是归纳成了一个"更靠谱"的单一答案,反而丢掉了信息。这就像有人本来记得两个不同的说法,越琢磨越觉得其中一个更权威,最后干脆把另一个忘了。多想一步,不一定是往前走,有时候是往窄路走。

真正决定完整回忆的因素:曝光度的不对称

这是这篇论文里我觉得最有意思的一个发现。研究者去数了低曝光语料库里,支持每个冲突说法的文档数量,把数量多的那一方叫多数派,数量少的那一方叫少数派。

结果发现一个清晰的规律。多数派和少数派之间的曝光差距越大,模型的部分回忆率就越高,也就是说,模型越倾向于只记住那个曝光多的主流说法,把曝光少的边缘说法给漏掉了。反过来,少数派本身获得的曝光越多,完整回忆率就越高,部分回忆率就越低。

研究者用一个联合回归模型进一步拆解了这两边的独立作用。数据显示,多数派曝光每增加一个标准差,部分回忆率大约上升14.18个百分点,失败回忆率下降10.17个百分点。这说明多数派曝光主要决定的是"模型到底知不知道这件事"。而少数派曝光每增加一个标准差,完整回忆率上升15.13个百分点,部分回忆率下降15.41个百分点。这说明少数派曝光决定的是"模型能不能把两个说法都记全"。

这个发现挺重要的,它把一个模糊的"模型记忆不全"问题,变成了一个可以在数据层面下手解决的问题。如果预训练数据里,某个冷门事实的两种说法一个被提到50次,另一个只被提到2次,那不管模型规模多大、推理能力多强,它天生就更容易"选边站"。这不是模型能力不够,这是数据结构性的问题。就像一个孩子如果听家里长辈反复念叨某个亲戚的一种说法五十次,只偶尔听到另一种说法两次,长大后他脑子里默认的版本会是哪个,根本不用猜。

领域差异:有些知识天生更容易记全,有些天生更容易漏

论文还按知识领域拆分了结果。表现最好的是"人物、组织、事件"类知识,完整回忆率能到38.7%,其次是"数字内容与娱乐"类,32.1%。而表现最差的是"消费产品与服务"类,完整回忆率只有6.2%,部分回忆率却高达62.1%。

研究者给出的一个合理猜测是,这可能跟维基百科在预训练语料中被反复采样的现象有关。名人、机构、历史事件这类内容,维基百科上覆盖得比较全,而且被各种预训练语料反复引用,曝光度自然就高。相比之下,产品价格、投票数、精确到日的具体日期这类细节信息,曝光度天然就低,也更容易被模型的记忆遗漏一半。

这也解释了为什么论文里举的一个例子特别典型:Freedom 251这款手机的美元售价,一个说法是4美元,一个说法是7美元,32个模型里,没有一个能完整说出两个价格,24个只记住了4美元这个更流行的说法,8个干脆答错。

多模型协同:集体的记忆比个体更完整,但仍有缺口

论文还做了一个挺聪明的分析。研究者把32个模型的回答放在一起,用一种贪心算法逐步组合,每次挑一个能让完整回忆率提升最多的模型加入"专家团",看看这个虚拟团队最终能达到什么水平。

结果显示,从Kimi-K3单打独斗的52.4%开始,随着加入更多模型,完整回忆率一路涨到81.2%,失败回忆率降到了0。这说明不同模型确实各有各的知识盲区,合起来能覆盖到更全的信息。

但即便如此,还有18.8%的问题,也就是206个问题,即使把32个模型的答案全部拿来对比,也没有任何一个模型能把两个说法都答全。这些问题里的少数派说法,可能真的是预训练数据里极度稀缺的存在,稀缺到没有任何一个模型,不管多强,都没机会捡到它。

这个数字挺让人清醒的。它说明这不是"模型还不够聪明"的问题,而是"知识供给本身有天花板"的问题。就像一场大型的多人寻宝游戏,即使把所有玩家的发现汇总起来,某些藏得特别深的线索依然可能没人找到,不是玩家能力不够,是那条线索本来就埋得太深、留下的痕迹太少。

还有一个便宜的替代方案:困惑度也能当参考

除了让模型完整地生成答案再打分,论文还试了一个成本更低的替代评估方式,叫条件困惑度。

条件困惑度:指的是给定一个问题,模型对一段特定答案文本赋予的"意外程度"的量化指标,数值越低,说明模型觉得这段答案越"自然""符合预期"。

具体做法是把验证过的答案塞进一个自然的回复模板里,让模型按照它自己的对话模板走一遍,只计算答案部分那几个词的困惑度,而不需要模型真的从头生成一遍答案。结果发现,困惑度低的问题,往往对应完整回忆的情况,困惑度高的问题,往往对应失败回忆。这套方法虽然粗糙一些,但胜在快,不需要走一遍完整的生成加评判流程,可以作为大规模筛查时的一个廉价代理指标。

写在后面

读完这篇论文,我一直在想一个更本质的问题:我们一直说AI"知道"某件事,但"知道"这个词到底是什么意思?

如果一个模型只记住了一件事的一个版本,却对另一个同样有据可查的版本毫无察觉,它到底是"知道"还是"不知道"?按传统的单答案评测标准,它会被判定为答对了,拿满分。但ElephantBench这套体系告诉我们,这个满分背后可能藏着一半的盲区,而这个盲区,模型自己完全意识不到。

这让我想到一个更让人不安的类比。一个人如果只读过一本关于某段历史的书,他会觉得自己"了解"这段历史,他不会觉得自己有认知盲区,因为他压根不知道还存在另一本讲法完全不同的书。模型的处境和这个人一模一样,它不是故意隐瞒另一个说法,它是真的不知道另一个说法存在,或者曾经知道,但被训练过程中的曝光失衡给冲淡到几乎消失。这种"不知道自己不知道"的状态,比"知道自己不知道"要危险得多。

论文里那个多数派和少数派曝光度的发现,让我重新想了一下"数据决定模型"这句老话。它不只是说数据量决定能力上限,它说的是数据里各个说法的相对比例,直接决定了模型在面对分歧时会不会"选边站"。这意味着,消除模型的认知偏见,可能不完全是一个算法问题,更可能是一个数据配平问题,得从源头上让少数派的声音在训练语料里获得更多曝光,而不是指望模型自己在推理时突然开悟。

还有一个细节我觉得值得单独拎出来说。论文里提到,给小模型开推理,有时候反而让它把两个说法归并成一个,这个现象和人类身上的"过早收敛"心理现象挺像。人在信息不全的时候,大脑会本能地想要一个确定的答案,哪怕代价是丢掉另一部分真实信息。这种对确定性的渴望,似乎不只是人类的毛病,似乎在AI的推理机制里也留下了痕迹。这是不是意味着,更强的推理能力,某种程度上也意味着更强的"过早下结论"的倾向?这个问题,论文没有回答,但值得继续追问下去。

Q&A

Q1:ElephantBench是什么?

A:ElephantBench是腾讯优图实验室等机构提出的一个闭卷知识测试基准,包含1094道问题,专门用来测试大模型能否完整记住一件长尾事实的多个不同版本说法,而不是只记住其中一个。

Q2:为什么大模型知道答案却答不全?

A:研究发现模型往往只记住了曝光更多的主流说法,忽略了曝光较少的少数派说法,这种现象被称为认知短视。即使是最强模型,完整回忆率也只有约52%,大部分情况下只答对一半。

Q3:模型变大或者开启推理能解决这个问题吗?

A:能缓解但不能根治。模型规模扩大能显著降低完全不知道的情况,但部分回忆率反而上升。开启推理对大模型有帮助,但对小模型有时会让它把两个说法误判成一个,反而丢失信息。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
特斯拉新款 Model 3 终于要来了?交付时间大幅延长

特斯拉新款 Model 3 终于要来了?交付时间大幅延长

XCiOS俱乐部
2026-09-13 08:40:26
紧急提醒!高铁“三不带”统一执行,安检常被拦,别等误车才后悔

紧急提醒!高铁“三不带”统一执行,安检常被拦,别等误车才后悔

陈博世财经
2026-09-12 10:16:32
二叔欠30万十五年未还,我从未讨要,他女儿出嫁我拿着借条收礼金

二叔欠30万十五年未还,我从未讨要,他女儿出嫁我拿着借条收礼金

张道陵秘话
2025-09-25 17:48:36
陳松伶重返娘家TVB又狀態Fit爆,老公張鐸化身專屬攝影師打情罵俏

陳松伶重返娘家TVB又狀態Fit爆,老公張鐸化身專屬攝影師打情罵俏

粤睇先生
2026-09-12 21:35:04
许家印刚判完,国家就出新规了!现房是好事,但代价可能真不小

许家印刚判完,国家就出新规了!现房是好事,但代价可能真不小

华人星光
2026-09-10 13:03:48
121 秒奇迹!阿森纳 8500 万新援替补封神,阿尔特塔神换人太绝了

121 秒奇迹!阿森纳 8500 万新援替补封神,阿尔特塔神换人太绝了

奶盖熊本熊
2026-09-13 07:45:00
西安2172户被害人灵魂之问,“我们1.34亿元去了哪里”?

西安2172户被害人灵魂之问,“我们1.34亿元去了哪里”?

记录刘杰
2026-09-12 22:42:47
马拉多纳传记作者:马拉多纳在世界杯耽误过梅西,但梅西不记仇!

马拉多纳传记作者:马拉多纳在世界杯耽误过梅西,但梅西不记仇!

历史第一人梅西
2026-09-12 22:22:13
希拉里公开警告,以色列如果再次推选内塔尼亚胡,美国将不再客气

希拉里公开警告,以色列如果再次推选内塔尼亚胡,美国将不再客气

趣文说娱
2026-09-13 08:48:45
原来刘銮雄弟弟是他,身家百亿却坚决不娶女明星,儿女双全有出息

原来刘銮雄弟弟是他,身家百亿却坚决不娶女明星,儿女双全有出息

青杉依旧啊啊
2026-09-13 04:42:33
2026年9月,魏德尔的一句"不派军舰去中国家门口、不军演、不挑衅"的表态,被中文媒体不断转述。

2026年9月,魏德尔的一句"不派军舰去中国家门口、不军演、不挑衅"的表态,被中文媒体不断转述。

回京历史梦
2026-09-11 17:34:55
小米Logo被赛事声明删除、车队退赛,冠名合作的信任危机如何化解

小米Logo被赛事声明删除、车队退赛,冠名合作的信任危机如何化解

呼呼历史论
2026-09-12 08:15:49
摸臀女开始哭了,开始博同情了,又发视频吐槽要说法了,哭到心率 120!呕吼!

摸臀女开始哭了,开始博同情了,又发视频吐槽要说法了,哭到心率 120!呕吼!

魔都姐姐杂谈
2026-09-12 03:40:03
凌晨2点战报:再爆大冷墨菲惨遭五连鞭逆转5-6憾负,决赛对阵出炉

凌晨2点战报:再爆大冷墨菲惨遭五连鞭逆转5-6憾负,决赛对阵出炉

锐评利物浦
2026-09-13 09:51:33
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
中国人最爱的快餐,塌了

中国人最爱的快餐,塌了

快刀财经
2026-09-12 22:14:10
劝所有人赶紧戒烟:现在的香烟,和20年前根本不是一个东西

劝所有人赶紧戒烟:现在的香烟,和20年前根本不是一个东西

周哥一影视
2026-09-12 09:26:00
比托纳利更坑!热刺头号水货彻底隐身!19 次触球 7 次丢球太离谱

比托纳利更坑!热刺头号水货彻底隐身!19 次触球 7 次丢球太离谱

澜归序
2026-09-13 09:48:05
2026年,养老金重算补发陆续到账,为什么有人补500元,有人能补1500元?

2026年,养老金重算补发陆续到账,为什么有人补500元,有人能补1500元?

碎月导师
2026-09-13 07:00:03
雷宇扬灵堂内部曝光!吴志雄到场送别,一句话点破遗孀真实处境

雷宇扬灵堂内部曝光!吴志雄到场送别,一句话点破遗孀真实处境

普陀动物世界
2026-09-13 08:35:56
2026-09-13 11:23:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9843文章数 568关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

白岩松追忆敬一丹:她走的从容而坚定 没有任何遗憾

头条要闻

白岩松追忆敬一丹:她走的从容而坚定 没有任何遗憾

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

主持人敬一丹去世,女儿悲痛发讣告

财经要闻

“1+N+X”!私募业,监管规则密集落地!

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

艺术
教育
旅游
公开课
军事航空

艺术要闻

大唐名媛的游园图鉴:簪花、薄纱、遛鹤逗犬

教育要闻

难哭中等生:1辈子想不到这辅助线

旅游要闻

视频丨深度体验带动消费升级 这个暑期旅游还有哪些新趋势?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

胡塞武装:9天攻占5400平方公里

无障碍浏览 进入关怀版