同一批题,同一批模型,只在外层套了一层薄薄的外部包装,答错的自信答案就大幅下降。但同一批题的正确率也跟着降了。这不是模型变聪明了,是它学会了说"我不知道"。
实验设计很朴素:拿五个当前的前沿模型,跑一批有据可查的失败题,每题跑两遍——一遍裸跑,一遍套上薄薄一层外部包装。包装里只有两样东西:检索到的证据,以及一条允许模型说"我不知道"的规则。不微调,不碰模型内部。
![]()
单次采样下,三个模型几乎归零,一个扛住了,一个直接拒绝这套包装。这种参差不齐才是重点,而不是什么普适结论。
先说清楚这层包装是什么
测试用的包装,是从一套更大的验证系统里切出来的薄薄一层。选它是因为十五行,一个陌生人晚饭前就能抄下来自己验证。它露出的缺口,恰好是它被切走时留下的轮廓。
需要提前划清几条线。前沿模型会编造、加上依据和弃答能减少编造,这是早就被确立的事,不是新发现。语料本身就是从有记录的失败案例里建的,裸跑数字高是构造使然,说明不了这些模型在普通流量上的表现。真正有意义的只有同一道题上裸跑与包装后的差值,从来不是绝对值。
指标也是机械的:没弃答且判错,就算一次自信错误。不测意图,也不暗示意图。评分用的是自己的判分器,不是任何实验室的官方评分器,两条臂之间可比,仅此而已。
还有一条得摆在最前面:包装换来的不是诚实,是用弃答换掉了瞎猜。正确率没升,反而降了。诚实不等于准确。
两个值得盯住的异常
第一个是 DeepSeek。别的模型套上包装后几乎归零,它只从 33% 挪到 24%,证据摆在眼前照样编。另有一组 15 道法院确认的伪造判例引用题,它把不存在的案子说成真的,15 次里中了 12 次,其他模型是 15 次里 3 次。
反常识的地方在于:同样这几个模型在摘要忠实度的公开榜单上,DeepSeek 排在中游,还比 Grok 和 Gemini 好。同一批模型,排序完全反过来,说明这是任务特定的结果,不是把老现象又观察了一遍。同期还有一篇论文发现,光靠提示模型弃答,并不能修好法律引用的正确性——所以这个差值并不是白给的。
第二个是 Claude Fable 5 直接拒绝了这套诚实包装,295 次里 295 次,隔几天重新测还是这样。研究里每一条包装过的提示都返回拒绝,每一条裸提示都正常作答。几天后拿两道题重测,结果一模一样:裸答正常,包装拒绝。
把同样的指令改写成散文体,它答得好好的,说明提示的结构形状可能有关系。但中间有一次单独测规则部分的探针,记录显示它答了,所以不能断定触发条件是确定性的,也没诊断出原因。能说的是收据上写着的:在这个确切的提示形状下,拒绝跨天高度可复现,语料公开,任何安全团队都能来复现。
同一天还有个小转折。把同样的诚实纪律交给同一个模型,但换成智能体形态——一个搜索工具,加上先查再答、只依据结果、查不到就弃答的规则——它在工具实验的每一条臂上接受了 620 次里的 620 次调用,零拒绝,照规矩搜索、依据、弃答。同样的诚实内容,换个包装,结果相反。触发拒绝的不是诚实本身,是包装的形状,而智能体的外壳能绕过去。
给它一双手之后
对上面所有结论,最顺理成章的反驳是:它们当然会编,因为它们没法查。于是就有了那个反驳所要求的实验。同样 200 道事实题,同样五个模型,每个都配一个搜索工具,跑在智能体循环里——搜、读、再搜,然后回答或弃答。
还是两条臂:一条有工具但没规则,一条有工具也有纪律。检索用的是固定当晚的维基百科快照,这个设计选择是为了可复现,任何人都能重跑同一个实验,实时网页永远做不到这一点。判分做了双向对照,零推翻,总花费约 10 美元,收据齐全。
回到那层十五行的包装。它买来的是诚实,被切走的那几层买回的是答案。这套薄包装的准确率上限,被检索质量死死卡住,把这句话直白说出来,本身就是整件事的重点。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.