导语:
随着大模型规模化落地,以DeepSeek R1为代表的新一代推理模型在展现强大逻辑性的同时,其生成内容与事实产生偏差的情况也引发了广泛关注。对此,当前存在三种误区,一是认为模型幻觉源于训练数据清洗不彻底,构建“无菌”数据集可以消灭幻觉;二是认为幻觉等同于虚假信息,需要对其进行严格治理和管控;三是认为模型厂商需要对幻觉承担全部责任。然而,幻觉治理应跳出上述的错误归因,从幻觉的技术成因来看其解决方案。
大模型会基于客观世界多样化的表达预测出差异化的结果,这种多样性构成了大模型泛化能力的基础,也造成了模型生成内容准确性下降,产生了幻觉。从技术视角看,作为概率模型,大模型在预训练阶段可以通过调节参数,调整模型采样策略,平衡幻觉与泛化能力。在专注于能力优化的后训练阶段,推理模型能力的提升需要依靠在大量强化学习过程中自己领悟,基于奖励模型而非客观事实进行反馈,这在带来更强大性能的同时,可能产出与事实不一致但“听起来合理”、更容易获得高分的回答,从而放大幻觉。幻觉与模型训练的策略选择和多元目标相关,应将其视为模型可优化的特征,而不是简单看成漏洞。在控制有害幻觉,增加有益泛化方面,产业界已经出现了基于模型能力的内生性调优、基于外层护栏的补充保障能力、以及基于应用侧按需调用适配模型的系统性应对方案。
从规范角度,我国在立法过程中各方已经认识到幻觉并不是虚假信息,治理中强调引导、协同而非强制性管控。针对幻觉的治理有以下三点思考:一是幻觉并不是训练数据清洗的问题,对幻觉的治理不是消灭而是控制。二是治理应根据不同场景和使用目的加以区分。三是应建立企业、政府、公众的多元治理格局,企业在探索优化方案的同时避免过度宣传、政府在分场景治理的同时加强科普引导、公众在提升数字素养的同时在模型应用中产生优化需求,反向促进技术创新。
一、模型幻觉与泛化能力之间需要平衡
随着生成式AI的技术突破,以DeepSeek R1为代表的新一代推理模型展现了强大的逻辑性和推理能力,比如在文章创作中,R1能够带来充满灵性、文采飞扬的表达。与此同时,人们也发现R1有不少幻觉的现象,例如在基于用户给出的文章做摘要后,生成了看似合理却与原文不符的内容,容易对用户产生误导。根据Vectara模型测评,R1出现幻觉的比例约14.3%[1]。然而,一方面模型复杂推理能力的提升需要通过更大范围使用强化学习(RL)训练来实现,但RL的过程是基于环境(奖励模型)而非严谨的事实反馈,在现阶段技术中,这种依赖机器“自我思考”的机制虽然赋予了模型更高的思维灵活性,却也更容易产生幻觉;另一方面,大模型技术快速扩散,特别是在政企侧应用的普及,对生成结果的准确性和可靠性提出了更严格的要求,过高的幻觉会阻碍规模化应用。这需要我们正确理解幻觉产生的原理,在享受模型创意的同时控制有害误解。
幻觉是模型的特征(Feature),而不是模型的漏洞(Bug)。大模型的学习过程就像人脑的记忆一样,不可能每个字都记得清楚,会进行压缩和泛化,做到“抓大意、找规律”。模型的训练就是基于训练语料提炼规律,而推理则是利用规律回答新的问题。
从技术角度,大语言模型是基于前文预测下一个Token出现的概率,由于模型在预训练阶段会接触各类型的语言表达方式,下一个Token的生成源于对学习语料概率分布的理解和掌握,并非是对训练语料的简单搜索和复述。而幻觉出现的原因是预测的下一个Token分布偏长尾,导致和事实出现不一致的情况。这虽然会造成准确性和可靠性的下降,但也能让模型在没有训练过的样本上有正确表现,这种正确是基于之前语料学习的规则和逻辑;而正是这样的泛化能力,为模型在不同任务中的应用奠定了基础。此外,即使训练语料能100%完全符合“真实、准确、客观、多样”的标准,模型预测的概率分布在某些情况下仍会偏长尾,无法杜绝幻觉的产生。
在大语言模型预训练阶段,可以通过调节“泛化温度”参数,调整模型的采样策略,在幻觉和泛化能力之间进行平衡。调整参数可以控制输出概率的分布特点:较高的“温度”使概率分布更长尾,模型更倾向于给出多种可能的答案,从而增强模型的泛化能力和鲁棒性,而较低的“温度”使概率分布更集中,模型更倾向于给出最可能的答案,却以牺牲一定的泛化能力为代价。实践中低温状态(T=0.1-0.3)生成结果确定性高,适用于代码生成、智能客服问答等需要准确性的场景;中温状态(T=1.0)平衡多样性与合理性,适用于常规对话场景而;高温状态(T>1)可以激发创造性,适用于诗歌创作、头脑风暴等场景,但可能产生逻辑错误。[2]
在专注于能力优化的后训练阶段,大语言模型可以分成“快思考”的通用模型、以及“慢思考”的推理模型两个方向。通用模型经过大量较为严格的监督微调(SFT)训练,让模型从微调语料的规则中学习,同时获得更多的先验性知识,输出结果的准确性和可靠性相对较高。而随着DeepSeek等推理模型的广泛应用,幻觉问题再次引发关注。推理模型是在后训练阶段结合经过严格清洗、有思维链推理(CoT)过程的高质量数据集,通过RL进行训练的。RL的过程不需要人类过多反馈,而是通过让模型与环境互动,根据获得的“奖励”或“惩罚”来优化其行为。采用RL提升推理能力的同时,也造成了更多的幻觉,这也和RL自身技术特点有关。
推理能力的习得依靠模型在大量RL过程中自己领悟,尝试多种可能性激发“能动性”,让思维更活跃;而训练中使用SFT语料较少,目的也不是确保先验知识的精确性,而是让模型能像人类一样说话——这也是模型提升复杂推理能力的主要发展方向。模型的智能并不是依靠基于严格事实的反馈,而是基于奖励模型的奖惩信号,因为掌握了更强的逻辑性,在RL过程中可能产出与事实不一致但“听起来合理”、更容易获得高分的回答,从而放大了幻觉。例如R1训练先后经历了两个阶段的SFT和RL过程(GPRO方法):在第一阶段用少量SFT进行初始化,让模型基于设定的大方向通过RL自主探索。在第二阶段也仅采用少量SFT语料做指令遵循,让模型扩展通用能力与任务适配。同时,在RL训练过程中,对模型的创造性给予了更多的奖励,当然也更容易出现偏离事实的情况。[3,4] 在表现形式上,优势体现在将数学和代码的推理能力充分延伸到了语言创作领域,语言风格更为活泼、灵活、富有多样性,在创作上也更有文采。而劣势则是模型的主动探索会把简单问题复杂化,比如将用户做摘要的简单任务自动增加很长的思维链,反复从不同角度理解和延伸,产生了不必要的“脑补”,导致产生幻觉。
![]()
二、针对模型幻觉的系统性应对方案正在不断发展
从技术角度发现,不论是通用模型还是推理模型,幻觉与模型在训练策略上的选择、模型训练的参数设置和多元优化目标的选择相关。应将幻觉看成是可以优化的Feature,而不能简单将其视为Bug,才能更好控制有害幻觉,增加有益泛化。目前产业界已经出现了基于模型能力的内生性调优、基于外层护栏的补充保障能力、以及基于应用侧按需调用适配模型的三方面系统性方案。
(一)供给侧:基于模型能力的内生性调优
在后训练阶段,通用模型利用安全微调和安全对齐进行内生性调优。比如通过SFT引入标准问答对,使模型更好地在对齐人类意图、激活泛化能力的同时,提高生成内容的准确性和可靠性。还可以通过基于人类反馈的强化学习(RLHF),让人类对模型的输出进行排序,使模型学习到哪些输出是更准确、更符合人类价值观的。[5]
推理模型的后训练也逐渐出现了兼顾创造力与准确性的方案。其一,模型可以基于用户的意图理解,判断给出事实性还是创造性的回答。比如,通过系统提示词(System Prompt)的方式决定模型是否开启深度思考模式。System Prompt是由系统或开发者预先设定的一段提示词,对用户通常不可见,会根据用户的输入内容在后台引导模型的行为和输出风格。模型在现实中的应用,有些是偏数学和代码类的,需要依靠模型推理能力深度思考;而有些更偏事实性的先验知识,此类任务启用推理模式容易“用力过猛”,更适合模型结合训练知识以及RAG语料直接给出回答。例如最新推出的通义系列开源模型Qwen3.0,当用户通过百炼平台调用时,System Prompt可以结合模型指令遵循的能力,根据用户输入的关键词判断什么时候需要慢思考"Think",什么时候需要快思考"Talk",兼顾模型结果的创造性和严谨性。同时,当对模型进行本地化部署时,Qwen3也支持用户通过简单指令或配置文件让模型在思考与非思考模式之间动态切换。
其二,RL自身的技术路线也在不断演进,通过算法优化平衡创造性与幻觉控制。R1的RL过程采用的是GPRO方法,允许模型在较大范围内调整策略以增强创造性,但也可能因过度探索引发幻觉。在此基础上诞生的DAPO优化,通过引入动态奖励机制,在奖励函数中加入事实验证模块,对生成内容进行实时校验,可以抑制无依据的联想。[6] 而在今年4月刚出现的VAPO方法,又在DAPO基础上集成知识图谱检索等外部验证机制,让模型在生成关键信息时引用可信来源,采用“生成-验证-修正”的循环,保障创造性输出不偏离事实框架。[7]
其三,对不同任务类型进行精细化训练,调整SFT语料的占比。针对摘要、改写、翻译、报道等需要在忠于原始内容之上进行少量再创造的场景,可以加强约束(增加更多相关的SFT语料等),让模型在更多需要忠实原文的任务中,通过对更多微调语料规则的学习,与人类意图对齐,减少幻觉生成。[8]
(二)供给侧:基于外层护栏的补充保障
一方面,对于专业领域的知识,通过外挂知识库的方式帮助模型正确使用。例如检索增强(RAG)能够在不改变模型通用能力的前提下,在模型应用阶段引入外部知识,提升语料的时效性和专业性,解决模型训练数据无法及时更新的问题,增强大模型生成内容对具体场景的适配度。另一方面,通过外围护栏和安全巡检,控制模型生成幻觉内容。依靠外层护栏能力,包括关键词拦截、标准问答等技术持续监控模型。在采取以上措施的基础上,由于模型概率的不可控性,为进一步缓解幻觉的发生,依然会对模型生成内容采取自动化的实时安全巡检,在输出前再执行一次安全过滤和及时拦截。
![]()
(三)需求侧:基于应用按需调用适配模型
在工程上,可以利用Agent能力根据任务的复杂度,调用不同模型和工具进行处理,实现高效协同。通过对用户需求更深度理解,Agent可以通过路由模块对任务复杂度进行分类,将基础问答、数据查询等简单任务交给基座模型快速响应,或调用工具直接完成;而对需要“慢思考”的多步骤推理、代码生成等复杂任务则交给推理模型完成。这样既可以避免算力资源浪费,又能提升任务的成功率。
三、对幻觉治理的几点思考
总体而言,模型技术构架的特点决定了幻觉和泛化之间需要实现平衡,不能以过分牺牲泛化这一重要性能来“削足适履”地管控幻觉。我国《生成式人工智能服务管理暂行办法》第四条第五款提出“基于服务类型特点,采取有效措施,…提高生成内容的准确性和可靠性”,相比于2023年4月的征求意见稿中“利用生成式人工智能生成的内容应当真实准确,采取措施防止生成虚假信息”的表述已经有所放宽,核心原因在于在立法过程中各方都认识到模型幻觉虽然影响了生成结果的准确性和可靠性,但并非虚假信息,因此对幻觉的治理强调引导和协同,而非强制管控。具体而言,在治理方面有以下三点思考:
首先,幻觉是创造能力的伴生品,而不是训练数据清洗的问题,治理目的不是消灭而是控制幻觉。即使训练数据完全清洗干净也并不能杜绝幻觉,对幻觉的治理也不能通过严格管控训练语料实现。相反,模型预训练需要接触广泛的世界知识,过于追求“无菌”环境,对语料可及性造成事前的限制和阻碍,会造成知识空洞,降低模型能力,引发更严重的后果。因此,强制性消除幻觉不仅在技术上无法实现,也会阻碍大模型的发展。
其次,对幻觉的治理应根据不同场景和使用目的区别对待。幻觉的影响取决于不同领域应用中的容错率、以及生成内容的表达模态等多个因素。在以医疗诊断、法律判决、金融决策为代表的政企端应用场景中,对准确性和可靠性的要求很高,需通过RAG链接权威知识库,以及人类交叉验证尽可能减少有害的幻觉;而在更多面向公众端应用的创意写作、娱乐交互等场景,适度的“创造性编造”则会提升用户体验。在某些科研领域的应用中,幻觉还能激发创造力,显著加速科学家们构建新想法并对其进行测试的过程。例如,《纽约时报》就报道了利用大模型幻觉,推动新型抗生素研发以及创新导管设计的案例。[9] 此外,图片、视频是相较于文字而言更具象化的表达,人类对生成的多模态内容准确性和可靠性要求往往更高。因此,对幻觉分场景治理的策略既避免了“一刀切”式的过度防御,也确保技术能在合理风险边界内释放价值。
最后,幻觉治理应加强协同,建立企业、政府、公众的多元治理格局,共同提高认知。一是从事人工智能研发和应用的企业在技术和工程上不断探索平衡幻觉与创造性的最佳方案。同时也不应“过度宣传”产品的智能化程度,让公众认识到技术发展是长期演进的过程。二是政府侧对幻觉建立更全面、客观的认知,通过分场景治理的方式引导技术健康发展。此外,政府和媒体也要着力推动科普教育力度,让更多人客观认识到技术局限性、正视幻觉。三是重视公众在幻觉治理中的作用。公众具有用户和受众双重角色,能够直观感知内容生成质量。一方面,公众通过政府和企业的宣导提升数字素养,对模型原理有更好的理解;另一方面,用户在使用过程中会由于新需求的出现,产生对现有技术的优化需求,从而对技术进行需求导向的创新重塑。[10]
参考注释:
[1] Github:https://github.com/vectara/hallucination-leaderboard
[2] Google 官方提示工程 (Prompt Engineering)白皮书. 2025-04
[3] 四篇DeepSeek官方论文梳理: DeepSeekMoE、MLA、MTP、RL、Distillation. 2025-02
[4] DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. 2024-04
[5] 生成式人工智能治理与实践白皮书. 2023-11
[6] DAPO: An Open-Source LLM Reinforcement Learning System at Scale. 2025-03
[7] VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks. 2025-04
[8] DeepSeek-R1超高幻觉率解析:为何大模型总“胡说八道”?. 2025-02
[9] How Hallucinatory A.I. Helps Science Dream Up Big Breakthroughs. New York Times, 2024-12
[10] 人工智能时代内容生成的伦理治理——访清华大学文科资深教授、人工智能国际治理研究院院长薛澜. 学习时报. 2025-04
版块介绍 — 治理之智
在全球化背景下,科技的快速发展也带来了前所未有的治理挑战。本板块内容依托阿里巴巴集团先进的AI科技能力、丰富的应用场景与负责任的技术生态,聚焦于AI风险、AI大模型安全、AI大模型开闭源生态、AI大模型出海等AI治理政策研究,基于技术理性的风险观,为大模型发展与安全平衡与取舍提供独到见解。同时,我们致力于收集和分享海内外AI治理先进理论与经验,为构建合理的科技治理体系提供智慧与灵感。
Reading
3、
4、
5、
6、
7、
8、
9、
10、
11、
12、
13、
14、
15、
17、
18、
19、
20、
21、
23、
24、
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.