南加州大学团队在《自然·人类行为》上发表了一项注定引发争论的研究:当大语言模型成为普遍的写作助手,人类的语言多样性正在系统性萎缩。研究者横跨三项实验、七个数据集,分析了超过88万篇真实文本,给出了一组令人警醒的数字——当AI介入写作,文本的复杂度方差最高可收窄50%。
这篇论文题为《大语言模型时代语言多样性的萎缩》,核心发现一句话就能说清:语言是身份的指纹,而AI正在把这枚指纹抹平。奥威尔在《1984》里写道:“我们正在把语言塑造成它的最终形态,那个形态,将是没有任何人说别的语言时的样子。”几十年后,这个预言似乎在应验,只不过动手的不是极权政府,而是你手机里的AI写作助手。
![]()
AI上线那天,写作风格开始“变平”
研究的起点,是2022年11月30日ChatGPT向公众开放的那一天。这是一次罕见的“自然实验”:一个影响数亿人的技术产品横空出世,前后对比,清晰分明。团队选取了三类差异明显的真实写作样本:Reddit创意写作版块的31.8万篇用户故事、美国社区新闻平台Patch的37.9万篇本地报道、以及arXiv上的计算机科学论文摘要(约8万篇)。时间跨度从2018年1月延伸到2024年11月,几乎完整覆盖“前ChatGPT时代”与“后ChatGPT时代”。
他们先用高精度AI文本检测工具逐月标记“疑似AI写作”的文本比例,再计算当月所有文本的“写作复杂度方差”——一个聚合词汇丰富度、句法复杂度与罕见词占比的离散度指标,用来衡量“大家写得差得有多大”。方差越高,文字越千人千面;方差越低,越千篇一律。
结果指向一个方向:ChatGPT发布后,三个平台的写作复杂度方差都出现了显著下滑。不过各平台的路径略有不同,在Reddit与arXiv上,显著的是发布后持续下滑的斜率,且格兰杰因果检验表明,AI使用量的上升在时间序列上“领先”于风格趋同,指向的不是巧合,而是驱动;Patch新闻则相反,ChatGPT发布时出现即时骤降,但没有表现出明显的因果驱动。
不同平台“沦陷”程度有别:受影响最深的是Reddit,一个本该最鼓励个性与创意的社区;学术论文次之,AI让论文更“规范”,却也收窄了科学表达的多样性;新闻写作的萎缩相对温和。而且这种趋同是持续性的侵蚀,冲击分析显示,ChatGPT发布后的每一个月里,方差都在继续收窄,而不是发布初期跌一下便完事。
丢的是“人味儿”
整体趋势成立,那落到单篇文本上,AI到底“动”了哪里?研究者设计了一个贴近日常的受控实验:让人工智能当“文字编辑”。他们让GPT-3.5、Gemini、Llama 3等主流模型,用“润色”“改清晰”“压缩字数”“正式一点”等十余种提示词,去改写真实的Reddit帖子和arXiv摘要,几乎覆盖了普通人用AI改稿的全部日常用法。
先看好消息:AI很“听话”。在87%的文本中,改写版与原文的语义相似度都超过了0.95,核心信息、事实、结论基本原封不动,用AI润色并不会“跑题”。再看“坏消息”:正是这种“忠诚”让问题隐蔽。改写之后,文本的写作复杂度方差显著收窄,幅度高达21%到50%,且无论换GPT-3.5、Gemini还是Llama 3,无论换哪种提示词,结果都惊人地一致。这不是某个模型的“个性问题”,而是这类“以最大概率预测下一个词”的模型与生俱来的倾向。
换句话说:AI在帮你“把话说得更明白”的同时,也在悄悄把所有人的表达推向同一个统计学上“最可能”的均值。因为LLM的本质是从海量语料里预测“最可能的下一个词”,它会本能地避开“罕见而有趣”的表达,偏爱“稳妥而平庸”的用法,一次次改写下来,个性化的边缘表达被滤掉,只剩下最大公约数。你用AI改得越多,你的句子就越像“AI会写的句子”。
还有个容易忽略的细节:语义相似度高并不意味着“内容没变”,而是“意思没变、腔调变了”。同样一句话,十个人本有十种说法,经AI润色后收敛成一两种“标准说法”;信息没有流失,流失的是个性。
你的文字里,藏着“你是谁”
语言心理学早已证实:一个人的用词习惯,就是他的“身份指纹”。从词汇选择里,能反推性别、年龄、性格、情绪,甚至政治倾向。过去几十年,研究者正是靠这套方法,从文字中诊断抑郁症倾向、识别网络暴力、评估候选人性格。
研究者把这一整套方法搬来检验AI,先在原始文本上训练好分类器,让它预测作者的年龄、性别、大五人格、共情水平、道德倾向等属性,再让同一批分类器去预测AI改写后的文本,并比较不同提示词的影响。结论是,无论怎么折腾,AI改写都在侵蚀身份信号,只是程度略有差别。
结果令人警醒:经过LLM改写后,个人特质的预测准确率平均下降了6%;其中“年龄组”受损最重,分类器的F1分数从0.351一路掉到0.260,判断作者年龄的能力明显下降,不过仍高于随机基线。也就是说,AI改写过的文字,越来越难让人看出“是谁写的、多大年纪、什么性格”。
更值得警惕的是偏差的方向。当预测发生错误时,改写后的文本更常被识别为“年长者、男性、政治自由派”的语言,AI不仅抹平差异,还在放大特定人群的特征,把所有人的表达往“主流”上拽。有意思的是,分类器并没有完全失灵:AI改写后的文本依然保留了一部分可预测的模式,只不过保留的是“主流群体”的模式,牺牲的是“少数派”的表达。
试想一个招聘场景:HR用AI工具筛选简历,原本能从字里行间读出“对方性格外向、共情力强”的信号,经AI润色后这些信号被弱化甚至扭曲,所有人都被推向了同一个“标准模板”。表面是效率提升,实则是把鲜活的人压缩成冰冷的平均值。
语言“变平”之后,我们还剩什么
语言学界有条老理论“语言相对论”:语言的结构,会影响我们感知世界的方式。如果词汇被抹平、句式被统一,被压缩的或许不只是文采,还有思想的疆域。
论文用第三个实验从机制上做了拆解,他们复现了语言心理学中一批稳定的“词汇—心理特质”关联,比如男性作者更少使用社交与焦虑类词汇、外向者更爱用积极情绪词等等。但经过AI改写,这些关联并非全都幸存,有的被抹去,有的得以保留。例如“性别与负面情绪词”的关联就从显著变为不显著,年轻人对未来的关注也在改写后消失;而外向性与积极情绪词的关联则安然无恙。
这意味着,我们正在失去从文字中读取人心的可靠通道。这条通道曾经支撑着心理疾病的早期识别、招聘中的个性评估、个性化的内容推荐,乃至一个民族的语言文化传承。对医疗领域的冲击尤其值得警惕:不少研究正尝试用语言特征辅助抑郁症、焦虑症的早期筛查,患者无意间写下的文字可能是重要的诊断线索,但如果这些文字都被AI“统一处理”过,藏在措辞细节里的信号将荡然无存。
这项研究没有给出“不用AI”的结论,它只是把代价摆在了桌面上:每一次点击“润色”,你都在用一部分语言个性,换取表达效率。当所有人都做出同样的选择,我们失去的将不只是个人风格,而是整个社会在语言层面的多样性——那是文化、思想与身份认同的底层土壤。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.