Nature 子刊:8 亿人用 AI 写作,语言多样性正在消失

LLM 正在让所有人写得一样

先给结论:用 AI 助手润色文字,不只是把文章改顺,而是在可测量的尺度上让文章「越来越像别人」。南加州大学团队与合作者本周发表在 Nature 子刊(Nature Human Behaviour)的研究,分析了 2018—2024 年超过 88 万篇文本,发现 LLM 写作助手的普及——ChatGPT、Claude 等工具服务用户已超 8 亿——与写作风格的持续均质化显著相关,arXiv 论文、新闻、Reddit 故事无一例外。控制实验里,用 GPT-3.5、Llama 3 70B、Gemini Pro 改写人类文本,即使原意几乎不变(87% 文本相似度超 0.95),复杂度方差依然被显著压缩。同一研究还发现:文字里的年龄、性格、价值观信号在淡化,并统一偏向一个「默认人设」。改写后的文本回流训练语料,效应还会自我叠加。这不是风格之争,而是人类语言正在发生的结构性变化。

研究一:88 万篇文本里,风格方差在塌缩

第一步看真实数据:三个纵向语料——约 8 万篇 arXiv 摘要、37.96 万篇 Patch News 文章、31.8 万篇 Reddit 创意故事,跨 2018—2024。团队用检测工具 Binoculars 标记 AI 生成文本,追踪「写作复杂度」方差的走势。ChatGPT 发布后,arXiv 与 Reddit 的方差出现显著且持续的下降,AI 使用率能显著预测后续方差变化(arXiv 的格兰杰因果检验成立;Reddit 同样成立但滞后约 20 个月——作者认为是用户群体更广、工具采纳更慢)。Patch News 在发布时也明显骤降,但因果信号不显著:专业编辑与机构规范可能缓冲了直接效应,细微影响仍可能透过整体写作规范间接渗透。

第二步是控制实验:从 Reddit 和 arXiv 随机抽取 1,000 篇 ChatGPT 发布前的人类文本,用 GPT-3.5、Llama 3 70B、Gemini Pro 以中性提示(「改进语法」)改写。87% 的改写与原意相似度超过 0.95——意思保住了,风格方差却被显著压缩。

研究二:文字里的「作者指纹」在消失,还带上了默认人设

研究二问得更尖锐:还能从文字认出作者吗?团队收集了带心理测量数据的语料(年龄、性别、大五人格、共情、道德价值观),训练分类器从文本预测这些特质,再对比原文与改写版的预测准确率。两个发现:第一,六类特质的预测准确率平均下降约 6%(F1 绝对值),年龄受影响最大(0.351 → 0.260)。AI 削弱了身份信号,但没有彻底抹掉,分类器表现仍高于随机水平。第二,这种变化不是随机噪音,而是系统性偏斜:改写后的文本更常被判定为「年龄更大、道德感更强、共情更低、外向性更低、开放性和宜人性更高」——三种模型、不同提示词下方向一致。

换句话说,LLM 不是简单「擦除」身份,而是在引入偏差,把不同作者逐渐推向同一个「默认人设」。

研究三:「词—人」关联正在被选择性冲掉

社会语言学积累了成熟的结论:「外向者多用积极情绪词」「开放性与复杂词汇相关」。研究三检验这些关联在改写后是否还在。原文中经典发现都能复现;改写后,外向性与代词使用的关联、忠诚与朋友类词汇的关联、年龄与未来导向词汇的关联——显著消失;神经质与负性情绪词的关联则保留了下来。这是选择性侵蚀,比全面失真更麻烦:依赖词汇线索的学科——临床筛查、社会科学、营销画像——必须逐一重新验证哪些关联还可靠,否则会得出关于身份、群体差异的偏差结论。

反馈循环:均质化会自我强化

被润色的文本不会留在私人文档里。它流入评论、论坛、论文、新闻等在线语料,而下一代模型又用这些语料训练——均质化偏差因此自我强化:每一代模型读到的语料都更「AI 味」,把平均值再推远一步。像 Marin 535B 这样的全程公开训练让这条语料流水线变得可见:训练数据的口味,就是未来模型的口味。

结构性影响随之而来:靠文本多样性判断抑郁标记的临床筛查、个性化营销、偏好「圆熟」文风的招聘筛选、以及承载文化标记的语言遗产保护,都会收到越来越噪的信号。更深的担忧是语言与思维绑定——语言均质化可能悄悄约束认知灵活性与创造力,正如奥威尔在《1984》里警告的:极端情况下,「缩小思想的范围」。区别在于,这次不是审查和删除,而是一次次「帮我润色一下」。这种收敛为什么几乎必然发生、代价具体落在哪些系统上,我们在姊妹篇里做了进一步分析。

怎么办:把人类文本留在循环里

研究不是否定 LLM 写作工具——清晰表达与写作平权是真实收益。它指向的是设计与流程选择:

  • 研究者:使用词汇线索前先重新验证关联是否存活;「经过 LLM 改写后仍然成立」应成为语料研究的默认前提。
  • 做 AI 写作功能的团队:给文本加可验证的水印,正在成为 AI 内容的标配——保留人类原稿并标记它,未润色的草稿是唯一仍携带人类多样性的训练信号。Anthropic 用 500 万美元推动 AI 对人类影响的福祉评测基准,是同一直觉作用于另一个影响通道。
  • 平台与发布者:尽量让真实人类语料少被均质化循环污染——下一代训练集里 AI 文本越少,漂移越慢。
  • 写作者:把「润色」当作有损操作。保留未润色版本,逐条审视改动,警惕那些把你推向「默认人设」的修改。

常见问题

Q:怎么证明 AI 写作真的在降低语言多样性?
A:观察数据覆盖 88 万+ 文本(arXiv、Patch News、Reddit,2018—2024):ChatGPT 发布后写作复杂度方差显著下降,AI 使用率能显著预测后续下降;控制实验中用三个 LLM 改写 1,000 篇人类文本,87% 原意相似度超 0.95,方差仍被显著压缩。

Q:AI 会不会彻底抹掉文字里的身份信号?
A:不会。特质预测准确率平均下降约 6%(年龄 F1 从 0.351 降到 0.260),但仍高于随机。更麻烦的是系统性偏斜:改写文本一致偏向「年龄更大、更道德、更不共情」的默认人设,跨模型、跨提示词都成立。

Q:长期真正的风险是什么?
A:反馈循环:AI 味文本流入在线语料,训练下一代模型,再推远平均值。依赖词汇多样性的应用——抑郁筛查、招聘、营销、文化保护——收到的信号会越来越噪。

发表评论

滚动至顶部