2017年5月,人工智能阿尔法狗以3:0的成绩战胜了世界第一围棋手柯洁,举世哗然。人们纷纷感慨:“计算机在特定领域的智慧已经超过了人类。”然而,更令人意外的是,仅仅过了五个月,这个曾经击败人类棋王的“围棋之神”阿尔法狗,就被另一位对手以100:0的成绩击溃。
打败它的对手是自己的亲兄弟——阿尔法元。与阿尔法狗“学习人类棋谱”的策略不同,阿尔法元采用“不断与自我对弈”的学习模式。这种学习模式使得它在极短时间内就拥有了超越阿尔法狗的智慧。
这不禁让我思考,既然曾经的阿尔法元可以通过“自我对弈”不断进化棋技,那么今天的大语言模型(LLM)能否通过“不断学习自己产生的文字”来精进文笔呢?倘若可以,那么拥有“高于人类”文笔的AI,能写出怎样的文章?倘若不能,那这种自我循环训练又会带来什么隐患?
按我们的设想:先用LLM产出内容,再用这些内容训练新一代模型,新的模型用于下一轮产出。如此往复,就应该可以得到我们期望中的模型。

可这样生产出的,真的是我们所期待的“文字大师”吗?
2024年《Nature》的一篇论文对此展开了研究。结果显示,经这种循环训练模型非但没有进化成文学家,反而全部出现了“模型坍塌(Model Collapse)”的现象。所谓模型坍塌,就是指模型的知识多样性下降、输出错误增多、输出结果变单一。通俗讲就是模型变傻了。
为什么同样是自我训练,阿尔法元可以变得更聪明,而LLM却会走向坍塌?其实,根源在于阿尔法元和上述LLM在训练方法上存在差异。
在我们设想的训练中,前一代LLM生成的所有内容都会被不经筛选地展示给其下一代LLM,这其中就包括了大量错误信息和重复信息,新一代LLM会继承这些缺陷,导致模型的错误被不断累积放大,最终偏离正轨。
而阿尔法元的不同在于,它的训练过程有明确、可量化的奖惩机制。每当输出错误的结果时,系统会通过惩罚来避免模型再出现相同问题。正是在这个奖惩机制的推动下,阿尔法元才得以不断进化。
然而,围棋的奖惩机制固然容易敲定——“赢棋就奖励,输棋就惩罚”,可言及LLM,情况就不同了。试想:什么样的文章是值得奖励的,而什么样的文章又是应当被惩罚的?看来,在人类破解这个深奥的哲学问题之前,我们想象中的“文字大师”恐怕暂时还难以实现。
其实,“模型坍塌”问题不止存在于实验室的假想实验中,它已经悄然渗透进了我们的现实生活里。
今天,海量的AI生成内容充斥着互联网,而各大AI公司又在不断让自家模型学习互联网上的内容。这感觉,不和刚才我们探讨过的“循环训练”一样吗?因此,悲观地说,我们的语言模型很可能都处在坍缩的进程中。
这种担忧并非凭空臆想,现实中已经可以看到一些迹象:你是否感觉,生活中“人写的文章”越来越少,而AI生成的文章越来越多?你是否发现,判断一篇文章是否是AI生成的,正在变得容易?你是否看过,网络上大家总结出的“AI感文章特点”在变得越来越具体?
互联网原本是人类思想与文字的沃土,而如今,AI生成的文字却在不断地侵蚀这片土地。我想,在人类不断期待AI展现智慧的同时,也应当保持一份警觉:我们绝不能让AI自我循环生成的文字消解人类独有的思想力量。