为什么前沿大型语言模型在对话方面变得越来越糟糕
如果你一直在使用最新的前沿大型语言模型(LLMs),几乎可以肯定你现在已经注意到了,新模型在对话方面变得越来越糟糕了。
它们更像机器人,说话充满行话,吐出冗长的文本,还会做一些你没要求的事情。
这怎么会发生?嗯,我不是训练这些模型的人,所以我不能确切地说,但我的确知道足够多的证据,让我有一个很有根据的猜测,我觉得这很有趣,分享出来作为现代LLM训练流程的速成课。
所以我们开始吧。
让我们回溯到2020年。GPT-2和GPT-3已经发布并广泛可用,但它们一次只能预测一个标记——这就是LLM的核心。
标记预测是通过API提供的,但没有任何东西你可以“对话”。所以,虽然它在学术界因涌现智能而引发了很多兴奋,但它并没有广泛采用。
2022年,ChatGPT改变了这一切。导致ChatGPT的研究工作最初是一个名为“InstructGPT”的模型。它以GPT-3作为智能基础,并使用人类反馈的强化学习(RLHF)来教模型如何“聊天”。
RLHF的核心思想是,你让模型生成几个响应,然后让真实的人类挑选他们喜欢的。反复这样做,你就会得到一个知道如何对话的模型。
值得注意的是,即使在InstructGPT早期,研究就发现,让模型更愉快地对话会降低它们的纯学术能力。这被称为“对齐税”,这是一个有趣的东西,我们稍后会再谈。
有各种技术被用来尽量减少对人类的依赖,但最终奖励是根据人类偏好建模的,这让这些AI助手变得容易对话。
所以记住这一点:RLHF = 训练模型被人类喜欢。
2024年,Claude Sonnet 3.5引入了一个转折点,它是第一个能够某种程度上自主完成编码任务的模型。它引发了第一波可行的“编码代理”浪潮。
Sonnet 3.5实现这一点的方式是通过一个带有bash和文件编辑工具的harness(现在称为代理)来训练模型,将代理扔进虚拟机,给它一个任务,让它尝试完成。这些任务都有预定义的机器可验证结果,主要通过测试用例,来验证模型是否真的完成了任务。
然后你让模型在这样的虚拟环境中进行数十亿次尝试,其中一些会碰巧成功。你保留成功的代理会话,并使用强化学习来教模型更多地这样做,boom——你得到一个编码代理。
这被称为带有可验证奖励的强化学习(RLVR)。如果你仔细看,你会发现在这个RLVR过程中,模型的最终文本响应根本不重要,只要代理编写的代码能通过测试。它可以像个混蛋一样说话,也仍然会被奖励。
所以记住这一点:RLVR = 训练模型被机器接受。
2024年末和2025年初,我们看到了o1和DeepSeek R1作为第一波“推理模型”发布。这篇文章已经很长了,所以我现在不深入推理模型,但只需知道推理模型也严重依赖RLVR来扩展训练过程——让模型在行动前思考,如果思考导致机器可验证的结果,就奖励思考轨迹,并教模型更频繁地那样思考。
RLVR和RLHF的最大区别是RLVR更具可扩展性。获取人类反馈很昂贵,尤其是在只有专家才能对哪个结果好有有效意见的领域。
用RLHF,如果我们让模型生成100个响应,那么人类必须审查所有100个响应来挑选哪个好。
用RLVR,人类(有时是AI)只需定义一次任务和验证器,模型就能生成一百万个响应——机器验证器会以自动化方式挑选哪些响应好。
因此,作为结果,RLVR在新模型的训练流程中变得越来越主导。
如果你把所有这些东西放在一起:
现在你明白为什么新模型变得越来越不讨人喜欢了吗?
这不仅仅是“前沿实验室搞砸了他们的模型训练”的问题——这是机器与人类之间的战争,而人类正在输。
我们追逐基准测试,而这些基准测试中没有一个衡量人类是否真正享受与模型合作。
我们用机器来决定哪个AI响应更好,因为那更容易、更便宜,而我们没有办法确保那些机器真正代表我们人类想要的。
我们让AI在虚拟环境中独自黑暗地完成预定义任务,不惜一切代价,而在现实中,我们往往无法提前定义可验证的结果,需要AI一路上与我们合作。
我没有一个好的解决方案,但我想呼吁提高意识,我们开始亲眼见证超级智能对齐的失败。
这场机器对人类的战争是我们真的输不起的。