RLHF人类反馈强化学习——AI模型为什么越来越「听话」了

王尘宇 AI百科 1

ChatGPT刚出来的时候,经常给你编造事实、生成有害内容、答非所问。现在的模型明显「听话」多了,问什么答什么,不该说的不说。这个变化背后最关键的技术就是RLHF——基于人类反馈的强化学习。

先说RLHF之前的模型是什么状态。GPT-3这样的基础模型(Base Model),训练目标只有一个:预测下一个词。它读了互联网上的大量文本,学会了「什么样的文字接在什么样的文字后面」。但问题是,互联网上什么内容都有——有高质量的维基百科,也有胡说八道的论坛帖子。基础模型把这些全学了,所以它既能写出好文章,也能一本正经地胡说八道。

RLHF的作用就是教模型「什么该说,什么不该说,怎么说更好」。整个过程分三步。

第一步,收集人类偏好数据。给模型同一个问题,让它生成多个回答,然后请人类标注员对这些回答排序。比如问「如何做红烧肉」,模型生成了三个回答:A是正确的菜谱,B是乱编的步骤,C是正确的但写得很啰嗦。标注员会排成A > C > B。这样的排序数据收集几万到几十万条,就构成了训练材料。

第二步,训练奖励模型(Reward Model)。用第一步收集的排序数据,训练一个独立的模型来判断「回答好不好」。这个奖励模型学会了人类的偏好——什么样的回答人类会觉得好,什么样的会觉得差。它不需要知道正确答案是什么,只需要学会给回答打分。

第三步,用强化学习优化生成模型。让原始模型生成回答,奖励模型给分,然后用PPO(近端策略优化)算法调整原始模型的参数,让它倾向于生成高分回答。这个过程反复迭代,模型就会越来越符合人类偏好。

RLHF解决了什么问题?主要三个:减少幻觉(模型不太敢编造不确定的信息)、减少有害输出(模型学会了拒绝不当请求)、提升有用性(回答更直接、更切题)。但RLHF也有副作用——过度优化会让模型变得「太安全」,什么问题都给一堆免责声明,有用信息反而变少了。这就是所谓的「过度对齐」问题。

2026年的新进展是DPO(Direct Preference Optimization)正在取代传统的RLHF三步流程。DPO不需要单独训练奖励模型,直接用偏好数据优化生成模型,训练效率更高,效果也不差。LLaMA 3、Qwen2.5等开源模型已经广泛使用DPO了。

对普通用户来说,RLHF的意义很简单:你和AI对话时感受到的「它懂我在说什么」「它不会乱来」,很大程度上就是RLHF的功劳。没有RLHF的模型就像一个知识渊博但毫无社交能力的人——什么都知道,但说话不过脑子。

标签: RLHF 强化学习 AI训练 大模型

发布评论 0条评论)

  • Refresh code

还木有评论哦,快来抢沙发吧~