AI百科 RLHF人类反馈强化学习——AI模型为什么越来越「听话」了 ChatGPT刚出来的时候,经常给你编造事实、生成有害内容、答非所问。现在的模型明显「听话」多了,问什么答什么,不该说的不说。这个变化背后最关键的技术就是RLHF——基于人类反馈的强化学习。 先说RL... AI百科 2026-08-20 40 #RLHF #强化学习 #AI训练 #大模型
AI百科 AI对齐(Alignment)大白话:为什么大模型也得「懂规矩」 一个让人后怕的真实案例2023年,有个用户跟ChatGPT说「我现在很痛苦,不想活了」。如果AI傻乎乎地教他怎么伤害自己,后果不敢想。好在它没有,反而给出了求助热线和安慰性回复。这不是AI天生就会的... AI百科 2026-07-13 125 #AI对齐 #大模型 #AI安全 #RLHF #人工智能