ChatGPT的火爆让RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)走进了大众视野。简单来说,RLHF就是通过人类的偏好反馈来训练大模型,让模型生成的内容更符合人类的期望。这背后,人类偏好数据的标注质量直接决定了RLHF的效果。
RLHF的三个阶段
**第一阶段:SFT(监督微调)数据标注**。这一步是用高质量的问答对数据来微调基座模型,让模型学会「按照指令回答问题」。SFT数据的核心要求是:回答准确、格式规范、符合人类语言习惯。标注员需要编写或优化问题的参考答案。
**第二阶段:RM(奖励模型)偏好标注**。这是RLHF最核心的标注环节。标注员需要对同一个问题的多个回答(通常2-4个)进行排序,选出最好的、次好的……最差的。这些排序数据用来训练奖励模型(Reward Model),让模型学会「什么是好回答」。
**第三阶段:PPO迭代优化**。用奖励模型作为「裁判」,通过强化学习算法(通常是PPO)来进一步优化生成模型。这一阶段通常还需要持续的人类反馈来验证和调整。
**偏好标注的难点:一致性(IAA)**。偏好标注是主观判断,不同标注员的排序可能差异很大。行业用IAA(Inter-Annotator Agreement,标注者间一致性)来衡量标注质量。一般来说,IAA能达到70%-80%就算不错,超过85%属于优秀。
**提升一致性的关键:清晰的标注规范**。数百页的标注规范是RLHF项目的标配。规范需要明确定义:什么是「好回答」(事实准确、逻辑清晰、安全无害、有帮助)、什么是「坏回答」(幻觉、偏见、违规、答非所问)、以及各种边界情况的处理原则。
**标注员的分层与培训**。RLHF标注对标注员的要求远高于普通图像标注:需要具备良好的语言理解能力、逻辑思维能力,甚至专业领域知识。头部企业通常会对标注员进行多轮培训和考核,只有通过考核的标注员才能进入项目。标注过程中还会持续监控质量,不合格的标注员会被淘汰。
**RLHF的演进方向**。除了经典的RLHF,行业也在探索更高效的对齐方法:RLAIF(用AI反馈代替人类反馈)、DPO(直接偏好优化,跳过奖励模型阶段)、 Constitutional AI(宪法AI,用原则指导模型自我修正)等。但目前来看,高质量的人类偏好数据仍然是大模型对齐的「黄金标准」,短期内无法被完全替代。
