首页 / RLHF(人类反馈强化学习)
👍 RLHF(人类反馈强化学习) 是什么?
让AI通过点赞和踩来学习,像训练小狗
⚡ 一句话秒懂
让AI通过点赞和踩来学习,像训练小狗
📖 举个故事
训练AI像训练一只聪明的小狗。训练师(人类)先让AI回答问题,然后给反馈:这个回答好(点赞),那个回答有偏见(踩)。AI通过学习哪些回答被点赞、哪些被踩,慢慢调整自己的行为。几千次反馈后,AI学会了:要有礼貌、不要歧视、回答要准确、不确定时要说「不知道」。RLHF就是通过人类打分来教AI做人的方法。
💡 类比理解
暂未补充。
🧩 真实例子
暂未补充。
🛠️ 怎么实际使用
RLHF的效果你在日常使用中就能感受到。ChatGPT之所以比早期AI更「懂事」、更少输出有害内容,就是因为经过了RLHF训练。如果你自己在做AI产品,可以收集用户反馈(点赞/踩按钮),积累到一定量后用RLHF优化模型。注意:反馈质量很重要,标注员需要经过培训,确保评判标准一致。
📚 进阶原理
RLHF(Reinforcement Learning from Human Feedback)分三步:①用人类标注的偏好数据训练奖励模型(Reward Model),让它学会评分;②用奖励模型给策略模型(Policy Model)的生成结果打分;③用PPO(Proximal Policy Optimization)算法优化策略模型,使奖励最大化。DPO(Direct Preference Optimization)是简化替代方案,不需要独立奖励模型。