强化学习难度 ★★★★★
RLHF
让人类当"裁判"给AI打分,AI根据分数学习"人类喜欢什么"
分享:
📖 详细解释
🎯 一句话定义
让人类当"裁判"给AI打分,AI根据分数学习"人类喜欢什么"
⚙️ 工作原理
三步:1)监督微调SFT(用人类写的示范训练);2)训练奖励模型RM(学习人类偏好);3)PPO强化学习(用RM当奖励信号优化策略)
💡 生活类比
"AI是学生,人类是老师。老师不直接教知识点(写规则),而是给学生的答案打分(反馈),学生根据分数调整自己的答题风格"
🌍 真实应用
ChatGPT、Claude、GPT-4等对话AI都用RLHF让输出更符合人类偏好——更有帮助、更安全、更自然