强化学习难度 ★★★★★

RLHF

让人类当"裁判"给AI打分,AI根据分数学习"人类喜欢什么"

分享:

📖 详细解释

🎯 一句话定义

让人类当"裁判"给AI打分,AI根据分数学习"人类喜欢什么"

⚙️ 工作原理

三步:1)监督微调SFT(用人类写的示范训练);2)训练奖励模型RM(学习人类偏好);3)PPO强化学习(用RM当奖励信号优化策略)

💡 生活类比

"AI是学生,人类是老师。老师不直接教知识点(写规则),而是给学生的答案打分(反馈),学生根据分数调整自己的答题风格"

🌍 真实应用

ChatGPT、Claude、GPT-4等对话AI都用RLHF让输出更符合人类偏好——更有帮助、更安全、更自然

🔗 相关术语