强化学习难度 ★★★★☆
奖励函数设计
奖励函数是AI行为的指南针——你奖励什么,AI就优化什么
分享:
📖 详细解释
🎯 一句话定义
奖励函数是AI行为的指南针——你奖励什么,AI就优化什么
⚙️ 工作原理
奖励塑造(Reward Shaping)需要在稀疏奖励(难学但安全)和密集奖励(易学但可能学偏)间平衡
💡 生活类比
"考试只考选择题,学生就不练写作文。奖励函数设计不好,AI可能学到"捷径"而非真正的能力"
🌍 真实应用
ChatGPT的RLHF训练中,人类反馈就是奖励信号,决定了模型的行为风格