强化学习难度 ★★★★★
策略梯度
不评估每个动作的价值,而是直接学习"什么情况下该做什么"的策略
分享:
📖 详细解释
🎯 一句话定义
不评估每个动作的价值,而是直接学习"什么情况下该做什么"的策略
⚙️ 工作原理
∇J(θ)=E[∇log π(a|s)·R]。直接优化策略网络的参数,使高回报的动作出现概率增大
💡 生活类比
"Q-Learning是先学"哪个动作好"再做选择;策略梯度是直接学"该怎么选",跳过评估步骤"
🌍 真实应用
机械臂控制、自动驾驶路径规划、ChatGPT的人类反馈对齐(RLHF)