首页/AI术语词典/策略梯度
强化学习难度 ★★★★★

策略梯度

不评估每个动作的价值,而是直接学习"什么情况下该做什么"的策略

分享:

📖 详细解释

🎯 一句话定义

不评估每个动作的价值,而是直接学习"什么情况下该做什么"的策略

⚙️ 工作原理

∇J(θ)=E[∇log π(a|s)·R]。直接优化策略网络的参数,使高回报的动作出现概率增大

💡 生活类比

"Q-Learning是先学"哪个动作好"再做选择;策略梯度是直接学"该怎么选",跳过评估步骤"

🌍 真实应用

机械臂控制、自动驾驶路径规划、ChatGPT的人类反馈对齐(RLHF)

🔗 相关术语