强化学习难度 ★★★★☆
马尔可夫决策过程
用数学语言描述"智能体在环境中做决策"这件事
分享:
📖 详细解释
🎯 一句话定义
用数学语言描述"智能体在环境中做决策"这件事
⚙️ 工作原理
MDP = (S, A, P, R, γ):状态空间S、动作空间A、状态转移概率P、奖励函数R、折扣因子γ。目标:找到策略π使累计奖励期望最大
💡 生活类比
"下棋就是一个MDP:状态=棋盘局面,动作=走哪步,奖励=赢了+1输了-1,转移=对手回应后的新局面"
🌍 真实应用
所有强化学习问题都可以建模为MDP——从游戏AI到机器人控制到推荐系统