强化学习难度 ★★★★★
DQN
当状态太多表格存不下时,用神经网络来"估算"每个状态-动作的价值
分享:
📖 详细解释
🎯 一句话定义
当状态太多表格存不下时,用神经网络来"估算"每个状态-动作的价值
⚙️ 工作原理
Deep Q-Network:用CNN逼近Q(s,a)。两大创新:经验回放(Experience Replay)打破样本相关性、目标网络(Target Network)稳定训练
💡 生活类比
"Q-Learning是查攻略书(表格),但如果游戏有10^100种局面(如围棋),攻略书写不完。DQN是请一个"老玩家"(神经网络)凭经验估算"
🌍 真实应用
DeepMind 2013年用DQN玩Atari游戏达到人类水平,这是深度学习+强化学习的里程碑