强化学习难度 ★★★★☆
Q-Learning
建立一张"状态-动作价值表",记录在每个情况下做什么最好
分享:
📖 详细解释
🎯 一句话定义
建立一张"状态-动作价值表",记录在每个情况下做什么最好
⚙️ 工作原理
Q(s,a)←Q(s,a)+α[r+γmax Q(s',a')-Q(s,a)]。ε-greedy策略:以ε概率随机探索,1-ε概率选最优
💡 生活类比
"像旅行攻略:每个城市(状态)记录各个景点(动作)的评分,根据攻略选择去哪里"
🌍 真实应用
推荐系统中的A/B测试策略优化、游戏AI、资源调度