强化学习
不给标准答案,让AI自己尝试,做对了奖励做错了惩罚,慢慢学会最优策略
🧩 这是什么?
不给标准答案,让AI自己尝试,做对了奖励做错了惩罚,慢慢学会最优策略
🌍 生活中的类比
训练小狗:做对了给零食(奖励),做错了不理它(惩罚)。反复多次后狗就学会了坐下、握手
📱 现实中的应用
AlphaGo下围棋、机器人学习行走、自动驾驶决策系统
不给标准答案,让AI自己尝试,做对了奖励做错了惩罚,慢慢学会最优策略
不给标准答案,让AI自己尝试,做对了奖励做错了惩罚,慢慢学会最优策略
训练小狗:做对了给零食(奖励),做错了不理它(惩罚)。反复多次后狗就学会了坐下、握手
AlphaGo下围棋、机器人学习行走、自动驾驶决策系统