强化学习

不给标准答案,让AI自己尝试,做对了奖励做错了惩罚,慢慢学会最优策略

🧩 这是什么?

不给标准答案,让AI自己尝试,做对了奖励做错了惩罚,慢慢学会最优策略

🌍 生活中的类比

训练小狗:做对了给零食(奖励),做错了不理它(惩罚)。反复多次后狗就学会了坐下、握手

📱 现实中的应用

AlphaGo下围棋、机器人学习行走、自动驾驶决策系统