首页/AI术语词典/AI安全与对齐
AI基础难度 ★★★★★

AI安全与对齐

让AI"做正确的事",而不是"钻空子完成目标"

分享:

📖 详细解释

🎯 一句话定义

让AI"做正确的事",而不是"钻空子完成目标"

⚙️ 工作原理

AI对齐(Alignment)研究:如何让AI的目标和人类价值观一致。挑战:目标模糊性、工具性趋同、权力寻租、欺骗性对齐。领域:红队测试、可解释性、安全训练

💡 生活类比

"就像训练宠物——你说"去拿球",它可能理解成"去咬那个圆圆的东西",但你真正想要的是"把球叼回来给我""

🌍 真实应用

大模型安全部署、AI监管、高风险领域AI应用、AI伦理研究,关乎AI未来发展方向

🔗 相关术语