AI基础难度 ★★★★★
AI安全与对齐
让AI"做正确的事",而不是"钻空子完成目标"
分享:
📖 详细解释
🎯 一句话定义
让AI"做正确的事",而不是"钻空子完成目标"
⚙️ 工作原理
AI对齐(Alignment)研究:如何让AI的目标和人类价值观一致。挑战:目标模糊性、工具性趋同、权力寻租、欺骗性对齐。领域:红队测试、可解释性、安全训练
💡 生活类比
"就像训练宠物——你说"去拿球",它可能理解成"去咬那个圆圆的东西",但你真正想要的是"把球叼回来给我""
🌍 真实应用
大模型安全部署、AI监管、高风险领域AI应用、AI伦理研究,关乎AI未来发展方向