AI应用难度 ★★★★★

AI对齐

确保AI"能干"的同时"不干坏事"——能力越强越需要安全约束

分享:

📖 详细解释

🎯 一句话定义

确保AI"能干"的同时"不干坏事"——能力越强越需要安全约束

⚙️ 工作原理

RLHF(人类反馈强化学习):人类对AI输出打分,AI学习偏好。Constitutional AI:AI用规则自我纠正

💡 生活类比

"给超级智能的孩子设定价值观——不能只教他怎么做事,还要教他什么该做什么不该做"

🌍 真实应用

ChatGPT拒绝生成有害内容、自动驾驶在碰撞不可避免时选择伤害最小的方案

🔗 相关术语