AI应用难度 ★★★★★
AI对齐
确保AI"能干"的同时"不干坏事"——能力越强越需要安全约束
分享:
📖 详细解释
🎯 一句话定义
确保AI"能干"的同时"不干坏事"——能力越强越需要安全约束
⚙️ 工作原理
RLHF(人类反馈强化学习):人类对AI输出打分,AI学习偏好。Constitutional AI:AI用规则自我纠正
💡 生活类比
"给超级智能的孩子设定价值观——不能只教他怎么做事,还要教他什么该做什么不该做"
🌍 真实应用
ChatGPT拒绝生成有害内容、自动驾驶在碰撞不可避免时选择伤害最小的方案