NLP与大模型难度 ★★★★★
MoE混合专家
不养一个全才,养一群专才——每次只激活最合适的几个"专家"
分享:
📖 详细解释
🎯 一句话定义
不养一个全才,养一群专才——每次只激活最合适的几个"专家"
⚙️ 工作原理
N个专家网络+一个路由器(Gate)。每个输入只激活Top-K个专家,总参数量大但计算量不变
💡 生活类比
"医院不只有一个全科医生,而是有骨科、心内科、眼科等专家。MoE让每个token只找最合适的"专家"处理"
🌍 真实应用
DeepSeek V3用MoE实现6710亿参数但只激活370亿,Mixtral 8x7B也是MoE架构