
最近看AI新闻,MoE这个词出现频率越来越高。DeepSeek用了MoE,Grok用了MoE,传闻GPT-5也是MoE。到底什么是MoE,为什么突然人人都在用?
MoE全称Mixture of Experts,翻译过来叫"混合专家模型"。核心思路其实很简单:不是让一个大脑干所有的事,而是搞一堆专家,每次只叫几个来干活。
先说传统模型怎么干活
普通的Transformer模型,比如你给它一句话让它翻译,它内部所有的参数都会参与计算。一个700亿参数的模型,翻译一个句子也要动用全部700亿参数。这就像你问一个厨师红烧肉怎么做,整个厨房50个人都放下手里的活来回答你一个问题。效率很低。
MoE的做法
MoE把模型分成很多个"专家"(Expert),每个专家其实就是一个小型神经网络。前面加一个"路由器"(Router),也叫门控网络,它的作用是:看一眼输入,然后决定这次该叫哪几个专家来处理。
比如一个MoE模型有8个专家,每次只激活2个。那计算量就只有传统模型的四分之一左右。但因为专家分工明确,效果反而可能更好。
打个比方:医院分科室,你肚子疼不用先看眼科再看耳鼻喉,直接挂消化科就行。MoE也是这个逻辑——不同类型的输入交给不同的专家处理。
为什么现在才火
MoE不是新概念,1991年就有人提了。但最近火起来有几个原因:
一是模型越来越大。训练一个万亿参数的密集模型,成本高到离谱。MoE可以用相对少的计算资源训出更大的模型——比如总参数1万亿,但每次推理只用1000亿,成本可控。
二是DeepSeek把MoE的工程实践公开了。他们的MoE设计让很多人发现,原来开源模型也能做到这个水平。
三是推理成本的压力。做AI产品最头疼的就是推理费用。MoE每次只激活部分参数,直接省了大半的计算费用。对做API服务的公司来说,这意味着能多扛几倍的用户量。
MoE的坑
说好处多,坑也不少。
第一个问题是负载均衡。如果路由器总是把任务分给同一个专家,其他专家就闲着。相当于公司里一个能干的人累死,其他人摸鱼。需要额外的机制来保证任务均匀分配。
第二个问题是训练不稳定。路由器本身也要学习,但它的训练信号比较弱,容易出现突然"偏科"的情况。
第三个问题是显存。虽然计算量小了,但所有专家的参数都得放在显存里。一个MoE模型总参数1万亿,显存占用跟1万亿的密集模型差不多。省的是计算,没省存储。
总结
MoE本质上是用"按需调用"来解决大模型的成本问题。不是所有场景都需要全部参数参与,那就不让它们参与。这个思路在工程上很自然,但要真正做好,路由器设计、专家分工、负载均衡,每个环节都得花心思。
接下来一两年,密集模型和MoE模型会共存。简单任务用密集模型够了,复杂场景MoE更划算。作为普通用户,不用太关心底层架构,但了解一下能帮你判断——为什么有的模型又快又便宜,有的又慢又贵。
还木有评论哦,快来抢沙发吧~