手机里能跑的大模型,几乎都是蒸馏出来的。今天用大白话把这事讲清楚。
蒸馏的意思很简单:大模型当老师,小模型当学生,学生不从头学,直接学老师给出的答案。老教授带研究生就是这么个逻辑,研究生不用把图书馆的书全背下来,跟着导师做两年项目,学会的是导师的判断力和做事方法。
技术细节也不复杂。大模型输出答案时,每个词后面都跟着一长串概率,比如「西安」后面跟「SEO」的概率是0.6,跟「美食」的概率是0.3。这些概率分布就是软标签,里面藏着大模型对语言的理解。蒸馏时,学生模型不只学那个正确答案(硬标签),而是学整条概率分布,等于把老师的语感也学走了。训练时还会加一个温度参数,把概率分布拉平一点,让那些小的概率值不至于被忽略。
为什么要蒸馏?三个字:跑不动。一个700亿参数的大模型,推理一次要好几张A100,普通公司和个人根本用不起。蒸馏出70亿参数的小模型,显存需求直接降一个数量级,手机、笔记本都能跑,成本低到可以忽略。
2026年最出名的例子是DeepSeek-R1。DeepSeek把R1的推理能力蒸馏到1.5B、7B、32B几个小模型里,32B那个在消费级显卡上就能跑出接近大模型的数学和推理水平,发布当天就被下载疯了。Qwen和Llama也都有官方蒸馏版本,很多手机厂商的端侧模型就是这么来的。
蒸馏不是万能的,有两个限制得知道。第一,学生学不到老师不会的东西,蒸馏模型的天花板就是老师的水平,指望小模型超过老师不现实。第二,老师的毛病会原样传下来,老师爱编数据,学生照样编,幻觉是会被继承的。
所以看模型的时候别只看参数大小。同样是70亿参数,从头训练的跟蒸馏出来的,效果能差出一大截。看发布说明里有没有写distilled from,写了就说明它站在巨人肩膀上。选小模型优先选蒸馏版,同样的钱,效果更好。
还木有评论哦,快来抢沙发吧~