AI的「训练」和「推理」到底有什么区别?我用做饭打了个比方

王尘宇 AI百科 4

上周一个做市场的朋友问我:「你们说的训练模型,不就是让AI学习吗?那为啥训练完了还要花钱跑推理?」

这个问题其实很多人搞混。我用做饭打了个比方,她马上就懂了。

训练AI就像学做菜。你得买食材(训练数据)、看菜谱(算法)、反复练习(迭代训练)、尝味道调整(调参)。这个过程非常费时费力——GPT-4级别的模型,训练一次的电费大概够一个普通家庭用几百年。具体来说,训练一个千亿参数的大模型,光是GPU集群的电费就要几千万人民币,还不算硬件采购和人力。

推理就是你已经学会做菜了,有人点菜你现做。每次推理只需要跑一次前向计算,消耗的资源比训练小几个数量级。但架不住次数多——ChatGPT每天要响应几亿次请求,推理成本累积起来也相当可观。

打个更具体的比方。训练阶段就像你花三个月工资去新东方学厨师,上了几千节课、切了几百斤土豆、炒了几千盘菜。推理阶段就是你出师后每天在厨房炒菜——炒一盘菜的成本当然比学厨低得多,但一年炒几万盘,加起来也不少。

技术上来说,训练和推理的核心区别在于:训练要反向传播(backpropagation),也就是每算出一个结果,还要倒回去调整模型里的参数。这个过程需要存中间结果,显存占用是推理的好几倍。推理只要前向计算一遍,不需要反向传播,所以快得多、省得多。

一个70B参数的大模型,训练需要几百张A100 GPU跑几周。但推理只需要一张A100或者两张4090就能跑起来。这就是为什么训练只能在大公司做,但推理可以在你自己的电脑上跑——只要你显存够。

现在很多公司在做蒸馏——就是用一个已经训练好的大模型去教一个小模型。小模型继承了大部分能力,但推理成本降到原来的十分之一甚至更低。这也是为什么现在手机上也能跑AI了——不是训练放在手机上,是推理放上去了。

所以总结一下:训练是一次性的重体力活,推理是日常的轻体力活。训练决定了AI的智商上限,推理把智商转化成每次回答。

想自己跑个本地模型玩玩的话,现在门槛已经很低了。Ollama下载一个7B的模型,一张RTX 3060就能流畅推理。但你要想从零训练一个7B的模型——那还是算了吧,先准备个一百万预算。

标签: AI训练 AI推理 大模型 AI科普 机器学习

发布评论 0条评论)

  • Refresh code

还木有评论哦,快来抢沙发吧~