
经常有人问我:多模态大模型是啥?跟普通的大模型有啥区别?今天我不甩专业术语,用一个外卖订单把这个概念讲清楚。
先说你手机里现在能用的AI。ChatGPT、Kimi、DeepSeek——如果你只打字提问,那你用的是纯文本大模型。它能读文字、写文字,仅此而已。
但如果你给DeepSeek发一张外卖小票的照片,问它「我这周点了几次奶茶,花了多少钱」,它能识别图片里的文字和数字,给你一个准确的回答——这时候它用的就是多模态能力。
所谓「多模态」,说白了就是AI能同时处理多种类型的信息。
文字是一种模态。图片是第二种。语音是第三种。视频是第四种。甚至传感器数据、3D模型、医疗影像——这些都算不同的模态。
纯文本模型就像一个只能读书的人。多模态模型就像一个能看、能听、能读、能说的人。
那它是怎么做到的?
原理不复杂。以图片为例:多模态模型里有一个叫「视觉编码器」的组件,它把图片切成很多小块,每一块转成一组数字。文字也被转成数字。然后训练的时候,模型学会了在这两种数字之间建立关联——看到猫的图片,对应到「猫」这个词。
训练的数据量非常恐怖。GPT-4V据传用了上亿对图文数据。这也是为什么多模态模型只有大厂和头部创业公司能做——普通团队根本拿不出这么多高质量的多模态数据。
现在有哪些多模态模型可以用?
先说明一点:不是所有叫多模态的都名副其实。有些模型只能图生文(看图说话),但不能文生图(根据文字生成图片)。真正意义上的多模态应该支持输入和输出的多种组合。
目前国内比较能打的有几个:通义千问VL,阿里的,图文理解能力很强,尤其是中文场景——我用来识别合同扫描件里的关键条款,准确率比人工还高一点。DeepSeek-V3支持图文混合输入,上传一张图表它能帮你分析趋势,但输出还是纯文字。智谱GLM-4V在学术基准上表现不错,实际用起来对模糊图片的识别不太稳定。Kimi的多模态主要是文件解析方向,PDF、PPT、Excel这些格式处理得特别好。
有什么用?不是画饼
医疗:把CT片子喂给多模态模型,它能标出疑似病灶区域。不是替代医生,是帮医生快速过片。某三甲医院放射科用这个方案,阅片时间缩短了将近一半。
教育:学生拍一道数学题,模型不光给答案,还能一步步讲解。
电商:用户拍一张穿搭照片,模型识别出衣服款式,在商品库里匹配相似款。淘宝的拍立淘底层就是多模态技术。
局限也很明显
目前的模型对视频的理解还比较弱。一个10分钟的视频喂进去,它最多能记住几个关键帧的内容,做不到真正理解时间线上的因果逻辑。另外幻觉问题在多模态场景下更严重——你给模型看一张模糊的图片,它可能脑补出不存在的内容,这在医疗和法律场景下尤其危险。
总的来说,多模态是大模型的必然方向。纯文本的天花板摆在那里。但要让它真正好用、可靠,还有很长的路要走。
小编点评
我买过十几款手机了,从诺基亚功能机到现在的折叠屏,发现最实用的永远是续航长+系统流畅的那一款,参数都是虚的。
买路由器别光看天线数量,信道质量和芯片方案才是关键,推荐大家多看看真实评测。
有没有哪款软件是你换了无数个最终留下来的?评论区交换一波。
还木有评论哦,快来抢沙发吧~