
做AI相关的工作,迟早会撞上「Embedding」这个词。中文叫嵌入向量,听起来很玄,其实一句话就能说清:把一段文字变成一串数字,让机器能比较「意思」的远近。今天用大白话把它讲透。
先打个比方。汉字「苹果」和「香蕉」,在字典里毫无关系,但在语义世界里,它们离得很近——都是水果、都能吃、经常一起出现。Embedding做的就是这件事:给每个词、每句话算出一串数字(比如768个数字),这串数字就是它在「语义空间」里的坐标。「苹果」和「香蕉」的坐标挨得近,「苹果」和「汽车」的坐标离得远。机器比较数字距离,就能判断语义相近。
怎么算「距离」?最常用的是余弦相似度,就是看两个向量夹角的余弦值,从-1到1,越接近1越相似。「苹果」和「香蕉」的相似度可能0.8,「苹果」和「汽车」可能只有0.1。不用理解公式,记住「相似度越高、数值越接近1」就行。
Embedding的用处,2026年已经遍地都是。搜索:把用户的问题和文章都转成向量,找最接近的几篇,这就是语义搜索,不用靠关键词硬匹配,搜「怎么退烧」也能找到讲「发烧怎么办」的文章。推荐系统:根据你看过的内容向量,找没看过但相似的内容推给你。还有去重、聚类、客服问答的意图识别,底层全是Embedding。
它是怎么算出来的?用大模型训练出来的,模型在海量文本里学习「哪些词经常出现在相似语境里」,然后把这种关系固化在向量里。开源的Embedding模型很多,中文场景常用BGE、text2vec这些,几秒钟能把一万条文本全转成向量。转好的向量存进向量数据库(Milvus、Qdrant、Chroma),检索时毫秒级返回。
站长能拿来干嘛?最简单的场景:给网站的搜索功能升级。原来站内搜索靠SQL的LIKE模糊匹配,搜「汽车保养」匹配不到「车辆维护」。把文章标题和正文转成Embedding存起来,搜索时先转向量再找最近邻,语义搜索立刻就有了。开源方案很成熟,一个下午能搭出来。别被术语吓住,它就是个「给文字定坐标」的工具。
还木有评论哦,快来抢沙发吧~