AI入门25|Embedding是什么?为什么AI能找到“意思相近”的内容?
讲知识库和 RAG 时,经常会遇到一个词:
Embedding。
中文一般叫:
嵌入,或者向量嵌入。
这个词听起来很数学,但普通用户不需要理解公式。
只要先记住一句话:
Embedding 是把文字、图片等内容转换成一组数字表示,让计算机可以比较它们在“语义上有多接近”。
一、传统搜索主要看“字面上像不像”
比如你在资料库里搜索:
“解除劳动合同”。
传统关键词搜索往往优先寻找真的出现了“解除劳动合同”这几个字的文件。
但现实中,同一个意思可能有很多不同说法:
辞退员工;
终止劳动关系;
解除劳动关系;
不胜任解除。
如果只按字面匹配,就可能漏掉很多真正相关的材料。
二、Embedding试图比较“意思像不像”
Embedding 的做法,可以粗略理解为:
先把一段文字转换成一串数字。
这串数字不是文章编号,也不是简单的字符编码。
它会尽量保留内容的某些语义特征。
于是:
意思接近的内容,数字表示也会更接近;
意思差得很远的内容,距离往往也更远。
因此系统可以搜索:
“哪些内容和这个问题在语义上最相似?”
而不只是:
“哪些文件出现了同样的关键词?”
三、什么是“向量”?
你会经常看到另一个词:
Vector,向量。
对于AI入门来说,不需要研究数学定义。
可以把它理解成:
一组用来表示某段内容特征的数字坐标。
比如一段话经过 Embedding 模型处理后,可能变成几百甚至几千个数字。
系统再通过这些数字计算不同内容之间的相似程度。
所以“向量搜索”本质上就是:
根据这些数字表示寻找语义上更接近的内容。
四、这和AI知识库有什么关系?
关系非常大。
假设知识库里有一万份文件。
用户问:
“IPO里劳务派遣超过法定比例通常怎么整改?”
系统不可能每次都把一万份文件交给大模型阅读。
一种常见做法是:
先把知识库中的内容提前做 Embedding;
用户的问题也做 Embedding;
比较两边的向量;
找到语义最接近的几个片段;
再把这些片段交给大模型分析。
所以 Embedding 常常是知识库“找资料”能力背后的基础之一。
五、Embedding不是大模型本身的“记忆”
这一点也容易混淆。
把一批文档做成 Embedding,并不代表:
大模型已经把这些文档训练进去了。
更像是:
系统为这些资料建立了一套方便检索的“语义坐标”。
需要的时候再找出来。
所以:
Embedding 是检索技术。
不是模型训练。
六、Embedding也不会自动理解一切
语义检索很有用,但并不是百分之百准确。
比如专业法律资料里:
两个条款文字很像,但法律效果完全不同;
同一个词在不同监管场景含义不同;
旧法规和新法规语义高度相似,却不能混用。
这时候单靠“相似度”就不够。
还需要结合:
关键词;
标签;
时间;
来源;
效力状态;
其他结构化条件。
因此真正好的检索系统通常不是只靠一种方法。
七、Embedding为什么值得普通用户了解?
因为它解释了一个很常见的现象:
为什么今天的知识库可以在你没有输入完全相同关键词的情况下,仍然找到“意思差不多”的资料。
也解释了为什么知识库有时候会找错:
系统认为两段内容“很像”,但在你的专业语境里其实并不等价。
八、这一篇只需要记住两句话
第一:
Embedding把内容转换成可以比较语义相似度的数字表示。
第二:
它让AI知识库可以从“关键词搜索”进一步走向“按意思搜索”。
下一篇就可以继续讲它最常见的应用之一:
RAG。
也就是为什么很多AI在回答问题之前,会先从知识库里找资料,再生成答案。
