Skip to content
查看 GitHub 源文件

源文件:https://github.com/lennonli/licheng-AI-tutorials/blob/main/docs/ai-basics-25-embedding-ABL-20260831-V1.md

AI入门25|Embedding是什么?为什么AI能找到“意思相近”的内容?

讲知识库和 RAG 时,经常会遇到一个词:

Embedding。

中文一般叫:

嵌入,或者向量嵌入。

这个词听起来很数学,但普通用户不需要理解公式。

只要先记住一句话:

Embedding 是把文字、图片等内容转换成一组数字表示,让计算机可以比较它们在“语义上有多接近”。

一、传统搜索主要看“字面上像不像”

比如你在资料库里搜索:

“解除劳动合同”。

传统关键词搜索往往优先寻找真的出现了“解除劳动合同”这几个字的文件。

但现实中,同一个意思可能有很多不同说法:

辞退员工;

终止劳动关系;

解除劳动关系;

不胜任解除。

如果只按字面匹配,就可能漏掉很多真正相关的材料。

二、Embedding试图比较“意思像不像”

Embedding 的做法,可以粗略理解为:

先把一段文字转换成一串数字。

这串数字不是文章编号,也不是简单的字符编码。

它会尽量保留内容的某些语义特征。

于是:

意思接近的内容,数字表示也会更接近;

意思差得很远的内容,距离往往也更远。

因此系统可以搜索:

“哪些内容和这个问题在语义上最相似?”

而不只是:

“哪些文件出现了同样的关键词?”

三、什么是“向量”?

你会经常看到另一个词:

Vector,向量。

对于AI入门来说,不需要研究数学定义。

可以把它理解成:

一组用来表示某段内容特征的数字坐标。

比如一段话经过 Embedding 模型处理后,可能变成几百甚至几千个数字。

系统再通过这些数字计算不同内容之间的相似程度。

所以“向量搜索”本质上就是:

根据这些数字表示寻找语义上更接近的内容。

四、这和AI知识库有什么关系?

关系非常大。

假设知识库里有一万份文件。

用户问:

“IPO里劳务派遣超过法定比例通常怎么整改?”

系统不可能每次都把一万份文件交给大模型阅读。

一种常见做法是:

先把知识库中的内容提前做 Embedding;

用户的问题也做 Embedding;

比较两边的向量;

找到语义最接近的几个片段;

再把这些片段交给大模型分析。

所以 Embedding 常常是知识库“找资料”能力背后的基础之一。

五、Embedding不是大模型本身的“记忆”

这一点也容易混淆。

把一批文档做成 Embedding,并不代表:

大模型已经把这些文档训练进去了。

更像是:

系统为这些资料建立了一套方便检索的“语义坐标”。

需要的时候再找出来。

所以:

Embedding 是检索技术。

不是模型训练。

六、Embedding也不会自动理解一切

语义检索很有用,但并不是百分之百准确。

比如专业法律资料里:

两个条款文字很像,但法律效果完全不同;

同一个词在不同监管场景含义不同;

旧法规和新法规语义高度相似,却不能混用。

这时候单靠“相似度”就不够。

还需要结合:

关键词;

标签;

时间;

来源;

效力状态;

其他结构化条件。

因此真正好的检索系统通常不是只靠一种方法。

七、Embedding为什么值得普通用户了解?

因为它解释了一个很常见的现象:

为什么今天的知识库可以在你没有输入完全相同关键词的情况下,仍然找到“意思差不多”的资料。

也解释了为什么知识库有时候会找错:

系统认为两段内容“很像”,但在你的专业语境里其实并不等价。

八、这一篇只需要记住两句话

第一:

Embedding把内容转换成可以比较语义相似度的数字表示。

第二:

它让AI知识库可以从“关键词搜索”进一步走向“按意思搜索”。

下一篇就可以继续讲它最常见的应用之一:

RAG。

也就是为什么很多AI在回答问题之前,会先从知识库里找资料,再生成答案。

内容同步自 GitHub 仓库,仅作为工具教程与工作流说明。

CONTACT

联系李成律师

扫描二维码添加微信,沟通法律 AI、非诉业务及相关合作事项。

手机端可点击二维码查看原图并长按识别。

李成律师微信二维码扫码添加微信