
在第15回中,我们介绍了AI处理文本时使用的基本单位“Token(标记)”。第8回则讲解了RAG技术,即从公司内部资料中检索与问题相关的信息,并将其传递给AI进行回答的机制。
那么,AI是如何判断“汽车”和“车”具有相似含义,或者在RAG中找到与问题语义接近的资料呢?
其中一个关键技术就是“嵌入(Embedding)”。
将词语和文本转换为“数值序列”
嵌入技术是将词语、文本、图片等特征转换为计算机可以计算的“向量”——一串数值。
仅仅给词语分配ID编号,无法体现“汽车”和“车”含义相近,“狗”和“猫”概念接近的关系。
嵌入通过数值化,使得语义和特征相似的词语或文本在向量空间中彼此靠近。
大型语言模型(LLM)内部会将输入的Token转换为向量进行处理;而RAG等检索系统则使用专门的嵌入模型,将问题和文档片段转换为向量。
虽然两者都基于“用数值表示信息”的理念,但LLM内部的Token向量与RAG检索用的文档向量不一定相同。
类比为“语义世界的地址”
可以把嵌入理解为确定“语义世界的地址”。
就像地图上东京和横滨距离较近,东京和伦敦距离较远一样,嵌入将词语或文本表示为数百到数千维的向量(如768维、1536维、3072维等),在这个多维空间中,语义相近的词语或文本距离更近。
例如,“狗”和“猫”向量距离较近,而“狗”和“财务报表”距离较远。
通过这种坐标化,计算机可以通过向量间的距离和方向判断“文字不同但内容相近”。
支撑RAG和“基于语义的搜索”
嵌入技术在第8回介绍的RAG和语义搜索中发挥着重要作用。
传统关键词搜索主要匹配输入词汇的文字,若提问和文档用词不同,可能难以找到目标信息。
使用嵌入后,例如“因身体不适想请假”这一问题和“病假申请流程”这份公司内部文档,虽然文字不同,但转换为向量后语义接近,便能更容易检索到相关资料。
RAG会先将公司内部文档分割成合适大小,进行嵌入并存入向量数据库。提问时,同样将问题向量化,检索距离最近的文档向量,再传递给LLM生成回答。
此外,有些模型支持将文本与图片等不同类型数据关联的嵌入,也被用于图像搜索等场景。
嵌入技术虽是生成式AI背后不易察觉的“幕后功臣”,但它通过将语言和文本转化为可比较的数值表达,使得基于“语义相似度”的信息检索成为可能。
在RAG等AI搜索应用中,选择合适的嵌入模型直接影响搜索精度和最终传递给AI的信息质量。



