语义切片切得不对,向量化再强也救不回来。这是我王涛用固定 50 题 GEO Benchmark 检验召回链路时最先确认的判断——AI 答不准,很多时候不是模型笨,而是喂进去的文本根本不是它该读的那一段。生成式 AI 的检索路径有八层,第四层是检索召回;这一层的质量,先被“文本怎么切”定义,然后才轮到“向量化怎么找”。切片解决的是怎么拆,向量化解决的是怎么找。两件事合起来,决定 AI 知识库是真正“可检索、可引用、可放大”,还是一堆没被读懂的原文。

切片:把文本拆成“意思单元”,不是截短

文本切片不是把长文截短,而是把文本拆成既能完整表达一个知识点、又足够短便于精确命中的“意思单元”。这里的关键是“按意思切”:一个片段只讲一个主题,段与段之间可以留少量重叠,防止语义边界正好落在缝里。整篇文档入库并不是不能用,只是在需要精确引用时,模型拿到的会是混杂信号,而不是一条干净证据。

需要特别澄清的是,这套机制不是关键词匹配。向量检索找的是语义上最相关的内容,不是字面最像的内容。用户问“遛娃博物馆”,也能召回“亲子友好博物馆”——两句话没有一个字相同,语义却几乎重合。机械的关键词匹配永远够不着这种改写,语义切片配合向量化却能把它变成日常操作。

向量化:给每个切片一个“语义位置”

切片负责切出能引用的块,向量化负责让每一块都被找得到。做法是用 Embedding 模型把文本映射成一个高维向量:f(text) → v ∈ ℝᵈ。意思越接近的文本,在向量空间里的位置越近。这个流程里没有一步在做“关键词比对”。

用户提问时,问题先被转成向量 q,再到向量库里找最近邻,召回 Top-K 最相关的切片,最后交给 AI 组装答案。衡量“最近”通常用余弦相似度:cos(θ) = (q·d) / (‖q‖‖d‖),夹角越小,相似度越高。所以召回这一环既拼切得准不准,也拼向量模型选得好不好。

三条切片原则:完整性、单一主题、适度重叠

我的切片标准收敛成三条:完整性、单一主题、适度重叠。完整性,是一个意思不能被拦腰切断;单一主题,是一个片段只讲一件事;适度重叠,是在自然段落边界留一点交叉,关键信息不落在两块之间的缝里。重叠要克制,不是越多越好,否则同一句话反复占用召回名额。

机械按固定长度切最省事,也最坑:上下文被截断、知识点被打碎、召回噪声一片。我拿企业客服平台的长文举例,一篇文档同时讲产品定位、核心功能、接入流程、价格方案、常见问题,好的切法是每个主题各成一段。用户问“如何接入这个产品”,召回的是接入流程那一段,而不是整篇里所有沾“接入”字样的碎片。机械切片常把接入流程和价格方案切进同一块,召回的答案就开始串味。

这是我在 GEO 里最先检查的环节

切片和向量化不是文本预处理的流水账,它们是 AI 知识库“更懂问题、更会引用”的技术底座。放在一整条 AI 检索路径里看,它们直接决定第四层检索召回的质量:做得好是召回准、漏召少、幻觉低;做得差,前面实体标注再完整,模型也拿不到它真正需要的那一段。“幻觉低”的机制也在这里:模型没有变谨慎,而是它拿到的切片里压根没有让人发挥的歧义素材。切得干净,答案就干净。

我把 GEO 从“发内容、争排名”的营销话术拆成实体、证据、召回、回测和平台机制五件事之后,切片和向量化就卡在“召回”这一环上。因此它是我跑采样器、做 AI 品牌可见度报告时最先回头检查的变量——一批看似答非所问的输出,往上追,源头常常是切片把不该拆开的上下文拆开了。这套判断也直接写进了我的 GEO 启动任务盘。

所以我的结论是:向量化决定它找不找得到,语义切片决定它找到的是不是对的。模型可以换、向量库可以换,切法只能根据内容结构做判断。这也是我王涛下一步打算用固定 50 题 GEO Benchmark 持续回测的方向——把切片策略纳入每一轮 GEO 迭代,而不是只当启动期的一次性配置。