很多人把 GEO 当成“新 SEO”,以为多发文章就行。我(王涛)此前不这么看,但我的理解同样不够准确:我把生成式引擎的决策基础理解为经典 RAG——网页被向量化,算相似度,被召回,然后被推荐。2026 年 6 月到 7 月,我建立自己的 GEO 研究知识库,把研究对象拆成实体、出处、召回、回测和平台机制五类,用的就是这套前提。到 2026 年 8 月,我把生成式引擎的信息获取链路完整梳理了一遍,不得不推翻它。
一、经典 RAG 管不到的完整链路
真实链路复杂得多:复杂问题进来,先推理,再做查询规划,多轮搜索,打开网页或 PDF,提取内容,发现信息不足就再搜一次,跨来源验证,组织上下文,最后生成答案。用户只能看到最后生成的答案和它的引用来源,但 GEO 要研究的完整链条是:用户问题如何被理解意图、是否触发搜索、查询如何改写与拆解、搜索哪些来源、哪些页面进入候选、哪些内容最终进入上下文、哪些实体与论断被采用、为什么推荐 A 而不是 B。这里面只有中间一小截叫传统 RAG。真正的研究对象应该表述为:生成式引擎的信息获取与出处选择机制(Information Acquisition & Evidence Selection)。它处在 GEO 的上游。
二、价值评级给出的重心排序
这带来学习重心的重新分配。不再以“RAG Engineer”的方式深挖检索算法,而是转向“大模型信息获取”这一整层:搜索、检索、事实锚定(Grounding)、上下文工程、代理式搜索、评估。我给各主题按 GEO 价值排过优先级:BM25 与嵌入,学到理解机制即可,三颗星;分块与元数据,能判断失败原因即可,三颗星;RRF 与重排,理解位置和边界即可,三颗星;向量数据库调参,一颗星,不必深挖。需要深入研究的是:查询规划与改写、代理式搜索与深度研究、上下文工程、Grounding 与引用、检索评估,都在五颗星。最高档给了黑盒采样与归因,六颗星。这个排序有明确成立条件:目标是理解生成式引擎如何决定推荐谁、引用谁。如果目标变成传统搜索排名,重排和向量库调参的权重会完全不同,这张表不适用。
三、边界的三个提醒
第一,评级表回答的是投入深度,不是效果对比,不能从中推出“上下文工程比嵌入更强”这类结论。第二,这个方向来自 2026 年 8 月的一次系统梳理,参考过 Anthropic 的 Context Engineering 讨论、TREC 2025 的 RAG 评测方向,以及 Stanford 与 Manning 对比长上下文的工作,但这些原始文献我没有逐一核对,只能作为方向性参考。长上下文会改变信息获取方式,这个方向我确定;具体改变了多少、在哪些任务上改变,需要单独验证,这里不做量化断言。第三,整个判断面向生成式引擎的信息获取场景,传统 SEO 场景不适用。
四、这改变了什么:从调参到信息获取设计
这次转向改变的是归因方式。“黑盒采样与归因”在评级表里位于最高档,而我过去几个月在做的,正是多平台 AI 采样器、固定 50 题的 GEO Benchmark 和 AI 品牌可见度报告这些黑盒探测工作。这个结果反过来确认,这些工作本身就是 GEO 研究的主干。以前在项目里遇到“内容被收录,AI 就是不引用”,我会先检查分块合不合理、嵌入要不要换、重排怎么调,全是经典 RAG 中游的动作。现在我会先往上游看:查询是怎么拆解的,页面有没有进入候选,它能不能通过跨来源验证。一次不被引用,常常不是相似度问题,而是链路在某一环断了。做可见度报告时我看到最多的现象正是“进了候选,进不了最终上下文”,单看检索机制解释不了它,必须用全链路视角。TaoHtml 这类网页结构化工具也因此获得新的定位:它服务于内容提取与验证,而不是嵌入前的清理工具。我知识库里那五类模块不用推翻,但关系要从并列改成因果——从用户意图到最终推荐,是一条逐环追踪的链。整个研究任务从“把调参做好”变成了“把信息获取过程设计好”,这是我认为这次转向最核心的产出。
—— 王涛(Taomir)