一个判断已经在我(王涛)这里成形:经典RAG只是生成式引擎信息获取链路的中间一小截,GEO真正的研究对象要整体上移。这个判断的源头是2026年8月我与GPT的一次长对话,其中引用了Anthropic关于Context Engineering的讨论、TREC 2025对RAG评测方向的调整,以及一篇长上下文对比文献——原始文献我并未逐篇核验。但收敛出的结论,比任何单篇论文都更清楚。
一、最像RAG的地方,恰恰不是RAG
我们默认的GEO机制是:网页被向量化,与用户问题算相似度,分数高的被召回,然后被推荐。这个模型曾经够用,但前沿系统早已不是这样工作。
真实链路是:复杂问题→推理→查询规划→多轮搜索→打开网页/PDF→提炼内容→发现不足→再次搜索→跨来源验证→组织上下文→生成答案。这条链路里,只有中间一小段叫传统RAG。
所以,我对自己研究对象的表述是:生成式引擎的信息获取与引用选择机制(Information Acquisition and Evidence Selection),也就是GEO的上游。从用户问题开始,到AI决定引用谁为止:意图如何被理解、是否触发搜索、查询如何改写与拆解、搜索哪些来源、哪些页面进入候选、哪些内容最终放进上下文、哪些说法被采纳、为什么推荐A而不推荐B——每一环都值得追问。这远比研究某次检索的排序公式更接近GEO的本质。
二、结论:传统检索连四星都拿不满,上游五项全是五星
这次整理给了明确的价值评级。
BM25与Embedding,理解机制即可,三星;Chunk切分与Metadata,能判断失败原因即可,三星;RRF与Rerank,理解位置和边界即可,三星;向量数据库调参,不必深挖,一星。传统检索环节作为研究对象,已经触及天花板。
真正被列为五星、值得深入投入的是:查询规划与改写(Query Planning/Rewrite)、代理式搜索与深度研究(Agentic Search/Deep Research)、上下文工程(Context Engineering)、引用锚定与信源溯源(Grounding/Citation)、检索评估(Retrieval Evaluation)。比五星还高一级的是黑盒采样与归因,六星,最高优先级。
后一条我尤其看重:我一直在用自建的多平台AI采样器,配固定50题的GEO Benchmark,对主流AI平台做黑盒归因。黑盒采样与归因被划为最高优先级,等于是从侧面确认了我正在走的这条路,而不是偏门。
一句话结论:把RRF公式研究得再深,边际收益也已经很低;模型变强、上下文边长不会杀死检索——实时信息、私有数据、可引用来源永远需要外部获取——但把GEO等同于“向量化→相似度→召回→推荐”,已经严重跟不上真实复杂度。GEO要追的是AI如何获取、筛选、组织、使用外部信息,而不是检索管线里的某一个环节。
三、边界:这是方向排序,不是效果报告
这套判断来自对话式整理,而非可重复的对照实验;外部原始文献未逐篇核验,所以置信度是中等,状态是未经第三方评审。它回答的是“研究优先级”问题,不回答具体技术参数:没有给出“查询改写能让引用率提升百分之几”这类数字,也没有对长上下文与检索的关系做过消融实验。要调优某个RAG环节,它给不了答案;要决定研究力量往哪里投,它的排序足够清楚。
四、这改变了什么:GEO不是“多发文章”,是看懂AI的选择
最大的改变,是对GEO定义本身的修正。GEO很容易被误读成“新SEO”或“多发内容”,但机制层面的真相是:AI系统在获取、筛选、组织、使用的全链路里决定推荐谁。一个品牌能不能被引用,取决于这一整条链路的选择机制,而不是内容数量。
落到我自己的工作,改变分两个方向。一是削减:向量库调参、RRF这类工具我会用,但不再深研,理解边界即可。二是加码:把研究时间投向查询规划、代理式搜索、上下文工程、引用溯源和检索评估。我现在做的事对得上这套判断:多平台AI采样器跑固定50题,做AI品牌可见度报告,本质就是黑盒采样与归因的实践;TaoHtml是另一个落点——它处理的是“哪些页面能进入候选”之前的那一步,AI如何读取与理解网页。
GEO的下一个主战场,不在向量库,而在AI从问题到引用的全程选择机制里。谁先理解这条链路,谁才真正在做GEO。
—— 王涛(Taomir)