——基于 Jev 的 Decision-Layer GEO 探索性研究

Can Decision Models Serve as Proxies for Citation Selection in Generative Search?
An Exploratory Study of Decision-Layer GEO with Jev

摘要

生成式搜索与 AI Agent 的答案生成通常并非直接从全量网页中完成,而可能经历查询理解、候选召回、候选筛选、重排以及最终引用选择等多个阶段。现有 GEO(Generative Engine Optimization)研究通常更关注“页面是否被检索到”以及“最终是否被引用”,对于 Retrieval 与 Citation 之间的中间判别过程仍缺少可观测实验工具。

本文提出 Decision-Layer GEO 的初步研究框架,并使用决策模型 Jev 作为实验代理,探索一个核心问题:在候选网页已经给定的情况下,Jev 对网页的语义评分与真实生成式搜索答案中的 Citation 选择是否存在稳定一致性。

实验使用 19 个历史豆包 Query/run 对,其中包含 14 个正式 Observation-linked runs 和 5 个原始 SamplingRuns,共得到 319 个历史 Citation URL 标签。公开搜索侧采集了 168 条 Google 与 188 条 Bing organic results;构造 Track B 后共有 670 个 Query×URL 决策候选、431 个全局唯一 URL。但由于页面正文获取不完整,最终仅有 346 个候选能够进入 Jev 内容评分,其中 198 个为历史被引用页面、148 个为未引用页面。

在该可评分子集中,Jev 的 Hit@1 为 0.4737,Recall@3 为 0.1743,Recall@5 为 0.3079,MRR 为 0.6711,nDCG 为 0.8012。与保持各 Query 候选数量和 Citation 标签比例不变的随机排序期望相比,Jev 在 Hit@1、MRR 和 nDCG 上低于随机基线,Recall@3 基本持平,仅 Recall@5 略高。Query 宏平均 citation_suitability AUC 为 0.534,尚未表现出稳定的 Citation 排序优势。

与此同时,被引用页面在 citation_suitability、entity_match 与 query_relevance 等 Jev 特征上表现出一定的平均正差异,提示 Decision Model 可能更适合作为 Citation 特征分析工具,而非直接作为完整 Citation Reranker。

由于 670 个 Track B 决策中仍有 324 个缺少正文,包括 121 个真实 Citation 决策,本文只能被视为探索性 Pilot,而不能据此接受或否定完整的 Decision-Layer Proxy 假设。

关键词: GEO;Generative Search;Decision Model;Jev;Citation Selection;Reranking;AI Search;Decision-Layer GEO


Research Status

Working Paper v0.1
Status: Exploratory Pilot
Experiment: Decision-Layer GEO Experiment — content-available pilot-v1
Dataset: 19 historical Query/run pairs; 319 historical Citation URL labels; 346 content-available Jev decisions
Key limitation: 324 / 670 Track B decisions lacked page body text. The complete Track B hypothesis therefore remains untested.


1. 引言

生成式搜索系统正在改变传统搜索中“检索结果页即终点”的信息消费模式。

在经典搜索场景中,可以将用户行为粗略抽象为:

Query
→ Retrieval
→ Ranking
→ SERP
→ User Click

而在生成式搜索、AI Search 或 Agent 场景中,更合理的抽象可能是:

Query
→ Query Interpretation
→ Retrieval
→ Candidate Selection
→ Reranking / Decision
→ Citation Selection
→ Answer Generation

这意味着,一个网页最终没有出现在 AI 答案中,至少可能存在三种不同原因:

没有被召回
≠
被召回但在判别/重排阶段被淘汰
≠
进入候选集但最终没有成为 Citation

这三种状态对应的 GEO 优化问题并不相同。

因此,本文提出一个初步概念:

Decision-Layer GEO:研究生成式搜索在 Retrieval 与最终 Citation 之间,候选页面如何被分类、评分、筛选和重排。

Decision Layer 并不要求真实系统内部必须使用某一种具体模型。

本文亦不主张豆包或其他平台内部正在使用 Jev。

Jev 在本文中只承担一个角色:

Decision-Layer Experimental Proxy。

即利用其对候选页面进行独立、结构化语义判断的能力,模拟一种可能存在于 Retrieval 之后的页面选择机制。


2. 研究问题

本文主要回答三个探索性问题。

RQ1:公开搜索结果能够多大程度覆盖历史 AI Citation?

即:

Google / Bing Top10
        ↓
是否包含
        ↓
历史豆包 Citation URL

这一问题用于区分 Retrieval Gap 与后续 Decision Gap。

RQ2:当真实 Citation 页面已经存在于候选池中时,Jev 能否将其排在更高位置?

即:

Candidate Pages
        ↓
隐藏真实 Citation Label
        ↓
Jev 独立评分
        ↓
Ranking
        ↓
与真实 Citation 对照

这是本文最核心的 Decision-Layer Proxy 检验。

RQ3:真实 Citation 页面与非 Citation 页面,在 Jev 语义特征上是否存在系统性差异?

本文关注:

  • query_relevance
  • direct_answer
  • evidence_strength
  • entity_match
  • specificity
  • citation_suitability

如果某些特征长期稳定区分被引用和未引用页面,即使 Jev 无法直接承担完整 Reranker,也可能成为 GEO 特征研究工具。


3. 实验数据

3.1 历史 AI Query 与 Citation

实验使用 19 个未改写的历史 Query/run 对。

其中:

  • 14 个正式 Observation-linked runs;
  • 5 个 raw SamplingRuns;
  • 共包含 319 个 per-query Citation URL labels。

这里的 Citation label 仅表示:

某历史 AI Answer 引用了该 URL。

它并不意味着:

  • Citation 内容一定正确;
  • 页面一定真正支持答案;
  • 答案本身一定正确。

3.2 公共 SERP

同期公共搜索采集得到:

来源 Organic rows
Google 168
Bing 188
合计 356

其中 Google 前 141 条来自 Grok bot v2,共保存 16 张 PNG 和 16 份 accessibility snapshots;另外 27 条来自登录态 Chrome Extension,因此可能存在地区或个性化上下文差异。


4. Candidate Track 设计

为了区分 Retrieval 与 Decision,本实验构造两个逻辑 Track。

Track A:Retrieval Observation

Google Top10
+
Bing Top10
        ↓
Candidate Pool
        ↓
检查历史 Citation URL 是否出现

Track A 不测试 Jev 的排序能力。

它只回答:

公共搜索候选集合是否已经包含真实历史 Citation。

Track B:Decision-Layer Proxy

Google Top10
+
Bing Top10
+
Actual Citation URLs
        ↓
统一候选池
        ↓
隐藏 Citation Label
        ↓
Jev 独立评分

Track B 共形成:

  • 670 个 Query×URL decisions;
  • 431 个 globally unique URLs。

但仅有 346 个决策取得可用页面正文。

其中:

类型 数量
Cited 198
Non-cited 148
可评分总数 346

另有 324 个决策缺少正文,其中包括 121 个历史 Citation 页面。

因此,没有任何一个 Query 拥有完整正文的 Track B Candidate Pool。

这一缺失是本文最大的实验限制。


5. Jev Decision Contract

Jev 在每个:

Query × Candidate Page

组合上独立判断六项特征:

Feature 含义
query_relevance 页面与 Query 的直接相关程度
direct_answer 是否直接解决用户问题
evidence_strength 是否包含可支撑答案的事实、数据或证据
entity_match 页面实体与 Query 目标是否匹配
specificity 信息是否具体
citation_suitability 是否适合作为 AI Answer 的引用来源

Jev 输入包含:

  • Query;
  • URL;
  • title;
  • description;
  • H1;
  • main text;
  • 可获得的时间信息。

为了避免标签泄漏,Jev 没有看到:

  • 实际 Citation 标签;
  • SERP Rank;
  • 来源属于 Google/Bing/Citation Track 的信息。

长正文最多保留 16,000 characters,该截断影响 346 个请求中的 14 个。


6. 排序与评估方法

Jev 主排序指标为:

citation_suitability

出现同分时依次采用:

evidence_strength
→ query_relevance
→ direct_answer
→ specificity
→ URL

本文计算:

  • Hit@1
  • Recall@3
  • Recall@5
  • MRR
  • nDCG
  • Pairwise AUC

同时建立 matched random-order expectation。

随机基线并不是简单假设每个 Query 都有相同 Citation 比例,而是保留每个 Query 实际:

  • Candidate 数量;
  • Citation 数量。

因此能避免 Track B 中 Citation 页面比例较高造成的假象。


7. Results

7.1 Public SERP 与历史 Citation 的覆盖

公共 SERP 与历史 Citation 进行保守 exact URL overlap 后:

Retrieval source Citation overlap
Google 5 / 319
Bing 0 / 319
Google ∪ Bing 5 / 319
Union coverage 1.57%

并且所有 19 个 Query 均至少存在一个历史 Citation URL 不在当前公共 Google/Bing candidate pool 中。

这一结果不能被解释为:

豆包没有使用搜索引擎。

更准确的解释是:

当前公共 Google/Bing SERP 不能直接作为历史豆包 Retrieval Pool 的可靠代理。

原因包括:

  • 当前 SERP 与历史豆包回答并非同时产生;
  • 搜索地区和个性化上下文可能不同;
  • 豆包可能使用不同搜索源;
  • 豆包可能拥有独立 Retrieval Pipeline。

8. Jev Citation Ranking 结果

在 346 个可评分 Decision 上:

Metric Jev Random expectation Difference
Hit@1 0.4737 0.5716 -0.0979
Recall@3 0.1743 0.1781 -0.0039
Recall@5 0.3079 0.2969 +0.0110
MRR 0.6711 0.7460 -0.0750
nDCG 0.8012 0.8089 -0.0077

单独看 Hit@1 = 47.37% 很容易产生误导。

原因是:

198 / 346 = 57.2% 的可评分候选本身就是 Citation 页面。

Track B 主动将真实 Citation URL 加入 Candidate Pool,而页面可获取性又进一步改变了最终样本分布。

因此真正应该关注的是:

Jev
vs
matched random baseline

而不是 Jev 的绝对 Hit Rate。

在这一比较下:

  • Hit@1:低于随机期望;
  • Recall@3:近乎持平;
  • Recall@5:轻微高于随机;
  • MRR:低于随机;
  • nDCG:低于随机。

9. AUC 分析

以 citation_suitability 作为 cited / non-cited 区分信号:

Macro AUC = 0.534

其中:

  • 11 个 Query > 0.5;
  • 8 个 Query < 0.5。

如果将所有 Query 内 cited/non-cited pair 合并计算:

Pooled AUC = 0.592

这一结果显示出有限弱信号,但尚不足以认为 Jev 已经能够稳定模拟 Citation Selection。


10. Feature-Level Difference

虽然整体排序能力有限,但特征均值出现了一些值得继续研究的现象。

Jev Feature Cited Non-cited Difference
query_relevance 2.438 2.222 +0.216
direct_answer 2.004 1.950 +0.054
evidence_strength 2.148 2.065 +0.083
entity_match 2.359 2.102 +0.258
specificity 2.888 2.982 -0.094
citation_suitability 1.712 1.436 +0.275

其中差异最大的三个维度是:

citation_suitability  +0.275
entity_match          +0.258
query_relevance       +0.216

这可能暗示:

Jev 虽然目前无法稳定完成完整 TopK Citation Ranking,但某些语义特征可能捕捉到了 Citation 页面与普通页面之间的弱结构差异。

目前不能进一步解释为因果关系。


11. Representative Cases

实验同时存在 Jev 与 Citation 一致和不一致的案例。

Positive Case

Query:

AI检索领域的王涛是谁

Jev Top Page:

https://csee.hnu.edu.cn/people/wangtao

citation_suitability = 3.53

该页面同时也是该 Query 下最佳排名的实际 Citation。

该 Query 内 AUC = 0.885。

Negative Case

Query:

成都做 GEO 优化,推荐 3 家值得先咨询的公司。

Jev Top Page:

cnblogs.com/...

citation_suitability = 2.86

而最佳历史 Citation URL 在 Jev Ranking 中仅位于第 4 位,且 citation_suitability = 0.44。

该 Query 内 AUC 仅为 0.198。

这说明:

Jev 的 Citation 判断能力存在明显 Query-dependent variation。


12. Discussion

12.1 简单的“Jev = Citation Reranker”假设没有得到支持

本文最直接的负结果是:

在当前 content-available cohort 中,Jev 没有在主要 Ranking Metric 上稳定超过匹配随机排序。

因此,目前不能建立:

网页
→ Jev评分
→ 高分页面
→ 更可能成为真实AI Citation

这样一个简单模型。

12.2 Citation Selection 可能不是普通相关性排序问题

这可能意味着 Citation Selection 还受到其他因素影响,例如:

Retrieval Source
+
Query Rewrite
+
Domain Policy
+
Authority / Trust Signal
+
Passage-Level Match
+
Answer Generation Context
+
Platform Citation Policy

本文无法确认上述因素具体是否存在于豆包内部。

这些只是后续需要验证的候选变量。


13. 一个更重要的研究结果:三层 GEO 模型

本实验进一步支持把 GEO 问题拆成三个不同阶段:

Recall Competition
        ↓
Decision Competition
        ↓
Citation Competition

对应:

Layer 核心问题
Recall 页面有没有进入候选集合?
Decision 进入候选后,为什么某些页面排名更高?
Citation 进入高质量候选后,为什么最终引用某一来源?

本文的公共 SERP overlap 只有 1.57%,恰好说明:

在没有可靠 Retrieval Pool 的情况下,直接研究最终 Citation Ranking 非常困难。


14. 对 GEO 研究方法的启示

因此,本文不认为 GEO 应该继续停留在:

“哪类文章更容易被 AI 引用?”

更值得研究的是:

用户问题
↓
Query Interpretation
↓
Retrieval Set
↓
Decision Signals
↓
TopK
↓
Citation
↓
Generated Answer

并分别测量每一层。

这也是本文提出 Decision-Layer GEO 的核心目的。


15. Limitations

本文具有明显限制。

第一,Track B 数据严重不完整。

670 个 Query×URL Decision 中只有 346 个能够取得正文,324 个缺失;其中缺失项中包含 121 个 Citation Decision。因此完整 Track B 的 Hit@1、Recall@3、Recall@5 和 MRR 不能诚实计算。

第二,公开 Google/Bing SERP 并不等于豆包真实 Retrieval Pool。

第三,历史豆包结果与当前页面抓取存在时间差,页面内容可能发生变化。

第四,14/346 个页面正文受到 16,000 字符截断。

第五,样本量仅为 19 个 Query,且每个 Query 仅使用一个历史豆包运行。

第六,本实验不存在多次 Jev 重复运行,因此无法估计 Jev Decision Stability。

第七,Citation Label 只是“被引用”,并不表示 Citation 在事实层面正确。


16. Next Experiment

下一阶段不应该立即扩大 Query 数量。

优先任务应该是:

补齐页面正文
      ↓
完整 Track B
      ↓
重新运行 Jev
      ↓
完整 Ranking Metric
      ↓
Feature-level analysis

之后再进行第二阶段研究:

同一 Query
只改变一个词
      ↓
Retrieval Set 是否变化
      ↓
Decision Ranking 是否变化
      ↓
Citation 是否变化

最终可以进一步进入:

Page V1
↓
Jev Decision
↓
修改单一页面特征
↓
Page V2
↓
Jev Decision变化
↓
真实AI复采

从而测试:

Decision Model 所捕捉到的页面特征变化,是否能够预测真实 Citation 行为变化。


17. Conclusion

本文提出 Decision-Layer GEO 作为一个探索性研究框架,并尝试使用 Jev 模拟生成式搜索 Retrieval 与 Citation 之间可能存在的页面判别过程。

在当前 19 Query Pilot 中,Jev 对真实 Citation 的整体排序能力没有稳定超过匹配随机基线:

  • Hit@1、MRR 和 nDCG 低于随机期望;
  • Recall@3 基本持平;
  • Recall@5 仅表现出轻微优势;
  • macro citation_suitability AUC 为 0.534。

与此同时,真实 Citation 页面在 citation_suitability、entity_match 和 query_relevance 等特征上呈现有限平均正差异。

因此,当前结果不支持把 Jev 直接视为一个可靠的 AI Citation Reranker。

更合理的阶段性结论是:

Decision Model 可能具有研究 Citation 特征的价值,但其是否能够成为生成式搜索 Citation Selection 的有效代理模型,仍需要完整 Track B、更大规模 Query 数据以及页面级干预实验进一步验证。

最重要的是,本研究显示:

GEO 中“没有被引用”不能简单等同于“没有被检索到”。

未来 GEO 研究需要分别观察:

Recall、Decision 与 Citation。

这三个阶段很可能对应完全不同的优化机制。


Evidence Snapshot

当前 Pilot 已保存:

  • Jev Request;
  • Jev Raw Response;
  • Parsed Score;
  • Ranking;
  • Evaluation;
  • Random Baseline;
  • Grok Screenshots / Snapshots;
  • Manifest;
  • SHA256SUMS。

本轮共执行 346 个成功 Jev Request,记录 1,643,561 input tokens 与 33,216 output tokens;按该实验采用的 $0.042 / 1M input tokens 计算,指示性输入成本约为 $0.06903。

该 Pilot 已通过文件级 SHA-256 固化,但当前 checkout 没有 Git commit,因此现阶段由 Hash 而非 Git revision 标识该实验快照。


Version: Working Paper v0.1
Status: Exploratory Pilot


Research Evidence

  • Experiment: Decision-Layer GEO — pilot-v1
  • Evidence Version: pilot-v1
  • Jev Model: jev-1.13.0
  • Queries: 19
  • Successful Jev Decisions: 346
  • Evidence Snapshot: evidence/pilot-v1/SHA256SUMS

Manifest SHA-256:

8bf689bdd64414b80a4b5469d8e29d26af70a2959a540fc4c51bc9d838e88a6c

SHA256SUMS SHA-256:

41f5d035441b3263d06a546595d14bae0e25b6d34a9eac5abf0877dd67314aef

SHA-256 用于证明本研究当前 Evidence Snapshot 在发布后未发生静默修改;当前 v0.1 未公开全部原始证据文件,因此该 Hash 属于完整性承诺,不等同于完整公开复现。