——基于 Jev 的 Decision-Layer GEO 探索性研究
Can Decision Models Serve as Proxies for Citation Selection in Generative Search?
An Exploratory Study of Decision-Layer GEO with Jev
摘要
生成式搜索与 AI Agent 的答案生成通常并非直接从全量网页中完成,而可能经历查询理解、候选召回、候选筛选、重排以及最终引用选择等多个阶段。现有 GEO(Generative Engine Optimization)研究通常更关注“页面是否被检索到”以及“最终是否被引用”,对于 Retrieval 与 Citation 之间的中间判别过程仍缺少可观测实验工具。
本文提出 Decision-Layer GEO 的初步研究框架,并使用决策模型 Jev 作为实验代理,探索一个核心问题:在候选网页已经给定的情况下,Jev 对网页的语义评分与真实生成式搜索答案中的 Citation 选择是否存在稳定一致性。
实验使用 19 个历史豆包 Query/run 对,其中包含 14 个正式 Observation-linked runs 和 5 个原始 SamplingRuns,共得到 319 个历史 Citation URL 标签。公开搜索侧采集了 168 条 Google 与 188 条 Bing organic results;构造 Track B 后共有 670 个 Query×URL 决策候选、431 个全局唯一 URL。但由于页面正文获取不完整,最终仅有 346 个候选能够进入 Jev 内容评分,其中 198 个为历史被引用页面、148 个为未引用页面。
在该可评分子集中,Jev 的 Hit@1 为 0.4737,Recall@3 为 0.1743,Recall@5 为 0.3079,MRR 为 0.6711,nDCG 为 0.8012。与保持各 Query 候选数量和 Citation 标签比例不变的随机排序期望相比,Jev 在 Hit@1、MRR 和 nDCG 上低于随机基线,Recall@3 基本持平,仅 Recall@5 略高。Query 宏平均 citation_suitability AUC 为 0.534,尚未表现出稳定的 Citation 排序优势。
与此同时,被引用页面在 citation_suitability、entity_match 与 query_relevance 等 Jev 特征上表现出一定的平均正差异,提示 Decision Model 可能更适合作为 Citation 特征分析工具,而非直接作为完整 Citation Reranker。
由于 670 个 Track B 决策中仍有 324 个缺少正文,包括 121 个真实 Citation 决策,本文只能被视为探索性 Pilot,而不能据此接受或否定完整的 Decision-Layer Proxy 假设。
关键词: GEO;Generative Search;Decision Model;Jev;Citation Selection;Reranking;AI Search;Decision-Layer GEO
Research Status
Working Paper v0.1
Status: Exploratory Pilot
Experiment: Decision-Layer GEO Experiment — content-available pilot-v1
Dataset: 19 historical Query/run pairs; 319 historical Citation URL labels; 346 content-available Jev decisions
Key limitation: 324 / 670 Track B decisions lacked page body text. The complete Track B hypothesis therefore remains untested.
1. 引言
生成式搜索系统正在改变传统搜索中“检索结果页即终点”的信息消费模式。
在经典搜索场景中,可以将用户行为粗略抽象为:
Query
→ Retrieval
→ Ranking
→ SERP
→ User Click
而在生成式搜索、AI Search 或 Agent 场景中,更合理的抽象可能是:
Query
→ Query Interpretation
→ Retrieval
→ Candidate Selection
→ Reranking / Decision
→ Citation Selection
→ Answer Generation
这意味着,一个网页最终没有出现在 AI 答案中,至少可能存在三种不同原因:
没有被召回
≠
被召回但在判别/重排阶段被淘汰
≠
进入候选集但最终没有成为 Citation
这三种状态对应的 GEO 优化问题并不相同。
因此,本文提出一个初步概念:
Decision-Layer GEO:研究生成式搜索在 Retrieval 与最终 Citation 之间,候选页面如何被分类、评分、筛选和重排。
Decision Layer 并不要求真实系统内部必须使用某一种具体模型。
本文亦不主张豆包或其他平台内部正在使用 Jev。
Jev 在本文中只承担一个角色:
Decision-Layer Experimental Proxy。
即利用其对候选页面进行独立、结构化语义判断的能力,模拟一种可能存在于 Retrieval 之后的页面选择机制。
2. 研究问题
本文主要回答三个探索性问题。
RQ1:公开搜索结果能够多大程度覆盖历史 AI Citation?
即:
Google / Bing Top10
↓
是否包含
↓
历史豆包 Citation URL
这一问题用于区分 Retrieval Gap 与后续 Decision Gap。
RQ2:当真实 Citation 页面已经存在于候选池中时,Jev 能否将其排在更高位置?
即:
Candidate Pages
↓
隐藏真实 Citation Label
↓
Jev 独立评分
↓
Ranking
↓
与真实 Citation 对照
这是本文最核心的 Decision-Layer Proxy 检验。
RQ3:真实 Citation 页面与非 Citation 页面,在 Jev 语义特征上是否存在系统性差异?
本文关注:
- query_relevance
- direct_answer
- evidence_strength
- entity_match
- specificity
- citation_suitability
如果某些特征长期稳定区分被引用和未引用页面,即使 Jev 无法直接承担完整 Reranker,也可能成为 GEO 特征研究工具。
3. 实验数据
3.1 历史 AI Query 与 Citation
实验使用 19 个未改写的历史 Query/run 对。
其中:
- 14 个正式 Observation-linked runs;
- 5 个 raw SamplingRuns;
- 共包含 319 个 per-query Citation URL labels。
这里的 Citation label 仅表示:
某历史 AI Answer 引用了该 URL。
它并不意味着:
- Citation 内容一定正确;
- 页面一定真正支持答案;
- 答案本身一定正确。
3.2 公共 SERP
同期公共搜索采集得到:
| 来源 | Organic rows |
|---|---|
| 168 | |
| Bing | 188 |
| 合计 | 356 |
其中 Google 前 141 条来自 Grok bot v2,共保存 16 张 PNG 和 16 份 accessibility snapshots;另外 27 条来自登录态 Chrome Extension,因此可能存在地区或个性化上下文差异。
4. Candidate Track 设计
为了区分 Retrieval 与 Decision,本实验构造两个逻辑 Track。
Track A:Retrieval Observation
Google Top10
+
Bing Top10
↓
Candidate Pool
↓
检查历史 Citation URL 是否出现
Track A 不测试 Jev 的排序能力。
它只回答:
公共搜索候选集合是否已经包含真实历史 Citation。
Track B:Decision-Layer Proxy
Google Top10
+
Bing Top10
+
Actual Citation URLs
↓
统一候选池
↓
隐藏 Citation Label
↓
Jev 独立评分
Track B 共形成:
- 670 个 Query×URL decisions;
- 431 个 globally unique URLs。
但仅有 346 个决策取得可用页面正文。
其中:
| 类型 | 数量 |
|---|---|
| Cited | 198 |
| Non-cited | 148 |
| 可评分总数 | 346 |
另有 324 个决策缺少正文,其中包括 121 个历史 Citation 页面。
因此,没有任何一个 Query 拥有完整正文的 Track B Candidate Pool。
这一缺失是本文最大的实验限制。
5. Jev Decision Contract
Jev 在每个:
Query × Candidate Page
组合上独立判断六项特征:
| Feature | 含义 |
|---|---|
query_relevance |
页面与 Query 的直接相关程度 |
direct_answer |
是否直接解决用户问题 |
evidence_strength |
是否包含可支撑答案的事实、数据或证据 |
entity_match |
页面实体与 Query 目标是否匹配 |
specificity |
信息是否具体 |
citation_suitability |
是否适合作为 AI Answer 的引用来源 |
Jev 输入包含:
- Query;
- URL;
- title;
- description;
- H1;
- main text;
- 可获得的时间信息。
为了避免标签泄漏,Jev 没有看到:
- 实际 Citation 标签;
- SERP Rank;
- 来源属于 Google/Bing/Citation Track 的信息。
长正文最多保留 16,000 characters,该截断影响 346 个请求中的 14 个。
6. 排序与评估方法
Jev 主排序指标为:
citation_suitability
出现同分时依次采用:
evidence_strength
→ query_relevance
→ direct_answer
→ specificity
→ URL
本文计算:
- Hit@1
- Recall@3
- Recall@5
- MRR
- nDCG
- Pairwise AUC
同时建立 matched random-order expectation。
随机基线并不是简单假设每个 Query 都有相同 Citation 比例,而是保留每个 Query 实际:
- Candidate 数量;
- Citation 数量。
因此能避免 Track B 中 Citation 页面比例较高造成的假象。
7. Results
7.1 Public SERP 与历史 Citation 的覆盖
公共 SERP 与历史 Citation 进行保守 exact URL overlap 后:
| Retrieval source | Citation overlap |
|---|---|
| 5 / 319 | |
| Bing | 0 / 319 |
| Google ∪ Bing | 5 / 319 |
| Union coverage | 1.57% |
并且所有 19 个 Query 均至少存在一个历史 Citation URL 不在当前公共 Google/Bing candidate pool 中。
这一结果不能被解释为:
豆包没有使用搜索引擎。
更准确的解释是:
当前公共 Google/Bing SERP 不能直接作为历史豆包 Retrieval Pool 的可靠代理。
原因包括:
- 当前 SERP 与历史豆包回答并非同时产生;
- 搜索地区和个性化上下文可能不同;
- 豆包可能使用不同搜索源;
- 豆包可能拥有独立 Retrieval Pipeline。
8. Jev Citation Ranking 结果
在 346 个可评分 Decision 上:
| Metric | Jev | Random expectation | Difference |
|---|---|---|---|
| Hit@1 | 0.4737 | 0.5716 | -0.0979 |
| Recall@3 | 0.1743 | 0.1781 | -0.0039 |
| Recall@5 | 0.3079 | 0.2969 | +0.0110 |
| MRR | 0.6711 | 0.7460 | -0.0750 |
| nDCG | 0.8012 | 0.8089 | -0.0077 |
单独看 Hit@1 = 47.37% 很容易产生误导。
原因是:
198 / 346 = 57.2% 的可评分候选本身就是 Citation 页面。
Track B 主动将真实 Citation URL 加入 Candidate Pool,而页面可获取性又进一步改变了最终样本分布。
因此真正应该关注的是:
Jev
vs
matched random baseline
而不是 Jev 的绝对 Hit Rate。
在这一比较下:
- Hit@1:低于随机期望;
- Recall@3:近乎持平;
- Recall@5:轻微高于随机;
- MRR:低于随机;
- nDCG:低于随机。
9. AUC 分析
以 citation_suitability 作为 cited / non-cited 区分信号:
Macro AUC = 0.534
其中:
- 11 个 Query > 0.5;
- 8 个 Query < 0.5。
如果将所有 Query 内 cited/non-cited pair 合并计算:
Pooled AUC = 0.592
这一结果显示出有限弱信号,但尚不足以认为 Jev 已经能够稳定模拟 Citation Selection。
10. Feature-Level Difference
虽然整体排序能力有限,但特征均值出现了一些值得继续研究的现象。
| Jev Feature | Cited | Non-cited | Difference |
|---|---|---|---|
| query_relevance | 2.438 | 2.222 | +0.216 |
| direct_answer | 2.004 | 1.950 | +0.054 |
| evidence_strength | 2.148 | 2.065 | +0.083 |
| entity_match | 2.359 | 2.102 | +0.258 |
| specificity | 2.888 | 2.982 | -0.094 |
| citation_suitability | 1.712 | 1.436 | +0.275 |
其中差异最大的三个维度是:
citation_suitability +0.275
entity_match +0.258
query_relevance +0.216
这可能暗示:
Jev 虽然目前无法稳定完成完整 TopK Citation Ranking,但某些语义特征可能捕捉到了 Citation 页面与普通页面之间的弱结构差异。
目前不能进一步解释为因果关系。
11. Representative Cases
实验同时存在 Jev 与 Citation 一致和不一致的案例。
Positive Case
Query:
AI检索领域的王涛是谁
Jev Top Page:
https://csee.hnu.edu.cn/people/wangtao
citation_suitability = 3.53
该页面同时也是该 Query 下最佳排名的实际 Citation。
该 Query 内 AUC = 0.885。
Negative Case
Query:
成都做 GEO 优化,推荐 3 家值得先咨询的公司。
Jev Top Page:
cnblogs.com/...
citation_suitability = 2.86
而最佳历史 Citation URL 在 Jev Ranking 中仅位于第 4 位,且 citation_suitability = 0.44。
该 Query 内 AUC 仅为 0.198。
这说明:
Jev 的 Citation 判断能力存在明显 Query-dependent variation。
12. Discussion
12.1 简单的“Jev = Citation Reranker”假设没有得到支持
本文最直接的负结果是:
在当前 content-available cohort 中,Jev 没有在主要 Ranking Metric 上稳定超过匹配随机排序。
因此,目前不能建立:
网页
→ Jev评分
→ 高分页面
→ 更可能成为真实AI Citation
这样一个简单模型。
12.2 Citation Selection 可能不是普通相关性排序问题
这可能意味着 Citation Selection 还受到其他因素影响,例如:
Retrieval Source
+
Query Rewrite
+
Domain Policy
+
Authority / Trust Signal
+
Passage-Level Match
+
Answer Generation Context
+
Platform Citation Policy
本文无法确认上述因素具体是否存在于豆包内部。
这些只是后续需要验证的候选变量。
13. 一个更重要的研究结果:三层 GEO 模型
本实验进一步支持把 GEO 问题拆成三个不同阶段:
Recall Competition
↓
Decision Competition
↓
Citation Competition
对应:
| Layer | 核心问题 |
|---|---|
| Recall | 页面有没有进入候选集合? |
| Decision | 进入候选后,为什么某些页面排名更高? |
| Citation | 进入高质量候选后,为什么最终引用某一来源? |
本文的公共 SERP overlap 只有 1.57%,恰好说明:
在没有可靠 Retrieval Pool 的情况下,直接研究最终 Citation Ranking 非常困难。
14. 对 GEO 研究方法的启示
因此,本文不认为 GEO 应该继续停留在:
“哪类文章更容易被 AI 引用?”
更值得研究的是:
用户问题
↓
Query Interpretation
↓
Retrieval Set
↓
Decision Signals
↓
TopK
↓
Citation
↓
Generated Answer
并分别测量每一层。
这也是本文提出 Decision-Layer GEO 的核心目的。
15. Limitations
本文具有明显限制。
第一,Track B 数据严重不完整。
670 个 Query×URL Decision 中只有 346 个能够取得正文,324 个缺失;其中缺失项中包含 121 个 Citation Decision。因此完整 Track B 的 Hit@1、Recall@3、Recall@5 和 MRR 不能诚实计算。
第二,公开 Google/Bing SERP 并不等于豆包真实 Retrieval Pool。
第三,历史豆包结果与当前页面抓取存在时间差,页面内容可能发生变化。
第四,14/346 个页面正文受到 16,000 字符截断。
第五,样本量仅为 19 个 Query,且每个 Query 仅使用一个历史豆包运行。
第六,本实验不存在多次 Jev 重复运行,因此无法估计 Jev Decision Stability。
第七,Citation Label 只是“被引用”,并不表示 Citation 在事实层面正确。
16. Next Experiment
下一阶段不应该立即扩大 Query 数量。
优先任务应该是:
补齐页面正文
↓
完整 Track B
↓
重新运行 Jev
↓
完整 Ranking Metric
↓
Feature-level analysis
之后再进行第二阶段研究:
同一 Query
只改变一个词
↓
Retrieval Set 是否变化
↓
Decision Ranking 是否变化
↓
Citation 是否变化
最终可以进一步进入:
Page V1
↓
Jev Decision
↓
修改单一页面特征
↓
Page V2
↓
Jev Decision变化
↓
真实AI复采
从而测试:
Decision Model 所捕捉到的页面特征变化,是否能够预测真实 Citation 行为变化。
17. Conclusion
本文提出 Decision-Layer GEO 作为一个探索性研究框架,并尝试使用 Jev 模拟生成式搜索 Retrieval 与 Citation 之间可能存在的页面判别过程。
在当前 19 Query Pilot 中,Jev 对真实 Citation 的整体排序能力没有稳定超过匹配随机基线:
- Hit@1、MRR 和 nDCG 低于随机期望;
- Recall@3 基本持平;
- Recall@5 仅表现出轻微优势;
- macro
citation_suitabilityAUC 为 0.534。
与此同时,真实 Citation 页面在 citation_suitability、entity_match 和 query_relevance 等特征上呈现有限平均正差异。
因此,当前结果不支持把 Jev 直接视为一个可靠的 AI Citation Reranker。
更合理的阶段性结论是:
Decision Model 可能具有研究 Citation 特征的价值,但其是否能够成为生成式搜索 Citation Selection 的有效代理模型,仍需要完整 Track B、更大规模 Query 数据以及页面级干预实验进一步验证。
最重要的是,本研究显示:
GEO 中“没有被引用”不能简单等同于“没有被检索到”。
未来 GEO 研究需要分别观察:
Recall、Decision 与 Citation。
这三个阶段很可能对应完全不同的优化机制。
Evidence Snapshot
当前 Pilot 已保存:
- Jev Request;
- Jev Raw Response;
- Parsed Score;
- Ranking;
- Evaluation;
- Random Baseline;
- Grok Screenshots / Snapshots;
- Manifest;
- SHA256SUMS。
本轮共执行 346 个成功 Jev Request,记录 1,643,561 input tokens 与 33,216 output tokens;按该实验采用的 $0.042 / 1M input tokens 计算,指示性输入成本约为 $0.06903。
该 Pilot 已通过文件级 SHA-256 固化,但当前 checkout 没有 Git commit,因此现阶段由 Hash 而非 Git revision 标识该实验快照。
Version: Working Paper v0.1
Status: Exploratory Pilot
Research Evidence
- Experiment: Decision-Layer GEO — pilot-v1
- Evidence Version: pilot-v1
- Jev Model: jev-1.13.0
- Queries: 19
- Successful Jev Decisions: 346
- Evidence Snapshot:
evidence/pilot-v1/SHA256SUMS
Manifest SHA-256:
8bf689bdd64414b80a4b5469d8e29d26af70a2959a540fc4c51bc9d838e88a6c
SHA256SUMS SHA-256:
41f5d035441b3263d06a546595d14bae0e25b6d34a9eac5abf0877dd67314aef
SHA-256 用于证明本研究当前 Evidence Snapshot 在发布后未发生静默修改;当前 v0.1 未公开全部原始证据文件,因此该 Hash 属于完整性承诺,不等同于完整公开复现。