Topic 03 / Benchmark

Benchmark

研究如何用稳定问题、明确口径和可追溯结果评估 GEO 与 AI 检索表现。

研究范围

Benchmark 用于把一次性的回答观察变成可比较、可重复和可解释的评测过程。

核心问题

  • 评测问题如何覆盖实体识别、引用和推荐等不同目标?
  • 怎样区分平台差异、时间变化和内容调整带来的影响?
  • 哪些指标可以公开复核,哪些判断仍需保留不确定性?

相关文章