
AI 如何挑选候选来源:检索、重排、引用三阶段拆解
AI 决定引用谁,是一条三段管线:先「检索」拉出上百个候选页、再「重排」用可信度信号筛到剩几个、最后「生成」时只从留下的少数页抽句子加注来源。多数内容不是没被找到,而是死在中间的重排——被淘汰的原因是缺可信度信号,不是缺内容。 看懂哪一段淘汰你,才知道该补什么。
三段管线分别在做什么?
现代 AI 搜索(ChatGPT search、Perplexity、Google AI Overview)产生一句带引用的答案,内部大致跑三步:
- 检索(Retrieval):把用户问题转成查询,向搜索索引或向量库拉回一批候选,通常 20 到 100 个页面。这一段看的是「相关性」——你的内容有没有涵盖这个主题、关键实体对不对得上。
- 重排(Rerank):对候选逐一打分、重新排序,只留下前几名(常见是 3 到 8 个)进入下一步。这一段看的是「可信度与可用性」——权威信号、内容新鲜度、段落能不能被干净地抽出来。这是绝大多数内容阵亡的地方。
- 生成引用(Citation generation):模型只读留下的少数页,组出答案并在句子后挂上来源链接。这一段看的是「可摘取性」——哪一段话能被原封不动抽出来当佐证。
关键认知:被检索到(第一段)门槛很低,一篇涵盖主题的普通文章通常都进得了候选池;真正的窄门在第二段。你以为的「AI 都不引用我」,十之八九不是没被找到,是找到了但在重排被刷掉。
每一段淘汰什么、看什么信号?
| 阶段 | 淘汰标准 | 主要信号 | 你该做的事 |
|---|---|---|---|
| 检索 Retrieval | 主题不相关、实体对不上 | 语义相关性、关键词与实体覆盖 | 覆盖子问题、写全实体名称(品牌、作者、产品全称) |
| 重排 Rerank | 可信度低、内容过期、抽不出干净段落 | 网域权威、署名作者与 E-E-A-T、更新日期、结构化数据、段落自足度 | 补作者实体与 Schema、标明更新日期、每段做成自足答案块 |
| 生成引用 Citation | 没有一句可原封抽用的佐证 | 明确定义句、硬数据、可复制的清单/表格 | 提供带数字的定义句与比较表,让模型有「可抄的句子」 |
换句话说,三段各要不同的东西:检索要相关,重排要可信,生成要可抄。只顾堆内容(相关)而不补可信度信号,等于一直在第一关加分、却在第二关被判出局。
为什么多数内容死在重排,而不是检索?
因为检索靠的是语义比对,这件事现在对任何一篇像样的文章都不难——你写了「AI 来源选择」,向量库就找得到你。但重排是一个排序问题:候选之间互相比较,只有相对最可信的前几名能活。这里有三个残酷的事实:
- 它是相对的,不是及格制。你不是要「达标」,是要赢过同一批候选里的其他页。对手补了作者实体、你没补,你就往下掉。
- 信号稀缺者先出局。内容长度大家都有,但署名作者、可验证的外部引用、清楚的更新日期是稀缺的——重排器正是拿这些稀缺信号当筛子。
- 抽不出干净段落=实质弃权。就算排进前几名,若你整篇是连绵长论述、没有任何一段能被单独抽出,到了生成阶段模型宁可选旁边那个有现成定义句的页。
一个真实对照:同一组「什么是 GEO」的提问,A 页 2,000 字但无署名、无日期、无数据;B 页只有 900 字,但开头一句加粗定义、中段一张比较表、标了 2026 年更新、挂了 Organization schema。检索两篇都进候选,重排 B 明显胜出,生成阶段模型直接抄 B 开头那句定义。输的一方不是输在字少,是输在信号少。
怎么诊断自己卡在哪一段?
按这个顺序自检,就能定位你死在哪一关:
- 检索关:拿你的目标问题去问 AI,追问「你参考了哪些来源?」。若连你的竞品都没被列、整个主题都没你这类页——问题在检索(相关性/可爬性),先确认没被 robots 挡、内容确实涵盖该主题。
- 重排关:若竞品被引用、你没有,而你内容其实更完整——问题在重排。逐项比对:对手有没有署名作者、更新日期、外部权威引用、结构化数据,而你缺哪几项。这是最常见的失分点。
- 生成关:若你偶尔被列进来源清单、却很少被实际「抽句引用」——问题在可摘取性。回头看有没有一段是模型能原封抄走的定义句或数据句。
多数人跳过第 1、2 关直接狂写内容,于是字越写越多、却始终补不到重排要的那几个可信度信号。正确顺序是:先确认能被检索,再狂补重排信号,最后打磨可抄的句子。
补重排信号的最小行动清单
- 署名作者实体:文章挂明确作者,并用
sameAs串到可验证的社群或机构页,让 AI 把内容归给一个真实实体。 - 可见的更新日期:标出
date_updated并确实做实质更新,而非只改数字。新鲜度是重排的直接输入。 - 外部权威引用:关键主张至少附一个可点开的权威来源,把「可验证」这个信号做出来。
- 结构化数据:补上 Article、FAQPage、Organization schema,等于把作者、日期、实体用机器可读的方式再讲一次。
- 段落自足化:每个 H2 下第一段做成 40 到 60 字的自足答案块,同时服务重排(好抽)与生成(可抄)。
常见问题(FAQ)
Q1:我内容明明最完整,为什么还是不被引用? 内容完整只赢得「检索」这一关,赢不了「重排」。重排比的是可信度信号——署名作者、更新日期、外部引用、结构化数据。内容量够但这些信号缺,就会在重排被更「可信」的对手刷掉。
Q2:三段管线每家 AI 都一样吗? 架构大同小异(检索、重排、生成),但各家权重不同:Perplexity 更重可验证的外部来源,Google AI Overview 叠加既有的搜索排名信号,中文引擎更看重原生中文内容的完整度。共通点是重排这一段都吃可信度信号。
Q3:怎么知道我是死在检索还是重排? 问 AI 你的目标问题并追问来源。连竞品都没被列=检索关(先查有没有被挡、内容够不够相关);竞品被引、你没有=重排关(补作者、日期、引用、schema)。这一步先做,能省下大量白写的内容。
Q4:把段落切碎、做成一问一答,会不会伤害人类阅读? 不会,反而更好读。答案块要求每段开头先给结论,本质是倒金字塔写法;人类读者一样先看到重点,想深入再往下读论证。可摘取与可读性在这里是同一件事。
Q5:补齐这些信号后,多久会看到 AI 开始引用? 取决于各引擎的重抓与重建索引周期,通常数天到数周。加速做法是确保页面能被即时检索(稳定 URL、干净 HTML),并在更新后主动让搜索引擎重新抓取,缩短重排看到新信号的时间。
理解这条管线后,会发现 GEO 的重点不是「写更多」,而是把可信度信号补到能赢得重排。GeoSeoToday 把 AI 搜索优化的完整地图与可被引用检测整理成一站,入口见 /zh-hans/aio/。想先打好「可抄的句子」这一段,从〈「答案优先」开头段落怎么写〉练起;想把作者与实体信号用机器可读方式补齐,见〈为 GEO 加结构化数据〉。