AI 如何挑選候選來源:檢索、重排、引用三階段拆解

AI 決定引用誰,是一條三段管線:先「檢索」拉出上百個候選頁、再「重排」用可信度訊號篩到剩幾個、最後「生成」時只從留下的少數頁抽句子加註來源。多數內容不是沒被找到,而是死在中間的重排——被淘汰的原因是缺可信度訊號,不是缺內容。 看懂哪一段淘汰你,才知道該補什麼。

三段管線分別在做什麼?

現代 AI 搜尋(ChatGPT search、Perplexity、Google AI Overview)產生一句帶引用的答案,內部大致跑三步:

  1. 檢索(Retrieval):把使用者問題轉成查詢,向搜尋索引或向量庫拉回一批候選,通常 20 到 100 個頁面。這一段看的是「相關性」——你的內容有沒有涵蓋這個主題、關鍵實體對不對得上。
  2. 重排(Rerank):對候選逐一打分、重新排序,只留下前幾名(常見是 3 到 8 個)進入下一步。這一段看的是「可信度與可用性」——權威訊號、內容新鮮度、段落能不能被乾淨地抽出來。這是絕大多數內容陣亡的地方。
  3. 生成引用(Citation generation):模型只讀留下的少數頁,組出答案並在句子後掛上來源連結。這一段看的是「可摘取性」——哪一段話能被原封不動抽出來當佐證。

關鍵認知:被檢索到(第一段)門檻很低,一篇涵蓋主題的普通文章通常都進得了候選池;真正的窄門在第二段。你以為的「AI 都不引用我」,十之八九不是沒被找到,是找到了但在重排被刷掉。

每一段淘汰什麼、看什麼訊號?

階段 淘汰標準 主要訊號 你該做的事
檢索 Retrieval 主題不相關、實體對不上 語意相關性、關鍵詞與實體覆蓋 覆蓋子問題、寫全實體名稱(品牌、作者、產品全稱)
重排 Rerank 可信度低、內容過期、抽不出乾淨段落 網域權威、具名作者與 E-E-A-T、更新日期、結構化資料、段落自足度 補作者實體與 Schema、標明更新日期、每段做成自足答案塊
生成引用 Citation 沒有一句可原封抽用的佐證 明確定義句、硬數據、可複製的清單/表格 提供帶數字的定義句與比較表,讓模型有「可抄的句子」

換句話說,三段各要不同的東西:檢索要相關,重排要可信,生成要可抄。只顧堆內容(相關)而不補可信度訊號,等於一直在第一關加分、卻在第二關被判出局。

為什麼多數內容死在重排,而不是檢索?

因為檢索靠的是語意比對,這件事現在對任何一篇像樣的文章都不難——你寫了「AI 來源選擇」,向量庫就找得到你。但重排是一個排序問題:候選之間互相比較,只有相對最可信的前幾名能活。這裡有三個殘酷的事實:

一個真實對照:同一組「什麼是 GEO」的提問,A 頁 2,000 字但無署名、無日期、無數據;B 頁只有 900 字,但開頭一句加粗定義、中段一張比較表、標了 2026 年更新、掛了 Organization schema。檢索兩篇都進候選,重排 B 明顯勝出,生成階段模型直接抄 B 開頭那句定義。輸的一方不是輸在字少,是輸在訊號少。

怎麼診斷自己卡在哪一段?

按這個順序自檢,就能定位你死在哪一關:

  1. 檢索關:拿你的目標問題去問 AI,追問「你參考了哪些來源?」。若連你的競品都沒被列、整個主題都沒你這類頁——問題在檢索(相關性/可爬性),先確認沒被 robots 擋、內容確實涵蓋該主題。
  2. 重排關:若競品被引用、你沒有,而你內容其實更完整——問題在重排。逐項比對:對手有沒有具名作者、更新日期、外部權威引用、結構化資料,而你缺哪幾項。這是最常見的失分點。
  3. 生成關:若你偶爾被列進來源清單、卻很少被實際「抽句引用」——問題在可摘取性。回頭看有沒有一段是模型能原封抄走的定義句或數據句。

多數人跳過第 1、2 關直接狂寫內容,於是字越寫越多、卻始終補不到重排要的那幾個可信度訊號。正確順序是:先確認能被檢索,再狂補重排訊號,最後打磨可抄的句子。

補重排訊號的最小行動清單

常見問題(FAQ)

Q1:我內容明明最完整,為什麼還是不被引用? 內容完整只贏得「檢索」這一關,贏不了「重排」。重排比的是可信度訊號——具名作者、更新日期、外部引用、結構化資料。內容量夠但這些訊號缺,就會在重排被更「可信」的對手刷掉。

Q2:三段管線每家 AI 都一樣嗎? 架構大同小異(檢索、重排、生成),但各家權重不同:Perplexity 更重可驗證的外部來源,Google AI Overview 疊加既有的搜尋排名訊號,中文引擎更看重原生中文內容的完整度。共通點是重排這一段都吃可信度訊號。

Q3:怎麼知道我是死在檢索還是重排? 問 AI 你的目標問題並追問來源。連競品都沒被列=檢索關(先查有沒有被擋、內容夠不夠相關);競品被引、你沒有=重排關(補作者、日期、引用、schema)。這一步先做,能省下大量白寫的內容。

Q4:把段落切碎、做成一問一答,會不會傷害人類閱讀? 不會,反而更好讀。答案塊要求每段開頭先給結論,本質是倒金字塔寫法;人類讀者一樣先看到重點,想深入再往下讀論證。可摘取與可讀性在這裡是同一件事。

Q5:補齊這些訊號後,多久會看到 AI 開始引用? 取決於各引擎的重抓與重建索引週期,通常數天到數週。加速做法是確保頁面能被即時檢索(穩定 URL、乾淨 HTML),並在更新後主動讓搜尋引擎重新抓取,縮短重排看到新訊號的時間。


理解這條管線後,會發現 GEO 的重點不是「寫更多」,而是把可信度訊號補到能贏得重排。GeoSeoToday 把 AI 搜尋優化的完整地圖與可被引用檢測整理成一站,入口見 /zh-hant/aio/。想先打好「可抄的句子」這一段,從〈「答案優先」開頭段落怎麼寫〉練起;想把作者與實體訊號用機器可讀方式補齊,見〈為 GEO 加結構化資料〉。