
孤兒頁面稽核:找出沒有內部連結、爬蟲到不了的頁面
孤兒頁面是指存在於網站上、卻沒有任何內部連結指向它的頁面——爬蟲只能靠 sitemap 偶爾發現,權重完全進不來,長期常被 Google 排除在索引之外。 最可靠的抓法不是憑印象檢查,而是把 sitemap.xml 列出的全部網址,跟一次完整爬蟲(模擬 Googlebot 只走內部連結)抓到的網址清單做集合差,落在 sitemap 裡但爬蟲走不到的,就是孤兒頁。
為什麼孤兒頁會存在
常見成因有三種:舊文章改版時忘記從分類頁或相關文章區塊移除連結、活動頁或落地頁上線時只放進 sitemap 卻沒有從導覽或內文連過去、CMS 自動產生 sitemap 但內部連結策略是手動維護,兩者逐漸脫節。某中型部落格(約 340 篇文章)的實測案例中,全站爬蟲只走到 289 篇,sitemap 卻列了 340 篇——51 篇、約 15% 的內容完全沒有內部連結指向,其中 18 篇甚至是半年內發佈的新文章。
交叉比對的具體做法
孤兒頁抓取的核心邏輯很簡單:sitemap 清單 減去 爬蟲實際走到的清單 = 疑似孤兒頁,但爬蟲工具必須設定成「不讀取 sitemap 作為起點」,否則工具會用 sitemap 反過來餵網址給自己,等於失去比對意義。
- 匯出 sitemap 清單:下載
sitemap.xml(或逐一展開 sitemap index 底下的分 sitemap),取出所有<loc>網址,存成一份純網址清單。 - 關閉「以 sitemap 為起點」的爬蟲設定:用 Screaming Frog 或同類工具,只勾選「Crawl」模式,起點是首頁,讓工具完全依照頁面上實際存在的
<a href>連結逐層爬。不要同時匯入 sitemap 當種子網址。 - 匯出爬蟲實際走到的清單:爬完後匯出全部被發現的內部網址(HTML 頁面、狀態碼 200)。
- 做集合差:把兩份清單匯入試算表,用
VLOOKUP或XLOOKUP找出「在 sitemap 但不在爬蟲清單」的網址——這就是疑似孤兒頁。 - 交叉比對 GSC 涵蓋範圍報表:把疑似孤兒頁清單貼到 Google Search Console「頁面」報表逐一查詢,若狀態是「已檢索,尚未建立索引」或「探索到但目前未建立索引」,通常就是孤兒頁缺乏權重訊號的直接證據。
- 決定去留並補連結:確認頁面仍有價值的,從至少 2–3 個相關文章或分類頁補上內部連結;確認已無價值的,直接下架並設定 301 到最相關的存活頁面,而不是留著孤兒狀態繼續浪費抓取預算。
孤兒頁 vs 正常連結頁:訊號對照
| 檢查項目 | 正常有連結頁面 | 孤兒頁面(典型訊號) |
|---|---|---|
| 內部連結進站數 | 通常 3 個以上 | 0 個 |
| 爬蟲工具是否能走到 | 能(純連結爬取模式) | 不能,只在 sitemap 出現 |
| GSC 索引狀態 | 多為「已建立索引」 | 常見「探索到但未建立索引」 |
| 平均抓取頻率 | 依內容更新頻率而定 | 明顯偏低或長期未再抓取 |
| 常見成因 | — | 改版遺漏連結、活動頁未接內文、CMS 與連結策略脫節 |
常見問題(FAQ)
Q1:孤兒頁一定會被排除索引嗎? 不一定,但機率明顯偏高。Google 仍可能透過 sitemap 或外部連結發現並索引孤兒頁,只是缺乏內部連結傳遞的權重訊號,實務上這類頁面的索引穩定度與排名表現通常比有連結的頁面差一截。
Q2:多久該做一次孤兒頁稽核? 內容量持續成長的網站建議每季一次,大型改版或分類架構調整後應立即補做,避免遺漏連結累積成長期未被發現的問題。
Q3:sitemap 裡本來就不該放的頁面,也會被抓成孤兒頁嗎? 會。這也是這套方法額外的好處——它同時能揪出「根本不該放進 sitemap」的過期活動頁、測試頁,稽核時應一併判斷是修連結還是直接從 sitemap 移除。
Q4:只看 Google Search Console 的涵蓋範圍報表,能取代這套交叉比對嗎? 不能完全取代。GSC 只告訴你索引結果,不會直接告訴你「哪些頁面缺乏內部連結」這個成因;sitemap 與爬蟲清單的集合差比對,才能精準定位問題頁面本身。
孤兒頁解決的是「頁面存在但連結進不去」的問題,而讓權重能有效分配到每個頁面,還需要更完整的連結架構規劃——可參考〈內部連結策略:把權重灌進賺錢頁〉。若想了解內部連結在 GEO(AI 引用優化)脈絡下扮演的角色,可先讀總覽:/zh-hant/geo/。