
孤儿页面审计:找出没有内部链接、爬虫到不了的页面
孤儿页面是指网站上存在、却没有任何内部链接指向它的页面——爬虫只能靠 sitemap 偶尔发现,权重完全进不来,长期常被 Google 排除在收录之外。 最可靠的抓法不是凭印象检查,而是把 sitemap.xml 列出的全部网址,跟一次完整爬虫(模拟 Googlebot、只走内部链接)抓到的网址清单做集合差,落在 sitemap 里但爬虫走不到的,就是孤儿页。
孤儿页为什么会出现
常见成因有三种:旧文章改版时忘了从分类页或相关文章模块移除链接、活动页或落地页上线时只放进了 sitemap 却没有从导航或正文链过去、CMS 自动生成 sitemap 但内部链接策略是手动维护,两者逐渐脱节。某中型博客(约 340 篇文章)的实测案例中,全站爬虫只走到 289 篇,sitemap 却列了 340 篇——51 篇、约 15% 的内容完全没有内部链接指向,其中 18 篇甚至是半年内发布的新文章。
交叉比对的具体做法
孤儿页抓取的核心逻辑很简单:sitemap 清单减去爬虫实际走到的清单 = 疑似孤儿页,但爬虫工具必须设置成“不把 sitemap 当作起点”,否则工具会用 sitemap 反过来喂网址给自己,比对就失去意义了。
- 导出 sitemap 清单:下载
sitemap.xml(或逐一展开 sitemap index 下面的分 sitemap),取出所有<loc>网址,存成一份纯网址清单。 - 关闭“以 sitemap 为起点”的爬虫设置:用 Screaming Frog 或同类工具,只勾选“Crawl”模式,起点是首页,让工具完全依照页面上实际存在的
<a href>链接逐层爬取。不要同时导入 sitemap 当种子网址。 - 导出爬虫实际走到的清单:爬完后导出全部被发现的内部网址(HTML 页面、状态码 200)。
- 做集合差:把两份清单导入表格,用
VLOOKUP或XLOOKUP找出“在 sitemap 里但不在爬虫清单里”的网址——这就是疑似孤儿页。 - 交叉比对 GSC 覆盖率报告:把疑似孤儿页清单逐一贴到 Google Search Console“网页”报告里查询,如果状态是“已抓取,尚未编入索引”或“已发现,目前未编入索引”,通常就是孤儿页缺乏权重信号的直接证据。
- 决定去留并补链接:确认页面仍有价值的,从至少 2–3 个相关文章或分类页补上内部链接;确认已无价值的,直接下线并设置 301 跳转到最相关的存活页面,而不是留着孤儿状态继续浪费抓取预算。
孤儿页 vs 正常链接页:信号对照
| 检查项 | 正常有链接页面 | 孤儿页面(典型信号) |
|---|---|---|
| 内部链接进站数 | 通常 3 个以上 | 0 个 |
| 爬虫工具能否走到 | 能(纯链接爬取模式) | 不能,只在 sitemap 出现 |
| GSC 收录状态 | 多为“已编入索引” | 常见“已发现但未编入索引” |
| 平均抓取频率 | 依内容更新频率而定 | 明显偏低或长期未再抓取 |
| 常见成因 | — | 改版遗漏链接、活动页未接正文、CMS 与链接策略脱节 |
常见问题(FAQ)
Q1:孤儿页一定会被排除收录吗? 不一定,但概率明显偏高。Google 仍可能通过 sitemap 或外部链接发现并收录孤儿页,只是缺乏内部链接传递的权重信号,实际情况中这类页面的收录稳定度和排名表现通常比有链接的页面差一截。
Q2:多久该做一次孤儿页审计? 内容量持续增长的网站建议每季度一次,大型改版或分类架构调整后应立即补做,避免遗漏的链接累积成长期未被发现的问题。
Q3:sitemap 里本来就不该放的页面,也会被抓成孤儿页吗? 会。这也是这套方法额外的好处——它同时能揪出“根本不该放进 sitemap”的过期活动页、测试页,审计时应一并判断是修链接还是直接从 sitemap 移除。
Q4:只看 Google Search Console 的覆盖率报告,能取代这套交叉比对吗? 不能完全取代。GSC 只告诉你收录结果,不会直接告诉你“哪些页面缺乏内部链接”这个成因;sitemap 与爬虫清单的集合差比对,才能精准定位问题页面本身。
孤儿页解决的是“页面存在但链接进不去”的问题,而要让权重能有效分配到每个页面,还需要更完整的链接架构规划——可参考〈内部链接策略:把权重灌进赚钱页〉。若想了解内部链接在 GEO(AI 引用优化)语境下扮演的角色,可先读总览:/zh-hans/geo/。