crawl budget 是什麼?小網站要在意嗎

crawl budget(爬取預算)是 Googlebot 分配給你網站的爬取資源總量,由「爬取容量上限」(你的伺服器撐得住多少)與「爬取需求」(Google 覺得你的內容多值得爬)兩者共同決定。 Google 官方明講:幾千頁以下、內容當天就被收錄的網站,多數時候不需要擔心 crawl budget——但「低價值頁面浪費爬取資源」的邏輯,對任何規模的站都成立。

兩個變數怎麼運作?

Google Search Central 的官方文件把 crawl budget 拆成兩塊:

  1. 爬取容量上限(crawl capacity limit):Googlebot 不想爬垮你的伺服器。回應快、錯誤少 → 上限提高;大量 5xx 錯誤或回應變慢 → Googlebot 自動退避、爬得更少。
  2. 爬取需求(crawl demand):Google 對你內容的興趣。頁面越熱門(外鏈、點擊)、更新越頻繁、整站品質越高 → 需求越高。反之,一堆沒人看的重複頁會拉低需求。

兩者取交集就是你實際的爬取預算。重點:預算不是固定配給,而是 Google 對你網站的即時評價——它會隨你的品質與伺服器表現上下浮動。

Google 官方的適用門檻

依官方文件,真正需要管理 crawl budget 的是:

幾百頁的部落格不在名單上。但注意最後一條:小站也可能因為品質問題出現爬不動的症狀,這時問題不是預算太少,而是需求太低。

小網站真正該在意的:別浪費 Google 給的額度

小站的爬取額度綽綽有餘,前提是別自己糟蹋。常見的浪費源:

浪費源 例子 修法
內容負債 90 天 0 點擊的空殼頁佔掉爬取輪次 合併/移除/補料,見〈內容負債是什麼
無限 URL 空間 篩選參數、日曆頁、站內搜尋結果頁被爬 robots.txt 擋掉參數路徑
重複內容 同頁多網址(參數、大小寫、尾斜線) canonical + 統一內部連結
轉址鏈 A→B→C 連環 301 全部改成一步直達
軟 404 空頁面回 200 真的沒內容就回 404/410

怎麼觀察自己的爬取狀況?GSC 兩個地方

  1. 設定 → 檢索統計資料(Crawl stats):看每日檢索要求數、平均回應時間、依回應與檔案類型的分布。健康的站:回應時間穩定(建議 < 600ms)、5xx 比例趨近 0、爬取量沒有無故暴跌。
  2. 索引 → 網頁:「Discovered - currently not indexed」數量持續增加,是爬取需求不足最直接的警訊;「Crawled - currently not indexed」多,則是爬了但品質不過關。兩個狀態的完整判讀見〈GSC 三個地方揪出內容負債〉。

提升爬取效率的五件事(依 CP 值排序)

  1. 清內容負債:讓站上大部分頁面都是有人要的頁面——直接拉高爬取需求。
  2. 內部連結灌對地方:重要頁面從高權重頁可達,三次點擊內到得了。
  3. sitemap 只放要收錄的 URL:sitemap 是「你希望 Google 爬什麼」的宣言,別把 noindex 頁、轉址頁塞進去;lastmod 要誠實。
  4. 伺服器回應快:這同時是 CWV 與爬取容量的地基。
  5. 正確使用 robots.txt:擋掉參數陷阱與無限空間。注意 robots.txt 是「不要爬」不是「不要收錄」——要移出索引用 noindex 或刪頁。

2026 加映:AI 爬蟲也在花你的頻寬

GPTBot(OpenAI)、PerplexityBot、Google-Extended 等 AI 爬蟲的流量近年顯著成長。它們不影響 Google 的 crawl budget(各家獨立),但共享你的伺服器資源。想被 AI 引用就別擋它們;伺服器吃緊時,優先用快取與 CDN 解決,而不是封鎖。

常見問題(FAQ)

Q1:我的部落格只有 200 頁,可以完全忽略 crawl budget 嗎? 機制層面可以——你的額度用不完。但「別讓低品質頁稀釋整站評價」這件事和規模無關;200 頁裡有 120 頁是空殼,傷的是品質評估,症狀一樣是收錄變慢。

Q2:怎麼讓新文章更快被收錄? 發布後從首頁或高流量舊文加內部連結、把 URL 加進 sitemap 並更新 lastmod、用 GSC 網址檢查工具的「要求建立索引」。三件一起做,多數健康網站 24–72 小時內收錄。

Q3:爬取頻率突然暴跌是怎麼回事? 先查伺服器:是不是出現大量 5xx、回應時間飆高、或防火牆/CDN 誤擋 Googlebot。技術正常的話,再看是否近期大量新增低品質頁面拉低了爬取需求。

Q4:crawl budget 和排名有直接關係嗎? 沒有直接關係——爬得多不等於排得好。它影響的是「內容多快被發現與更新」;排名還是看內容品質與相關性。


GeoSeoToday處理爬取問題的順序永遠是:先清內容負債、再修內部連結、最後才調技術參數——因為需求端的問題佔了八成。想知道你的內容夠不夠格讓 Google 與 AI 願意花資源,可用 GEO 就緒度檢測器 自查,或從〈On-page & 技術 SEO 完整指南〉看整套方法。