
crawl budget 是什麼?小網站要在意嗎
crawl budget(爬取預算)是 Googlebot 分配給你網站的爬取資源總量,由「爬取容量上限」(你的伺服器撐得住多少)與「爬取需求」(Google 覺得你的內容多值得爬)兩者共同決定。 Google 官方明講:幾千頁以下、內容當天就被收錄的網站,多數時候不需要擔心 crawl budget——但「低價值頁面浪費爬取資源」的邏輯,對任何規模的站都成立。
兩個變數怎麼運作?
Google Search Central 的官方文件把 crawl budget 拆成兩塊:
- 爬取容量上限(crawl capacity limit):Googlebot 不想爬垮你的伺服器。回應快、錯誤少 → 上限提高;大量 5xx 錯誤或回應變慢 → Googlebot 自動退避、爬得更少。
- 爬取需求(crawl demand):Google 對你內容的興趣。頁面越熱門(外鏈、點擊)、更新越頻繁、整站品質越高 → 需求越高。反之,一堆沒人看的重複頁會拉低需求。
兩者取交集就是你實際的爬取預算。重點:預算不是固定配給,而是 Google 對你網站的即時評價——它會隨你的品質與伺服器表現上下浮動。
Google 官方的適用門檻
依官方文件,真正需要管理 crawl budget 的是:
- 大型網站(100 萬頁以上)且內容每週更新;
- 中型網站(1 萬頁以上)且內容每天大量變動;
- 或 GSC 顯示**大量「Discovered - currently not indexed」**的網站——這代表 Google 知道頁面存在但不願意花資源爬。
幾百頁的部落格不在名單上。但注意最後一條:小站也可能因為品質問題出現爬不動的症狀,這時問題不是預算太少,而是需求太低。
小網站真正該在意的:別浪費 Google 給的額度
小站的爬取額度綽綽有餘,前提是別自己糟蹋。常見的浪費源:
| 浪費源 | 例子 | 修法 |
|---|---|---|
| 內容負債 | 90 天 0 點擊的空殼頁佔掉爬取輪次 | 合併/移除/補料,見〈內容負債是什麼〉 |
| 無限 URL 空間 | 篩選參數、日曆頁、站內搜尋結果頁被爬 | robots.txt 擋掉參數路徑 |
| 重複內容 | 同頁多網址(參數、大小寫、尾斜線) | canonical + 統一內部連結 |
| 轉址鏈 | A→B→C 連環 301 | 全部改成一步直達 |
| 軟 404 | 空頁面回 200 | 真的沒內容就回 404/410 |
怎麼觀察自己的爬取狀況?GSC 兩個地方
- 設定 → 檢索統計資料(Crawl stats):看每日檢索要求數、平均回應時間、依回應與檔案類型的分布。健康的站:回應時間穩定(建議 < 600ms)、5xx 比例趨近 0、爬取量沒有無故暴跌。
- 索引 → 網頁:「Discovered - currently not indexed」數量持續增加,是爬取需求不足最直接的警訊;「Crawled - currently not indexed」多,則是爬了但品質不過關。兩個狀態的完整判讀見〈GSC 三個地方揪出內容負債〉。
提升爬取效率的五件事(依 CP 值排序)
- 清內容負債:讓站上大部分頁面都是有人要的頁面——直接拉高爬取需求。
- 內部連結灌對地方:重要頁面從高權重頁可達,三次點擊內到得了。
- sitemap 只放要收錄的 URL:sitemap 是「你希望 Google 爬什麼」的宣言,別把 noindex 頁、轉址頁塞進去;
lastmod要誠實。 - 伺服器回應快:這同時是 CWV 與爬取容量的地基。
- 正確使用 robots.txt:擋掉參數陷阱與無限空間。注意 robots.txt 是「不要爬」不是「不要收錄」——要移出索引用 noindex 或刪頁。
2026 加映:AI 爬蟲也在花你的頻寬
GPTBot(OpenAI)、PerplexityBot、Google-Extended 等 AI 爬蟲的流量近年顯著成長。它們不影響 Google 的 crawl budget(各家獨立),但共享你的伺服器資源。想被 AI 引用就別擋它們;伺服器吃緊時,優先用快取與 CDN 解決,而不是封鎖。
常見問題(FAQ)
Q1:我的部落格只有 200 頁,可以完全忽略 crawl budget 嗎? 機制層面可以——你的額度用不完。但「別讓低品質頁稀釋整站評價」這件事和規模無關;200 頁裡有 120 頁是空殼,傷的是品質評估,症狀一樣是收錄變慢。
Q2:怎麼讓新文章更快被收錄? 發布後從首頁或高流量舊文加內部連結、把 URL 加進 sitemap 並更新 lastmod、用 GSC 網址檢查工具的「要求建立索引」。三件一起做,多數健康網站 24–72 小時內收錄。
Q3:爬取頻率突然暴跌是怎麼回事? 先查伺服器:是不是出現大量 5xx、回應時間飆高、或防火牆/CDN 誤擋 Googlebot。技術正常的話,再看是否近期大量新增低品質頁面拉低了爬取需求。
Q4:crawl budget 和排名有直接關係嗎? 沒有直接關係——爬得多不等於排得好。它影響的是「內容多快被發現與更新」;排名還是看內容品質與相關性。
GeoSeoToday處理爬取問題的順序永遠是:先清內容負債、再修內部連結、最後才調技術參數——因為需求端的問題佔了八成。想知道你的內容夠不夠格讓 Google 與 AI 願意花資源,可用 GEO 就緒度檢測器 自查,或從〈On-page & 技術 SEO 完整指南〉看整套方法。