哪些網站封鎖 AI 爬蟲?28 個網域的存取基準測試
我們抓取了 28 個知名網域的 robots.txt 與 llms.txt,使用 PilotCite 自身的群組感知解析器測試五隻 AI 爬蟲——GPTBot、ClaudeBot、PerplexityBot、Google-Extended、Bingbot。28 個網域中有 9 個至少封鎖一隻爬蟲;Reddit 封鎖了全部五隻。只有 11 個網域發布了 llms.txt。完整結果表、方法論與限制說明如下。你可以用免費 AI 能見度檢測工具在自己的網站上跑同樣的檢查。
AI 能見度始於一個比多數團隊以為的更簡單的問題:爬蟲到底能不能讀到這個頁面?如果 robots.txt 封鎖了 GPTBot,那麼不管內容優化做得多好,ChatGPT 都不會引用那個網域——因為頁面根本沒進入候選池。這份基準測試把 PilotCite 在免費檢測工具裡使用的同一套解析器,套用到 28 個公開網域上,因此結果可以用任何人都能在自己網址上執行的同一個工具重現。
這份測試測了什麼
觀測日期:2026-07-31。樣本:28 個網域,涵蓋六個類別——AI 公司、大型 SaaS、媒體出版商、電商、社群平台、參考網站。完整網域清單見下方結果表,已完整公開,任何人都可以重新跑這項測試。
每個網域都透過 HTTPS 抓取兩個檔案:/robots.txt 和 /llms.txt。接著將 robots.txt 解析為按使用者代理(user-agent)分組的規則——不是字串搜尋。一隻爬蟲只有在它自己的具名群組或萬用群組(*)禁止根路徑(/)且沒有覆寫的允許規則時,才算被封鎖。這與 PilotCite 的網站稽核檢查中實作的邏輯完全相同:測試五個具名代理,每個都獨立評估適用於它的規則。
測試的五隻爬蟲是檢測工具目前涵蓋的:
- GPTBot — OpenAI 的爬蟲,供 ChatGPT 搜尋與瀏覽使用
- ClaudeBot — Anthropic 的爬蟲,供 Claude 使用
- PerplexityBot — Perplexity 的爬蟲
- Google-Extended — 控制 Google 是否能將抓取的內容用於 AI 訓練與 AI Overviews
- Bingbot — Microsoft 的爬蟲,供 Bing 與 Copilot 使用
結果:哪些網域封鎖了哪些爬蟲
下表列出樣本中的每個網域。✓ 表示爬蟲被允許;✗ 表示 robots.txt 封鎖了整個網站。llms.txt 欄顯示該網域是否發布了此檔案。
| 網域 | GPTBot | ClaudeBot | PerplexityBot | Google-Extended | Bingbot | llms.txt |
|---|---|---|---|---|---|---|
| reddit.com | ✗ | ✗ | ✗ | ✗ | ✗ | 否 |
| amazon.com | ✗ | ✗ | ✗ | ✗ | ✓ | 否 |
| nytimes.com | ✗ | ✗ | ✗ | ✗ | ✓ | 否 |
| x.com | ✗ | ✗ | ✗ | ✓ | ✓ | 是 |
| figma.com | ✗ | ✓ | ✗ | ✗ | ✓ | 否 |
| techcrunch.com | ✗ | ✗ | ✓ | ✗ | ✓ | 否 |
| wired.com | ✓ | ✗ | ✗ | ✗ | ✓ | 否 |
| theguardian.com | ✓ | ✗ | ✗ | ✓ | ✓ | 否 |
| medium.com | ✗ | ✗ | ✓ | ✓ | ✓ | 否 |
| openai.com | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| anthropic.com | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| perplexity.ai | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| huggingface.co | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| stripe.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| shopify.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| vercel.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| cloudflare.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| notion.so | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| github.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| linear.app | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| supabase.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| linkedin.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
| wikipedia.org | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| airtable.com | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| stability.ai | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| midjourney.com | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| stackoverflow.com | ✓ | ✓ | ✓ | ✓ | ✓ | 否 |
| pilotcite.com | ✓ | ✓ | ✓ | ✓ | ✓ | 是 |
哪些爬蟲最常被封鎖
Bingbot 幾乎被所有網域允許——28 個網域中只有 Reddit 封鎖了它。四隻 AI 專用爬蟲的封鎖率明顯更高:
| 爬蟲 | 允許 | 封鎖 | 封鎖率 |
|---|---|---|---|
| Bingbot | 27 | 1 | 4% |
| Google-Extended | 22 | 6 | 21% |
| GPTBot | 21 | 7 | 25% |
| PerplexityBot | 21 | 7 | 25% |
| ClaudeBot | 20 | 8 | 29% |
這個模式與每隻爬蟲的用途一致。Bingbot 服務的是通用搜尋引擎,多數網站希望出現在其中,因此封鎖它很罕見。Google-Extended 的封鎖率略低於三隻 AI 新創爬蟲,可能是因為有些網站會區分「出現在 Google 搜尋結果」(此時功能等同 Bingbot 的 Googlebot 通常仍然被允許)和「貢獻給 AI 訓練」這兩件事。三隻純 AI 爬蟲——GPTBot、ClaudeBot、PerplexityBot——背負著最高的封鎖率,反映了關於 AI 公司是否應該在未經補償的情況下使用出版商內容進行訓練或呈現的持續爭論。
一個值得注意的不一致現象:有些網域封鎖了部分 AI 爬蟲但允許其他。The Guardian 封鎖了 ClaudeBot 和 PerplexityBot 但允許 GPTBot。Medium 封鎖了 GPTBot 和 ClaudeBot 但允許 PerplexityBot。這些分歧表明封鎖決策通常是根據個別談判或政策立場逐隻爬蟲做出的,而非「全面拒絕 AI」的一刀切立場。
llms.txt 採用率仍然偏低
llms.txt 慣例是一個新興標準,網站透過發布一個純文字檔案,將 AI 系統指向它們最容易被引用的頁面。在這個樣本中,只有 11 個網域(約 39%)提供了此檔案——採用者偏向開發者工具公司(Stripe、Shopify、Vercel、Cloudflare、Notion、GitHub、Linear、Supabase),而非媒體出版商,後者沒有任何一家發布。
對於一個仍在早期採用階段的慣例來說,這並不意外,但它很重要:一個網站如果在 robots.txt 中封鎖 AI 爬蟲、同時又沒有 llms.txt,等於做了完全退出 AI 答案的選擇。一個允許爬蟲但沒有 llms.txt 的網站,則是把內容發現交給了運氣。
這對 AI 能見度意味著什麼
實際的結論是:爬蟲存取是一道位於所有其他 AI 能見度工作之下的二進位閘門。如果你的 robots.txt 封鎖了 GPTBot,ChatGPT 就不會引用你的頁面——不論你的內容結構有多好、你的實體一致性有多強,或有多少其他網站連向你。修復存取是成本最低的能見度改善,因為它不花錢,而且能解鎖下游所有工作。
數據中出現了三個值得對照自己網站檢查的模式:
- 無意的萬用封鎖。 robots.txt 中對
User-agent: *設定Disallow: /會封鎖每一隻沒有自己具名群組的爬蟲。如果你為了某隻特定爬蟲加了這條規則、卻忘了它也適用於萬用群組,你可能封鎖了比預期更多的代理。 - 不一致的逐隻政策。 樣本中有幾個網域允許某些 AI 爬蟲但封鎖其他。如果你的團隊決定允許 GPTBot,但 robots.txt 是在 ClaudeBot 出現之前寫的,較新的爬蟲可能落入了限制性的萬用規則。
- 開放網站缺少 llms.txt。 允許爬蟲但不發布 llms.txt,意味著 AI 系統能找到你的頁面,但沒有一個經過策展的指標指向你最重要的內容。加上一個只需要幾分鐘。
如何檢查你自己的網站
免費 AI 能見度檢測工具在輸入任何網址後,會執行與這份基準測試相同的解析器。它測試全部五隻爬蟲、檢查 llms.txt,同時也審查可擷取性(JavaScript 障礙、標題結構、結構化資料)和身分標記(Organization 標記)。不需要註冊——輸入一個網址,得到一份優先修復清單。
要了解 AI 平台是否真的提及和引用你的品牌——而不僅是它們能否爬取你的網站——PilotCite 監測會按排程在八個 AI 平台上執行真實提示詞,並長期追蹤提及、引用、競爭對手和來源。
限制說明
這份基準測試只檢驗了 AI 能見度的一個二進位維度:爬蟲能不能抓取頁面?它不測量爬蟲是否實際造訪了頁面、頁面對 AI 系統如何呈現,或內容是否贏得了引用。一個允許全部五隻爬蟲的網域,仍然可能在 AI 答案中完全消失——因為內容不相關、不具權威性,或結構上無法被擷取。完整的圖像需要監測實際的 AI 答案,而不只是檢查爬蟲權限。
樣本是為了類別多樣性而挑選的 28 個網域,不具統計代表性。robots.txt 規則於 2026-07-31 抓取一次,此後可能已變更。對於 robots.txt 回傳非 200 狀態碼的網域(midjourney.com 回傳 HTTP 403,stackoverflow.com 回傳 HTTP 418),因為未找到封鎖規則而視為「全部允許」——但缺少 robots.txt 與存在一份允許的 robots.txt 是不同的。
- 28 個受測網域中有 9 個至少封鎖一隻 AI 爬蟲;Reddit 封鎖了全部五隻。
- ClaudeBot 是最常被封鎖的爬蟲(28 個中 8 個),其次是 GPTBot 與 PerplexityBot(各 7 個)、Google-Extended(6 個)、Bingbot(1 個)。
- 只有 11 個網域發布了 llms.txt;採用者偏向開發者工具公司,而非媒體出版商。
- 有些網域封鎖了部分 AI 爬蟲但允許其他,顯示封鎖決策是逐隻爬蟲做出的,而非一刀切的立場。
- 爬蟲存取是位於所有其他 AI 能見度工作之下的二進位閘門——如果 robots.txt 封鎖了代理,任何內容優化都無法補償。
常見問題
這表示爬蟲無法抓取頁面來建立索引。對於來自訓練的答案,如果頁面在封鎖規則加入前已被抓取、或 AI 模型從其他來源學到了它,仍然可能出現。對於即時檢索的答案,被封鎖的爬蟲通常意味頁面不會被引用。實際效果取決於每個 AI 平台如何建立答案。
robots.txt 規則是按使用者代理個別設定的。網站根據談判、授權條款或對特定 AI 公司的政策立場,做出個別決定。並沒有要求必須對所有 AI 爬蟲一視同仁。
不是。它是一個新興慣例,幫助 AI 系統找到你最容易被引用的頁面,但不是必要的,也不是所有 AI 平台都會讀取它。在 robots.txt 中允許相關爬蟲才是必要條件;llms.txt 是加分項。
經常改變。大型出版商和平台隨著 AI 環境演進已多次更新 robots.txt 規則。這份快照反映 2026-07-31 的狀態,應視為一個時間點的觀測,而非永久不變的結論。
可以。pilotcite.com/tools/ai-visibility-checker 的免費 AI 能見度檢測工具會在你輸入的任何網址上執行相同的解析器,不需註冊。它還會檢查爬蟲存取之外的可擷取性和身分標記。
