iGears logo
聯絡我們

最新消息 · 專題文章

2026 年的 robots.txt:為何封鎖 GPTBot、ClaudeBot 會讓 GEO 投資歸零

robots.txtAI crawlerGEOSEO

多年來企業網站的「被發現」幾乎等於被 Google 收錄。2026 年已不是這樣。潛在客戶愈來愈常先問 AI 助手「香港有沒有做私有化 AI 的公司」,而不是打開搜尋結果第十頁。那些助手要引用你,前提是它們的 crawler 真的讀得到你的頁面。robots.txt 寫 Disallow、Cloudflare 回 403、或把舊文章 301 到分類頁,看起來都像小設定,實際效果是把你從那條發現路徑上抹掉。

2026 年的 robots.txt:為何封鎖 GPTBot、ClaudeBot 會讓 GEO 投資歸零

搜尋排名與 AI 引用,不是同一件事

Googlebot 讀你的頁、建立索引、再依查詢排序。GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot、Google-Extended 與 Applebot-Extended 做的是另一件事:把可引用的事實帶進生成式答案。兩套系統都讀 robots.txt,但目的不同。只為 Google 優化、同時在 robots 或 WAF 擋住 AI crawler,等於你在為一個表面投資、卻主動退出另一個表面。GEO(generative engine optimisation)不是換關鍵字密度,而是確保引用系統拿得到、讀得懂、找得到來源頁。

robots.txt 是勸告;HTTP 403 是拒絕

遵守 robots.txt 的 bot 看到 Disallow 就會離開。不遵守的 bot 根本不理。對認真的 AI 搜尋 crawler 來說,Disallow 已經足夠讓你從引用庫消失。更嚴重的是邊緣 403:請求在到達你的 origin robots.txt 之前就被 CDN 擋下,body 往往只有 “Your request was blocked.” 這不是「請勿索引」,而是「這台主機不存在」。我們在稽核自己的網站時,三個香港語系主機(www / en / cn.igears.com.hk)對上述 AI bot 都回 200;作為 hreflang x-default 的 www.igears.net 卻在 Cloudflare 對 GPTBot、ChatGPT-User、OAI-SearchBot、ClaudeBot、Claude-User 與 PerplexityBot 回 403。同一套內容、同一個品牌,fallback 語系對最需要它的 crawler 是隱形的。

Cloudflare 的雙重開關

若網站前面有 Cloudflare,AI crawler 政策通常不在 nginx,而在儀表板的兩處,關一個留一個等於沒關。第一是 Security → Bots 的 Super Bot Fight Mode/「Block AI Scrapers and Crawlers」——這產生 403。第二是 managed robots.txt injection——Cloudflare 會在你 origin 的 robots.txt 前面插入一段 Disallow GPTBot、ClaudeBot、Google-Extended、Applebot-Extended 的內容。robots 規格裡,同一 user-agent 出現兩次時,不同解析器處理順序不一;OpenAI 的解析器不必跟 Google 一樣。一份自相矛盾的 robots.txt 本身就是風險。正確做法是 origin 寫清楚允許哪些 citation bot,並在儀表板關掉會覆蓋它的托管規則。Bytespider 這類沒有引用行為、或你明確不想出現的爬蟲,可以繼續在邊緣擋。

Bytespider 不是「西方 AI 垃圾爬蟲」這麼簡單

許多西方範本會建議一律 Disallow Bytespider,理由是頻寬。若你的受眾只在英語市場,這或許合理。我們同時營運 cn.igears.com.hk(簡體)與 www.igears.com.hk(繁體)。Bytespider 服務字節跳動,而豆包是中文市場使用量最高的助手之一。在簡體主機上封鎖它,等於在你專門建立的語系裡退出該引用表面。實務上我們的做法是:三個香港主機允許 Bytespider;資產/Global 主機 www.igears.net 維持封鎖;若日後流量變成問題,用限速而不是永久封禁——限速可逆,從引用庫消失往往不可逆。ImagesiftBot 這類只抓圖、沒有引用行為的爬蟲,則明確 Disallow。

舊文章 301 到分類頁,是在丟權重

另一個常被當成「整理完畢」的做法,是把 /news_details/某篇文章 301 到 /insights/。對 Google 來說,這是 soft 404:具體頁面的累積訊號被丟到一個通用索引,而不是傳到對等的新 URL。正確順序是:有對等新文就 301 到那一篇;沒有對等、也沒有流量就 410;仍有曝光的題目就重寫成新文章再 301。本文的前身是 /news_details/seo-robots-txt——它至今仍會因「igears robots.txt」類查詢出現。把這樣的 URL 410 或導去分類頁,是把還在工作的資產丟掉。

一份可維護的 robots.txt 長什麼樣子

預設 User-agent: * Allow: / 已經允許大多數 bot。在 GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、Claude-User、PerplexityBot、Google-Extended、Applebot、Applebot-Extended 下面再寫一行 Allow: /,看起來多餘,其實是文件:避免十八個月後有人為了「省頻寬」加一條總 Disallow。政策註解要有日期與負責人。Sitemap 必須是該 host 的絕對 URL。正式站的 /robots.txt 應由 nginx 明確 alias 到每台主機自己的檔案;docroot 裡不要留一份名叫 robots.txt、內容卻是 Disallow: / 的 staging 殘留——那份檔只靠一條 nginx location 解除武裝,拿掉 location 後全站會默默從索引消失。Staging 若需要封鎖,用另一個檔名(例如 robots.staging.txt)再用 alias 送出。

llms.txt 補的是「權威摘要」,不是取代頁面

llms.txt 是給助手看的精簡公司與方案清單。它必須跟網站一致,過期的 llms.txt 比沒有更糟,因為助手會把它當成官方說法。我們用 PHP 從同一套公司資料與頁面 registry 產生,並以 text/plain; charset=utf-8 輸出,避免不熟悉的 MIME 被下載而不被解析。它補充 robots、sitemap 與 JSON-LD,不取代任何一項。

想檢查網站有沒有被 AI crawler 擋住?

我們可協助檢查 robots.txt、CDN/WAF、舊網址導向與 llms.txt,讓搜尋與生成式引用都讀得到你真正想被引用的頁面。

延伸閱讀

相關文章