快速且注重隱私的 robots.txt 產生器
管理搜尋引擎與網路爬蟲如何與您的網站互動,對於 SEO 及伺服器效能至關重要。這款 robots.txt 產生器提供視覺化介面,讓您輕鬆建立、管理與匯出網站的爬蟲指令,無需手動編寫語法。
由於本工具完全在您的瀏覽器內運作,您的網站架構、私人路徑與設定將保持絕對機密。您在產生器中輸入的任何內容都不會傳送至伺服器。您將獲得即時更新的輸出結果,並可立即複製或下載。
主要功能與特色
預設存取策略: 首先為所有機器人設定基本行為。您可以選擇允許所有存取(多數公開網站的標準作法),或封鎖所有存取(適用於測試環境或私人網路)。
自訂指令: 針對特定機器人或路徑新增專屬規則。您可以封鎖所有爬蟲存取 /admin/ 或 /search 等敏感目錄,同時允許特定機器人存取某些檔案。
封鎖 AI 爬蟲: 隨著大型語言模型的興起,許多網站擁有者不希望其內容被抓取用於 AI 訓練。本工具包含專門封鎖 AI 爬蟲的 robots.txt 規則功能。只需勾選單一選項,即可立即為最常見的 AI 機器人(包含 GPTBot、ClaudeBot、PerplexityBot、Google-Extended、Applebot-Extended 及 Bytespider)加入 Disallow: / 指令。
抓取延遲: 如果您的伺服器難以負荷自動化機器人帶來的大量流量,您可以設定抓取延遲。這會輸出 Crawl-delay 指令,指示機器人在每次請求之間等待指定的秒數。
Sitemap 整合: 在 robots.txt 中加入 sitemap 指令,是告訴搜尋引擎 XML sitemap 位置最有效率的方式。您可以貼上多個 sitemap 網址(一行一個),本工具會將其正確格式化並附加到檔案底部。
如何有效建立 robots.txt 檔案
在建立 robots.txt 檔案時,了解爬蟲如何讀取指令非常重要。檔案會分為多個區塊,每個區塊皆以 User-agent 宣告開頭,接著是適用於該爬蟲的規則。
- 指定 User-agent: User-agent 是機器人的名稱。使用星號 (
*) 可將規則套用至所有機器人。如果您想專門針對 Google 的圖片爬蟲,可以使用Googlebot-Image。 - 定義路徑: 路徑是相對於網域根目錄的相對路徑,且必須以正斜線 (
/) 開頭。若要封鎖整個目錄,請加上結尾斜線 (例如/private/)。若要封鎖特定檔案,請包含副檔名 (例如/data.csv)。 - 優先順序: 大多數現代爬蟲會尋找與其名稱相符且最明確的 User-agent 區塊。如果 Googlebot 造訪您的網站,它會遵循
User-agent: Googlebot下的特定規則,並忽略User-agent: *區塊。本產生器會自動依 User-agent 整理您的規則,確保輸出的內容整潔且有效。
了解其限制
雖然 robots.txt 檔案產生器讓編寫語法變得簡單,但了解這個檔案無法做到的事也非常重要。
它不是安全防護措施。 在 robots.txt 檔案中設定禁止抓取的路徑,只能告訴正規的爬蟲程式不要抓取該網頁,但惡意爬蟲會完全忽略這個檔案。此外,任何人都能透過瀏覽器直接查看你的 robots.txt 檔案,這代表你等於在公開暴露隱藏目錄的位置。若要確保真正的安全,請使用正確的身分驗證機制與合適的 HTTP 狀態碼,例如 401 Unauthorized 或 403 Forbidden。
它無法保證網頁不被索引。 如果網頁在 robots.txt 中被設定為禁止抓取,Google 就不會去爬取它。然而,如果網路上其他地方有連結指向該網頁,Google 仍可能會將該網址建立索引(通常會顯示「沒有這個網頁的資訊」之類的訊息)。如果你的目的是將網頁從搜尋結果中完全移除,你應該在 robots.txt 中允許抓取,並改為使用 noindex HTML 標籤。你可以使用我們的 Meta 標籤產生器 來產生正確的標籤。
部署與測試
設定好規則後,點擊下載以儲存檔案。檔案必須命名為 robots.txt(全小寫),並上傳到您網域的根目錄。例如:https://yourdomain.com/robots.txt。如果您將它放在子資料夾中,例如 https://yourdomain.com/assets/robots.txt,爬蟲程式會找不到該檔案,並假設您沒有設定任何限制。