跳至主要內容
SPCXTools

Robots.txt 產生器

產生並下載自訂的 robots.txt 檔案,輕鬆控制搜尋引擎爬蟲並封鎖 AI 機器人。

本機執行 — 檔案絕不會離開您的裝置

正在載入工具…

如何使用 Robots.txt 產生器

  1. 1選擇預設政策,允許或禁止所有搜尋引擎爬取您的網站。
  2. 2為特定的 User-Agent 和路徑加入自訂規則(例如:禁止存取 /admin/ 或 /private/)。
  3. 3設定爬取延遲(選填),防止過度頻繁的機器人導致伺服器過載。
  4. 4勾選「封鎖 AI 爬蟲」選項,立即加入規則以防止常見的 AI 機器人抓取您的內容。
  5. 5輸入您的 Sitemap 網址,然後複製產生的程式碼,或直接將檔案下載到您的裝置。

快速且注重隱私的 robots.txt 產生器

管理搜尋引擎與網路爬蟲如何與您的網站互動,對於 SEO 及伺服器效能至關重要。這款 robots.txt 產生器提供視覺化介面,讓您輕鬆建立、管理與匯出網站的爬蟲指令,無需手動編寫語法。

由於本工具完全在您的瀏覽器內運作,您的網站架構、私人路徑與設定將保持絕對機密。您在產生器中輸入的任何內容都不會傳送至伺服器。您將獲得即時更新的輸出結果,並可立即複製或下載。

主要功能與特色

預設存取策略: 首先為所有機器人設定基本行為。您可以選擇允許所有存取(多數公開網站的標準作法),或封鎖所有存取(適用於測試環境或私人網路)。

自訂指令: 針對特定機器人或路徑新增專屬規則。您可以封鎖所有爬蟲存取 /admin/ 或 /search 等敏感目錄,同時允許特定機器人存取某些檔案。

封鎖 AI 爬蟲: 隨著大型語言模型的興起,許多網站擁有者不希望其內容被抓取用於 AI 訓練。本工具包含專門封鎖 AI 爬蟲的 robots.txt 規則功能。只需勾選單一選項,即可立即為最常見的 AI 機器人(包含 GPTBot、ClaudeBot、PerplexityBot、Google-Extended、Applebot-Extended 及 Bytespider)加入 Disallow: / 指令。

抓取延遲: 如果您的伺服器難以負荷自動化機器人帶來的大量流量,您可以設定抓取延遲。這會輸出 Crawl-delay 指令,指示機器人在每次請求之間等待指定的秒數。

Sitemap 整合: 在 robots.txt 中加入 sitemap 指令,是告訴搜尋引擎 XML sitemap 位置最有效率的方式。您可以貼上多個 sitemap 網址(一行一個),本工具會將其正確格式化並附加到檔案底部。

如何有效建立 robots.txt 檔案

在建立 robots.txt 檔案時,了解爬蟲如何讀取指令非常重要。檔案會分為多個區塊,每個區塊皆以 User-agent 宣告開頭,接著是適用於該爬蟲的規則。

  1. 指定 User-agent: User-agent 是機器人的名稱。使用星號 (*) 可將規則套用至所有機器人。如果您想專門針對 Google 的圖片爬蟲,可以使用 Googlebot-Image。
  2. 定義路徑: 路徑是相對於網域根目錄的相對路徑,且必須以正斜線 (/) 開頭。若要封鎖整個目錄,請加上結尾斜線 (例如 /private/)。若要封鎖特定檔案,請包含副檔名 (例如 /data.csv)。
  3. 優先順序: 大多數現代爬蟲會尋找與其名稱相符且最明確的 User-agent 區塊。如果 Googlebot 造訪您的網站,它會遵循 User-agent: Googlebot 下的特定規則,並忽略 User-agent: * 區塊。本產生器會自動依 User-agent 整理您的規則,確保輸出的內容整潔且有效。

了解其限制

雖然 robots.txt 檔案產生器讓編寫語法變得簡單,但了解這個檔案無法做到的事也非常重要。

它不是安全防護措施。 在 robots.txt 檔案中設定禁止抓取的路徑,只能告訴正規的爬蟲程式不要抓取該網頁,但惡意爬蟲會完全忽略這個檔案。此外,任何人都能透過瀏覽器直接查看你的 robots.txt 檔案,這代表你等於在公開暴露隱藏目錄的位置。若要確保真正的安全,請使用正確的身分驗證機制與合適的 HTTP 狀態碼,例如 401 Unauthorized 或 403 Forbidden。

它無法保證網頁不被索引。 如果網頁在 robots.txt 中被設定為禁止抓取,Google 就不會去爬取它。然而,如果網路上其他地方有連結指向該網頁,Google 仍可能會將該網址建立索引(通常會顯示「沒有這個網頁的資訊」之類的訊息)。如果你的目的是將網頁從搜尋結果中完全移除,你應該在 robots.txt 中允許抓取,並改為使用 noindex HTML 標籤。你可以使用我們的 Meta 標籤產生器 來產生正確的標籤。

部署與測試

設定好規則後,點擊下載以儲存檔案。檔案必須命名為 robots.txt(全小寫),並上傳到您網域的根目錄。例如:https://yourdomain.com/robots.txt。如果您將它放在子資料夾中,例如 https://yourdomain.com/assets/robots.txt,爬蟲程式會找不到該檔案,並假設您沒有設定任何限制。

常見問題

什麼是 robots.txt 檔案?
robots.txt 是一個放在網站根目錄的純文字檔。它會向網路爬蟲(例如 Googlebot)提供指示,告知它們可以或不能抓取您網站上的哪些頁面或檔案。
如何封鎖 AI 爬蟲?
勾選此工具的「封鎖 AI」選項,會自動加入規則來阻擋已知的 AI 資料抓取程式(包含 GPTBot、ChatGPT-User、ClaudeBot、PerplexityBot、Google-Extended 等)。這會指示這些爬蟲不要使用您的網站內容來訓練大型語言模型。
抓取延遲的作用是什麼?
抓取延遲 (Crawl delay) 指令會告訴爬蟲在連續發送請求到您的伺服器之間,應該等待多少秒。如果某些爬蟲過度消耗頻寬或拖慢網站速度,這項設定就非常實用。請注意,並非所有搜尋引擎(例如 Google)都會遵守此指令,但仍有許多搜尋引擎會遵循。
robots.txt 檔案應該放在哪裡?
必須放在網站的最上層根目錄。舉例來說,如果您的網域是 example.com,這個檔案的正確存取路徑必須是 https://example.com/robots.txt。如果放在子目錄中,爬蟲會找不到該檔案。
使用此工具時,我的網站資料會被傳送到伺服器嗎?
不會。這個 robots.txt 產生器完全在您的瀏覽器中本機執行。您的規則、路徑和 Sitemap 網址絕對不會被上傳或儲存到我們的伺服器上。
robots.txt 會將我的網頁從搜尋結果中隱藏嗎?
不一定。雖然它可以阻止搜尋引擎抓取網頁內容,但如果有其他網站連結到該網址,它可能還是會出現在搜尋結果中。若要將網頁從搜尋索引中完全移除,您應該改用 "noindex" meta 標記。