← 返回文章列表
ii. 技術 SEO 觀察與策略

改版後 robots.txt 與 sitemap 檢查:索引訊號不要互相打架

免費seo顧問學習小教室 2026-08-20
抽象路徑與地圖色塊,畫面沒有文字。

文章摘要

改版後核對 robots.txt、sitemap 與後台索引設定是否一致,並說明這不能保證搜尋排名。

改版後 robots.txt 與 sitemap 檢查:索引訊號不要互相打架

為什麼改版後必須同步檢視這三者?

網站改版時,URL 結構、後台設定、靜態資源路徑往往全面調整。若未同步更新 robots.txtsitemap.xml 及 WordPress 或 CMS 後台的「搜尋引擎索引設定」(如 Yoast SEO 的「noindex」勾選、Rank Math 的「Advanced」索引控制),將導致搜尋引擎收到矛盾訊號。例如:sitemap 列出某頁面,但 robots.txt 卻用 Disallow: /blog/ 擋住整段路徑;或後台設為 noindex,sitemap 卻仍包含該頁——這些衝突不會立即報錯,但會拖慢 Googlebot 的爬行效率,延遲內容重新被發現與索引。須特別注意:這類技術校準不保證搜尋排名提升,亦不影響自然流量成長速度。它僅是避免人為錯誤阻礙既有內容被正常處理的基本功。

robots.txt 常見誤擋情境與驗證步驟

改版後最易忽略的是 robots.txt 中過度寬鬆或過度嚴格的規則。例如:原站使用 Disallow: /wp-admin/ 合理,但新版靜態生成器部署於 /dist/,卻誤加 Disallow: /dist/,導致所有前端 HTML 檔案無法被抓取;又或因複製舊設定,遺留 Disallow: /category/,而新版已取消分類頁、改用標籤導航,此規則反而擋住新結構中實際存在的關鍵頁面。驗證方式包括:以 Google Search Console 的「robots.txt 測試工具」逐條模擬 User-agent(尤其 GooglebotGooglebot-Image);比對原始 robots.txt 檔案與改版前備份;確認伺服器回應狀態碼為 200 OK 且無重定向。請務必記住:robots.txt 不具強制力,僅為建議性協議;它無法防止內容被索引,僅能限制抓取——若頁面已被其他網站連結,仍可能被索引。相關操作細節可參閱Google 官方 robots.txt 導讀

sitemap 內容品質與多份檔案一致性檢查

新版常見陷阱是保留舊 sitemap(如 sitemap_index.xml 引用已失效的 post-sitemap.xml),或自動產生工具誤將 301 跳轉頁、404 頁、後台管理頁、測試頁(如 /staging/)一併納入。須執行三項動作:第一,確認所有 sitemap 中的 <loc> URL 回傳 200 且非 noindex;第二,比對各份 sitemap(如 page-sitemap.xmlproduct-sitemap.xml)是否重複收錄相同 URL,或彼此排除關鍵分類;第三,檢查 sitemap 中是否混入 lastmod 時間錯誤(如早於建站日)、changefreq 設定失真(如對靜態政策頁標註 hourly)。若使用多語言站點,更需確認 hreflang 對應 sitemap 是否獨立提交且無交叉引用。這一切校正工作,目的在維持索引訊號純淨,不保證搜尋排名上升,亦不縮短 Google 重新評估週期

Search Console 提交的 sitemap 是否為最新有效版本?

GSC 中「索引 > Sitemaps」頁面所列的 sitemap URL,未必等同於實際生效版本。常見疏失包括:提交了開發環境網址(如 https://dev.pingbaidesign.com/sitemap.xml)、忘記刪除已停用的舊 sitemap(如 https://pingbaidesign.com/sitemap_old.xml)、或誤將壓縮檔 sitemap.xml.gz 當作主檔提交卻未配置伺服器解壓支援。正確做法是:登入 GSC → 左側選單點「索引」→ 「Sitemaps」→ 核對每筆提交狀態是否為「成功」且「最後讀取時間」在改版後 48 小時內;點擊該 sitemap 進入細節頁,查看「已提交」與「已索引」數量差距;若差距超過 15%,須立即下載原始 XML 檔並人工抽樣驗證。同時,請確認 robots.txtSitemap: 指令指向的 URL,與 GSC 提交的完全一致。此步驟屬技術基礎建設,不保證搜尋曝光增加,亦不影響關鍵字排名位置

交付清單:robots 原文備份、sitemap URL 抽樣、noindex 與 disallow 對照表

正式交付包含三項實質產出:其一,robots.txt 改版前後完整原文(含時間戳與部署人員簽核);其二,針對主 sitemap 抽樣 200 筆 URL,逐一記錄 HTTP 狀態碼、X-Robots-Tagmeta name="robots" 實際值、是否被 robots.txt disallow;其三,製作「noindex 與 disallow 對照表」,橫軸為頁面類型(首頁、產品頁、部落格列表、個別文章、404 替代頁),縱軸為三種控制層級(後台設定、HTML meta、robots.txt),標示是否一致。此清單非黑箱演算法,而是可審計、可回溯的技術紀錄。過程中所有判斷均依循Google 索引封鎖指引,並與技術 SEO 健康檢查流程緊密銜接。

常見問題(FAQ)

Q1:robots.txt 擋住某頁,但該頁有外部高權重連結,它還會被索引嗎?

A1:有可能。robots.txt 僅限制抓取,不阻止索引。若其他網站大量連結該頁,Google 可能基於連結文字與錨點資訊建立索引條目,但內容摘要將為空或極簡。此時頁面雖出現在搜尋結果,卻無法展開詳情,實際效益極低。因此,不應仰賴外部連結彌補 robots.txt 錯誤,而應修正規則本身。

Q2:我已提交新版 sitemap,為何 Search Console 顯示「已索引」數量未變?

A2:sitemap 提交僅是「告知」工具,非即時指令。Google 會依自身爬行排程重新處理,通常需 3–10 個工作天。若超過兩週仍未更新,應優先檢查該 sitemap 是否含大量 404、是否被 robots.txt 擋住、或是否存在伺服器頻寬限制導致部分 URL 抓取逾時。請參閱GSC 覆蓋率 404 盤點指南進行交叉驗證。

結構化資料對照表

項目 robots.txt sitemap.xml 後台 noindex 設定
控制目標 限制爬蟲抓取路徑 主動告知重要 URL 明確要求不索引單頁
生效範圍 全站所有符合 User-agent 的爬蟲 僅限提交的 URL 清單 僅限該頁面 HTML 層級
衝突優先權 若 disallow 與 sitemap 同時存在,Google 通常尊重 disallow sitemap 中 noindex 頁仍可能被索引(若被外鏈) noindex meta 優先於 sitemap 列出行為

參考資料與延伸閱讀

編輯方士軒依公開法規與 Google 官方文件整理,非執業律師、非法律意見;本內容不提供徵信服務,亦不涉及任何非法蒐證、系統入侵或規避技術之教導。所有建議均基於可公開取得之技術文件與實務經驗,不保證搜尋排名、流量成長或商業成交結果。

作者:方士軒|延伸查看:LinkedInGitHub

先做網站健檢,再決定優化方向

不承諾保證排名。由屏柏企業 SEO 顧問與網頁工程師方士軒 mars 協助您評估網站速度、行動版可用性、SEO 關鍵字結構與內容層級問題。

「SEO 是長期優化,不承諾保證排名。」
LINE 諮詢
立即撥打電話 LINE 諮詢 SEO 返回列表