技術SEO稽核涵蓋9大類別:可爬取性、可索引性、安全性、URL結構、行動裝置、Core Web Vitals、結構化資料、JavaScript渲染與IndexNow協定。當使用者提到「技術SEO」、「爬取問題」、「robots.txt」、「Core Web Vitals」、「網站速度」或「安全性標頭」時使用。
技術SEO稽核
類別
1. 可爬取性
- robots.txt:存在、有效、未封鎖重要資源
- XML Sitemap:執行
claude-seo run sitemap_discovery.py <url> --json;需在found中有有效條目,並將過時或不安全的 robots.txt 宣告與正常運作的備用位置分開報告 - Noindex 標籤:有意 vs 無意
- 爬取深度:重要頁面應在首頁3次點擊內
- JavaScript 渲染:檢查關鍵內容是否需要 JS 執行
- 爬取預算:大型網站(>1萬頁)需注意效率
- Googlebot 擷取限制:Googlebot 擷取 HTML 的前 2MB 與 PDF 的前 64MB(未壓縮;15MB 是較廣泛的爬蟲基礎預設值)。這不是2026年的變更,但內嵌 base64 圖片、過大的內嵌 CSS/JS 或臃腫的導覽列可能將關鍵內容/JSON-LD 推至上限之外,導致無法收錄。請將關鍵內容與結構化資料維持在前2MB內。
- 爬取速率自動調整(遇到5xx/回應緩慢時會退避);沒有手動爬取速率控制(舊版 Search Console 設定已於2024年1月移除)。透過 Sitemap、伺服器回應性與 robots 控制來影響爬取。
- Google 的標準爬取/robots 參考文件已移至 developers.google.com/crawling(2025-11-20 遷移);IP 範圍檔案移至
/crawling/ipranges/,且googlebot.json已重新命名為common-crawlers.json。
AI 爬蟲管理
截至2025-2026年,AI 公司積極爬取網路以訓練模型並驅動 AI 搜尋。透過 robots.txt 管理這些爬蟲是關鍵的技術SEO考量。
已知 AI 爬蟲:
| 爬蟲 | 公司 | robots.txt token | 用途 |
|---|---|---|---|
| GPTBot | OpenAI | GPTBot |
模型訓練 |
| ChatGPT-User | OpenAI | ChatGPT-User |
即時瀏覽 |
| ClaudeBot | Anthropic | ClaudeBot |
模型訓練 |
| PerplexityBot | Perplexity | PerplexityBot |
搜尋索引 + 訓練 |
| Bytespider | ByteDance | Bytespider |
模型訓練 |
| Google-Extended | Google-Extended |
Gemini 訓練(非搜尋) | |
| CCBot | Common Crawl | CCBot |
開放資料集 |
關鍵區別:
- 封鎖
Google-Extended可防止 Gemini 訓練使用,但不會影響 Google 搜尋索引或 AI 概覽(那些使用Googlebot) - 封鎖
GPTBot可防止 OpenAI 訓練,但不會阻止 ChatGPT 透過瀏覽引用您的內容(ChatGPT-User) - 約3-5%的網站現在使用 AI 專用的 robots.txt 規則
範例:選擇性封鎖 AI 爬蟲:
# 允許搜尋索引,封鎖 AI 訓練爬蟲
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Bytespider
Disallow: /
# 允許所有其他爬蟲(包括用於搜尋的 Googlebot)
User-agent: *
Allow: /
建議: 在封鎖前考慮您的 AI 可見度策略。被 AI 系統引用可提升品牌知名度與推薦流量。請參閱 seo-geo 技能以取得完整的 AI 爬蟲/擷取器分類。
使用者觸發的擷取器依設計忽略 robots.txt。 Google 現在將 Google-Agent(Project Mariner、代理瀏覽)以及 Google-NotebookLM 和 Google Messages 歸類為使用者觸發的擷取器,無法透過 robots.txt 封鎖。請改用伺服器端存取控制。相比之下,
Google-Extended和Google-CloudVertexBot遵守 robots.txt。新興技術:Web Bot Auth(RFC 9421)讓機器人可透過Signature-Agent標頭與agent.bot.goog的金鑰目錄進行加密驗證(由 Google-Agent 使用);反向 DNS 驗證仍是備用方案。
2. 可索引性
- Canonical 標籤:自我參照、無 noindex 衝突
- 重複內容:近似重複、參數 URL、www 與非 www
- 內容過薄:各類型頁面低於最低字數
- 分頁:rel=next/prev 或載入更多模式
- Hreflang:多語言/多區域網站正確設定
- 索引膨脹:不必要的頁面消耗爬取預算
3. 安全性
- HTTPS:強制執行、有效 SSL 憑證、無混合內容
- 安全性標頭:
- Content-Security-Policy (CSP)
- Strict-Transport-Security (HSTS)
- X-Frame-Options
- X-Content-Type-Options
- Referrer-Policy
- HSTS preload:高安全性網站檢查是否納入 preload 清單
- 返回按鈕劫持(垃圾政策違規、惡意行為):標記透過
history.pushState/replaceState(包括第三方廣告/函式庫平台注入的腳本)破壞返回按鈕的頁面。已於2026-04-13加入 Google 垃圾政策;自2026-06-15起強制執行(手動處分 + 自動降級):視為嚴重。
4. URL 結構
- 簡潔 URL:描述性、連字號、內容無查詢參數
- 階層:反映網站架構的邏輯資料夾結構
- 重新導向:無鏈結(最多1跳),永久移動使用301
- URL 長度:標記超過100個字元
- 結尾斜線:一致使用
5. 行動裝置最佳化與頁面體驗
- 響應式設計:viewport meta 標籤、響應式 CSS
- 觸控目標:最小48x48px,間距8px
- 字型大小:基礎最小16px
- 無水平捲動
- 行動優先索引:Googlebot Smartphone 是主要爬蟲(已於2024年完成推出)。行動版本非嚴格必要(Google 表示「非常強烈建議」),無法在行動裝置上運作的網站仍可被索引,但真正的風險是內容/一致性損失,而非硬性排除。
- 行動/桌面內容一致性(最高價值的行動檢查):等效的主要內容、相符的 robots meta 標籤、相符的標題/描述、等效的結構化資料、可爬取的資源;避免延遲載入需要使用者互動的主要內容。
- 侵入性插頁廣告 / 廣告密度:標記全頁插頁廣告、獨立同意重新導向頁面、持續性封鎖對話框,以及過度/干擾的廣告密度(一個命名的頁面體驗面向)。可接受:小型橫幅、標準 CMS/法律對話框。
- 「閱讀更多」深層連結:確保關鍵內容在載入時立即可見(不在分頁/摺疊選單後),不要在載入時劫持捲動,並保留 URL 雜湊片段;隱藏在可展開區塊後的內容較不可能符合資格。
頁面體驗是指導方針,而非單一排名系統。 只有 Core Web Vitals 直接影響排名;HTTPS 是已確認但輕量的訊號(影響少於~1%的查詢)。即使頁面體驗不佳,相關性仍可能勝出,因此不要過度強調安全性標頭。注意:獨立的頁面體驗報告已從 Search Console 移除(請透過 Core Web Vitals + HTTPS 報告監控)。
6. Core Web Vitals
- LCP(最大內容繪製):目標 <=2.5秒
- INP(與下一次繪製的互動):目標 <=200毫秒
- INP 已於2024年3月12日取代 FID。FID 已於2024年9月9日從 Chrome 的實測資料工具(CrUX API、PageSpeed Insights)中移除(Lighthouse 是實驗室工具,從未報告 FID)。請勿在任何地方引用 FID。
- CLS(累計版面配置位移):目標 <=0.1
- 評估使用真實使用者資料的第75百分位數
- 如有 MCP 可用,請使用 PageSpeed Insights API 或 CrUX 資料
7. 結構化資料
- 偵測:JSON-LD(首選)、Microdata、RDFa
- 針對 Google 支援的類型進行驗證
- 完整分析請參閱 seo-schema 技能
8. JavaScript 渲染
- 檢查內容是否在初始 HTML 中可見,或需要 JS
- 識別客戶端渲染(CSR)與伺服器端渲染(SSR)
- 標記可能導致索引問題的 SPA 框架(React、Vue、Angular)
- 如有適用,驗證動態渲染設定
JavaScript SEO:標準與索引指南(2025年12月)
Google 於2025年12月更新了 JavaScript SEO 文件,包含關鍵說明:
- 標準衝突: 如果原始 HTML 中的 canonical 標籤與 JavaScript 注入的不同,Google 可能使用任一。請確保伺服器渲染的 HTML 與 JS 渲染的輸出中的 canonical 標籤完全相同。
- 使用 JavaScript 的 noindex: 如果原始 HTML 包含
<meta name="robots" content="noindex">,但 JavaScript 將其移除,Google 仍可能尊重原始 HTML 中的 noindex。請在初始 HTML 回應中提供正確的 robots 指令。 - 非200狀態碼: Google 不會在回傳非200 HTTP 狀態碼的頁面上渲染 JavaScript。透過 JS 在錯誤頁面上注入的任何內容或 meta 標籤將對 Googlebot 不可見。
- JavaScript 中的結構化資料: 透過 JS 注入的 Product、Article 等結構化資料可能面臨延遲處理。對於時間敏感的結構化資料(尤其是電子商務 Product 標記),請將其包含在初始伺服器渲染的 HTML 中。
最佳實踐: 將關鍵 SEO 元素(canonical、meta robots、結構化資料、標題、meta description)放在初始伺服器渲染的 HTML 中,而非依賴 JavaScript 注入。
9. IndexNow 協定
- 檢查網站是否支援 IndexNow(用於 Bing、Yandex、Naver)
- 由 Google 以外的搜尋引擎支援
- 建議實作以在非 Google 引擎上獲得更快索引
代理友善頁面與代理瀏覽
AI 代理(不僅是 AI 摘要器)越來越常透過三種管道讀取網站:螢幕截圖的視覺模型、原始 HTML/DOM,以及無障礙樹(最乾淨的訊號)。稽核標準:語意 HTML(真正的 <button> 和 <a>,而非 <div onclick>)、標籤關聯、互動目標尺寸、跨模板的版面穩定性、cursor: pointer 正確性,詳見 references/agent-friendly-pages.md。
Google 現在提供一個 Lighthouse 代理瀏覽類別(自 Lighthouse 13.3.0、Chrome 150+ 起預設啟用;分組:代理中心無障礙、CLS + llms.txt、三個 WebMCP 稽核)。它報告通過比例(X of N),而非0-100分數,請與本技能自身的 Agent-UX 0-100 啟發式分數區分。PSI REST API 不公開此類別;請透過 Lighthouse CLI --only-categories=agentic-browsing、DevTools 或 PSI 網頁 UI 執行。請參閱 references/agent-friendly-pages.md。
稽核指令
# 使用 Playwright 渲染 + 擷取無障礙樹,然後評分
claude-seo run agent_ux_check.py https://example.com --json
掃描器會輸出 Agent-UX 分數(0-100)以及逐項問題:
- HTML 發現:真正的按鈕/錨點、
<div onclick>小工具、語意地標、沒有<label for>的輸入、沒有 ARIA 標籤的輸入 - 無障礙樹發現:總節點數、互動節點數、未命名的互動元素、
role="generic"比例
無障礙樹快照使用 Playwright 的 page.accessibility.snapshot(interesting_only=False)。若要擷取樹但不評分,請使用 claude-seo run render_page.py <url> --a11y-tree --json。
將發現呈現為機會,而非失敗;不要以低於100的 Agent-UX 分數來阻擋稽核。WebMCP 來源試用/註冊狀態需要驗證,缺乏 WebMCP 支援仍是機會,而非缺陷。
輸出
技術分數:XX/100
類別細項
| 類別 | 狀態 | 分數 |
|---|---|---|
| 可爬取性 | pass/warn/fail | XX/100 |
| 可索引性 | pass/warn/fail | XX/100 |
| 安全性 | pass/warn/fail | XX/100 |
| URL 結構 | pass/warn/fail | XX/100 |
| 行動裝置 | pass/warn/fail | XX/100 |
| Core Web Vitals | pass/warn/fail | XX/100 |
| 結構化資料 | pass/warn/fail | XX/100 |
| JS 渲染 | pass/warn/fail | XX/100 |
| IndexNow | pass/warn/fail | XX/100 |
嚴重問題(立即修復)
高優先級(1週內修復)
中優先級(1個月內修復)
低優先級(待辦事項)
DataForSEO 整合(選用)
如果 DataForSEO MCP 工具可用,請使用 on_page_instant_pages 進行即時頁面分析(狀態碼、頁面時間、斷鏈、頁面檢查),on_page_lighthouse 進行 Lighthouse 稽核(效能、無障礙、SEO 分數),以及 domain_analytics_technologies_domain_technologies 進行技術堆疊偵測。
Google API 整合(選用)
如果已設定 Google API 憑證,請使用 claude-seo run pagespeed_check.py <url> --json 取得真實 PSI + CrUX 實測資料(取代僅實驗室的 CWV 估計),claude-seo run crux_history.py <url> --json 取得25週 CWV 趨勢,以及 claude-seo run gsc_inspect.py <url> --json 取得每個 URL 的真實索引狀態。
錯誤處理
| 情境 | 動作 |
|---|---|
| URL 無法連線 | 回報連線錯誤及狀態碼。建議驗證 URL、檢查 DNS 解析,並確認網站可公開存取。 |
| robots.txt 未找到 | 註記在根網域未偵測到 robots.txt。建議建立包含適當指令的 robots.txt。繼續稽核其餘類別。 |
| HTTPS 未設定 | 標記為嚴重問題。回報是否提供 HTTP 但無重新導向、是否存在混合內容,或 SSL 憑證遺失/過期。 |
| Core Web Vitals 資料不可用 | 註記 CrUX 資料不可用(常見於低流量網站)。建議使用 Lighthouse 實驗室資料作為代理,並建議增加流量後再重新測試。 |




