返回文章列表
AI 趨勢4 分鐘2026/8/12

如何追蹤 AI 爬蟲造訪你的網站

了解 AI 與搜尋 crawler 的用途差異,以及 User-Agent、pixel、middleware 觀測能證明什麼、不能證明什麼。


AI 爬蟲有哪些?

目前主要的 AI 爬蟲包括:

名稱組織官方定位或注意事項 GPTBotOpenAI訓練用途 OAI-SearchBotOpenAIChatGPT 搜尋結果的網站連結與摘要 ChatGPT-UserOpenAI使用者操作所觸發的請求 ClaudeBot / Claude-SearchBotAnthropic不同產品用途應分開判讀 PerplexityBot / Perplexity-UserPerplexity索引與使用者觸發請求應分開判讀 GooglebotGoogleGoogle 搜尋 crawler

Google-Extended 不應列在 HTTP User-Agent 造訪表中。它是 robots.txt 的控制 token,Google 官方說明它沒有獨立的 HTTP User-Agent 字串。

為什麼要追蹤?

  • 觀察哪些請求使用已知 crawler User-Agent
  • 找出 crawler 經常造訪的頁面與錯誤狀態碼
  • 優化 robots.txt 設定
  • 把 crawler 活動與實際 AI 引用驗收分開比較
  • 如何追蹤

    Geovault 追蹤碼使用 image beacon,讓執行 JavaScript 的客戶端帶回完整頁面 URL,無 JavaScript 的解析器則使用站點綁定 fallback。這避免為第三方網站放寬 credentialed CORS。

    但 User-Agent 可以被偽造,pixel 也只會看到真的載入該資源的請求。因此介面把這些記錄標示為「UA 辨識」,不宣稱已經過供應商官方 IP 驗證,也不能把沒有記錄解讀成「從未被爬取」。真正的引用成效仍要看固定問題集的回答、來源連結與日期。

    OpenAI 的 crawler 用途與 robots token 可查閱 OpenAI crawler overview;Google crawler 驗證方式可查閱 Google crawler documentation

    想優化你的 AI 能見度?

    免費掃描你的網站,了解 GEO 技術準備度與可修復項目

    免費掃描

    協助我們改善 GeoVault

    經您同意後,我們才會使用 Google Analytics 4 了解頁面瀏覽與產品流程。廣告儲存、廣告個人化與跨站追蹤會持續停用;拒絕不影響網站功能,且可隨時變更。

    查看隱私權政策