AI 爬蟲有哪些?
目前主要的 AI 爬蟲包括:
Google-Extended 不應列在 HTTP User-Agent 造訪表中。它是 robots.txt 的控制 token,Google 官方說明它沒有獨立的 HTTP User-Agent 字串。
為什麼要追蹤?
如何追蹤
Geovault 追蹤碼使用 image beacon,讓執行 JavaScript 的客戶端帶回完整頁面 URL,無 JavaScript 的解析器則使用站點綁定 fallback。這避免為第三方網站放寬 credentialed CORS。
但 User-Agent 可以被偽造,pixel 也只會看到真的載入該資源的請求。因此介面把這些記錄標示為「UA 辨識」,不宣稱已經過供應商官方 IP 驗證,也不能把沒有記錄解讀成「從未被爬取」。真正的引用成效仍要看固定問題集的回答、來源連結與日期。
OpenAI 的 crawler 用途與 robots token 可查閱 OpenAI crawler overview;Google crawler 驗證方式可查閱 Google crawler documentation。