AI 流量不再只有爬蟲:企業邊緣治理先分清 Search、Agent、Training
當 AI 深入企業營運,進入網站的網路流量早已不只是傳統的搜尋引擎爬蟲。Cloudflare 正式宣布讓網站管理者能將 AI 流量精準拆分為 Search(搜尋)、Agent(代理人)、Training(模型訓練) 三種用途。這項分類的核心價值,不在於單純給 AI 流量貼上標籤,而是讓企業能夠根據不同用途的商業價值與資安風險,彈性套用不同的存取規則。
市場的變化早已反映在實際數據上。《Fortune》引述 HUMAN Security 的報告指出,會在網站上執行點擊、填表與資料查詢的 AI 代理人流量(AI Agent Traffic),年成長率高達 7,851%。不過報導也特別提醒,各家資安廠商對機器人(Bot)的判定標準不同,數據不應直接當成所有網站的通用指標。
對企業資安與 IT 團隊來說,真正關鍵的提問不該只是「我們的 AI 流量增加了多少?」,而是「哪些 AI 請求可以提供服務、哪些必須精準限制、哪些違規行為必須留下完整的稽核軌跡?」
拒絕一刀切!先將 AI 流量劃分三條政策通道
搜尋引擎的索引能為網站帶來曝光與流量;AI 代理人可能替使用者完成訂購或查詢,帶來實質轉換;但模型訓練抓取(Training)則往往涉及內容版權與伺服器資源的消耗。如果企業對所有 AI 流量只採用簡陋的「全盤允許」或「一律封鎖」規則,最容易陷入兩難:為了擋下訓練爬蟲而誤擋了搜尋曝光,或是為了爭取曝光而放任 AI 代理人任意存取敏感的管理頁面。
較理想的做法,是企業應先盤點內部的公開內容、會員專區、API 接口、登入流程與後台管理介面,再為這三種 AI 流量制定明確的通行權限:
- Search(搜尋索引): 允許存取公開網頁,確保 SEO 效益與 AI 搜尋(AEO/GEO)的能見度。
- Agent(自動化代理人): 針對查詢、訂購等流程開放特定 API,但嚴格限制存取頻率與操作範圍。
- Training(模型訓練抓取): 對於核心智慧財產與高價值內容,嚴格限制或直接阻擋未授權的訓練爬蟲。
建構這套邊緣入口政策時,企業可透過邊緣資安解決方案,將請求來源、存取路徑、存取頻率與異常行為整合至同一套防衛機制中。不過,政策本身的邊界仍需由業務、法遵與資安團隊共同討論劃定。
延伸閱讀:在上線防護規則前,可先參考 WAF 不只是擋攻擊:企業網站上線前該先做的 5 個防護基線,鎖定關鍵業務路徑。
別再迷信 robots.txt!它只是意願聲明,不是存取控制
許多網站管理者以為只要在網站根目錄放上 robots.txt 就能阻止 AI 爬蟲。然而,資安團隊與 Cloudflare 的實測觀察發現,部分 AI 服務(例如 Perplexity)在被網站阻擋後,可能會更換 User-Agent、IP 位址或 ASN(自治系統編號),甚至在特定情況下無視 robots.txt 的宣告。
這並非意味著所有 AI 廠商都會繞過規則,而是給企業一個很重要的資安警訊:robots.txt 僅代表網站的「溝通偏好」,完全不具備強制力,更不能取代真正的身分驗證與存取控制。
針對會員資料、價格 API、線上交易與後台管理路徑,企業必須仰賴嚴謹的身分驗證、權限管理、WAF 防護規則、速率限制(Rate Limiting)與日誌留存。如果企業採用的防禦方案只會辨識 User-Agent 標頭,卻無法結合 IP 信譽、行為特徵、請求路徑與異常頻率進行綜合研判,當遇到擅長偽裝成一般瀏覽器行為的 AI 代理人時,邊緣防線將會形同虛設。

評估 WAF 防護效益:不只要看封鎖數,更要驗證誤判率
AI 代理人並不等於惡意攻擊。很多時候,它是潛在客戶用來比價、查詢產品規格或完成服務流程的工具;直接粗暴地封鎖,很可能讓企業白白流失新的業務入口。反過來說,放任不理又會導致伺服器頻寬被吃滿、資料被大量爬取、甚至造成數據統計失真。
導入或調整資安策略時,建議採取以下三步驟落地:
- 觀察模式(靜態監控): 建立網站流量基線,分別統計 Search、Agent、Training 與一般真實使用者的請求比例。
- 分層控制(動態防衛): 公開頁面開放搜尋爬蟲;登入與交易 API 啟用雙重驗證或高強度挑戰(Challenge);對高頻率存取實施速率限制。
- 微調與滾動檢討: 定期查看商業轉換率、客服反應件數、API 錯誤率與誤擋(False Positive)案例。資安效益的評估標準不能只看「封鎖了幾萬筆請求」,而是在阻擋風險的同時,是否維持了業務的順暢運作。
延伸閱讀:想確保調整 WAF 規則時不會影響業務營運?請參考 一個案例看懂 Penta Security WAF 有沒有用:先驗這 4 個指標 分析誤擋率與應變工時。
把決策依據與稽核軌跡完整保留在邊緣層
當 AI 流量成為常態,內部稽核與資安合規主管最常問的問題一定是:「在什麼時間點?誰以什麼身分?對網站的哪個路徑做了什麼操作?系統當時做了什麼處置?」
企業需要的不是一張只有總流量起伏的概略圖表,而是包含以下項目的完整證據鏈:
- 當時生效的 WAF 政策版本
- 觸發的具體防護規則與特徵標記
- 例外放行或阻擋的判斷原因
- 系統回傳的 HTTP 狀態碼與日誌紀錄
CloudSecurity 的服務價值,不僅僅是協助企業掛上防火牆,更在於協助企業將邊緣防禦、自動化流量判讀與營運日誌完整串接。進一步了解如何將入口防線推到最前線,可參閱 邊緣保護不是把流量搬上 CDN:企業網站上線前先補的 5 個 WAF 檢查。

買方指南:4 招評估適合企業的 AI 流量治理方案
要在生成式 AI 時代守住企業的邊緣防線,在採購或導入資安方案時,可以透過以下 4 個問題進行檢視:
- 具備精細分類能力嗎? 能否清晰區分 Search、Agent、Training 與一般的 Malicious Bot(惡意機器人)?
- 具備多重訊號驗證嗎? 除了 User-Agent 外,能否結合 IP 響應信譽、請求行為模式與 TLS 指紋進行綜合判斷?
- 支援路徑層級的彈性控制嗎? 能否針對高風險的登入頁、API 接口與關鍵交易流程,設定獨立的防禦強度?
- 提供完善的營運支援嗎? 是否具備觀察模式、一鍵回滾、誤判分析工具以及合規所需的稽核軌跡紀錄?
AI 代理人流量的崛起,本質上是提醒企業重新將「網站入口」視為關鍵資安控制面。越早建立清晰的分流治理機制,就越能在擁抱 AI 帶來的新流量商機時,同時確保企業數位資產的隱私與安全。
FAQ 常見問題
A:Search 主要用於建立搜尋索引並提供曝光;Agent 代表 AI 代理人即時替使用者執行查詢、比較或交易;Training 則是將網站內容下載用於訓練大語言模型(LLM)。三者的商業價值與風險截然不同,不建議套用同一套阻擋規則。
A:非常需要。robots.txt 僅是意願宣告,不具備任何身分驗證、存取控制或強制阻擋的能力,無法保護會員資料、API 接口與後台頁面免於強行爬取或攻擊。
A:不建議一律封鎖。建議先透過 WAF 進行流量觀察與分類,對能帶來業務轉換或曝光的搜尋與代理人流量給予適當權限,僅對高風險路徑與未授權的模型訓練爬蟲實施限速或阻擋。
A:重點在於「動態研判與精準度」。包含能否結合行為特徵辨識偽裝流量、能否按路徑給予分層權限,以及是否提供完整的誤判分析與稽核紀錄留痕。
