如何管理良性機器人 | 良性機器人與惡意機器人

需要管理的不僅僅是惡意機器人。機器人管理策略需要避免封鎖善意機器人,同時減少惡意機器人。

學習目標

閱讀本文後,您將能夠:

  • 瞭解善意機器人與惡意機器人之間的區別
  • 瞭解善意機器人之「善」,以及為什麼善意機器人需要能夠存取 Web 屬性
  • 瞭解管理善意和惡意機器人的有效策略

相關內容


想要繼續瞭解嗎?

訂閱 TheNET,這是 Cloudflare 每月對網際網路上最流行見解的總結!

請參閱 Cloudflare 的隱私權政策,了解我們如何收集和處理您的個人資料。

複製文章連結

什麼是善意機器人?

善意機器人:聊天機器人、監控機器人、搜尋引擎機器人

機器人是一種電腦程式,可透過網際網路自動與 Web 內容進行互動。我們使用「善意」機器人來指任何執行非故意損害網站或惡意任務的機器人。由於善意機器人可能與惡意機器人具有一些共同特徵,因此僅封鎖惡意機器人而不封鎖善意機器人可能頗具挑戰性。

有多種善意機器人,每一種都設計用於完成不同的任務。以下是一些範例:

  • 搜尋引擎機器人:也稱為網路爬蟲或蜘蛛,這些機器人「爬行」或檢閱網際網路上幾乎每個網站上的內容,然後對該內容進行索引,以便它可以顯示在相關使用者搜尋的搜尋引擎結果中。它們由 Google、Bing 或 Yandex 等搜尋引擎操作。
  • AI 爬蟲:類似於搜尋引擎爬蟲,這些機器人會複製內容以用於大型語言模型 (LLM)檢索增強生成 (RAG) 和其他 AI 使用案例。(雖然 AI 爬蟲營運商通常不會故意損害被爬取的網站,但那些抓取原始內容的爬蟲可能會給網站營運商帶來直接成本,因為它們可能會傳送大量的網頁請求。)
  • 版權機器人:此類機器人在平台或網站爬行,尋找可能違反版權法的內容。這些機器人可能由擁有受版權保護內容的任何個人或公司操作。版權機器人可以查找重複的文字、音樂、影像甚至影片。
  • 網站監控機器人:這些機器人監控網站指標(例如,監控反向連結或系統中斷),並就重大變更或停機時間對使用者發出提醒。例如,Cloudflare 營運著一個名為 Always Online 的網路爬蟲機器人,當原始伺服器關閉時,它會告訴 Cloudflare 網路提供網頁的快取版本。
  • 商業機器人:由商業公司操作的機器人,它們爬行網際網路以獲取資訊。這些機器人可能由監控新聞報導或客戶評論的市場研究公司、優化其廣告展示位置的廣告網路或爬行客戶網站的 SEO 機構操作。
  • 摘要機器人:這些機器人在網際網路上爬行,尋找有新聞價值的內容以新增到平台的新聞摘要中。內容彙總工具網站或社交媒體網路可能會操作這些機器人。
  • 聊天機器人:聊天機器人透過用預先程式設計的回應回答使用者來模仿人類對話。一些聊天機器人足夠複雜,可以進行長時間的對話。
  • 個人助理機器人:常見範例包括 Siri 和 Alexa。這些程式通常由 AI 驅動,比典型的機器人更為先進。

善意機器人與惡意機器人

網站管理員應小心謹慎,切勿在嘗試篩選掉惡意機器人流量時,封鎖「善意」機器人。例如,許多網站通常會允許搜尋引擎網路爬蟲機器人通過,因為如果沒有這些機器人,網站就無法顯示在搜尋結果中。

惡意機器人可以竊取資料、入侵使用者帳戶、透過線上表單提交垃圾資料以及執行其他惡意活動。惡意機器人的類型包括認證填充機器人內容剽竊機器人垃圾內容機器人點擊欺詐機器人

什麼是 robots.txt?

善意機器人管理始於在網站的 robots.txt 檔案中正確設定規則。robots.txt 檔案是駐留在 Web 伺服器上的文字檔案,它為所有存取託管網站或應用程式的機器人指定規則。這些規則定義了機器人可以爬行和不能爬行的頁面、它們應該和不應該進入的連結以及其他機器人行為指令。Cloudflare 提供受管理 robots.txt 服務來簡化設定這些規則的過程。

有些(但並非全部)善意機器人會遵循 robots.txt 檔案中聲明的偏好設定。例如,Google 聲明,如果網站擁有者不希望其網站上的某個頁面出現在 Google 搜尋結果中,他們可以在 robots.txt 檔案中編寫規則,阻止 Googlebot 將該頁面編入索引。同樣,如果網站不希望其內容用於訓練 LLM,也可以透過 robots.txt 檔案表達該偏好。需要明確的是,robots.txt 檔案實際上並不能阻止機器人存取網站,一些機器人營運商根本不理會它們。

什麼是允許清單?

可以將允許清單視為活動的來賓名單。如果不在來賓名單上的某人試圖進入活動場地,安全人員將阻止他們進入。名單上的任何人都可以自由參加活動。這樣的方法是必要的,因為不速之客可能會表現不佳並破壞其他人的聚會。

對於機器人管理,這基本上就是允許清單的運作方式。允許清單是允許存取 Web 資產的機器人清單。通常,這透過稱為「使用者代理」、機器人 IP 位址或兩者的結合來實現。使用者代理是向網頁伺服器標識使用者(或機器人)類型的文字字串。

透過確保清單允許善意機器人使用者代理(例如屬於搜尋引擎的機器人)並封鎖不在清單上的所有機器人,網頁伺服器可以確保善意機器人的存取。

網頁伺服器還可以擁有包含已知惡意機器人的封鎖清單。

什麼是封鎖清單?

在網路環境中,封鎖清單是不允許存取伺服器、網路或 Web 資產的 IP 位址、使用者代理或其他線上身分指標的清單。這種方法與使用允許清單略有不同:基於封鎖清單的機器人管理策略將封鎖這些特定機器人並允許所有其他機器人通過,而允許清單策略僅允許指定的機器人通過並封鎖所有其他機器人。

允許清單是否足以讓善意機器人進入並將惡意機器人拒之門外?

惡意機器人有可能偽造其使用者代理字串,從而至少在最初看起來像一個善意機器人——就像小偷可能使用假身分證假裝自己在來賓名單上並潛入活動場地一樣。

因此,善意機器人允許清單必須與其他方法相結合來偵測欺騙,例如行為分析或機器學習。除了簡單地允許已知的善意機器人之外,這還有助於主動識別惡意機器人和未知的善意機器人。

AI 機器人呢?

多數 AI 工具會透過網路內容進行自我訓練。AI 爬蟲機器人會遍歷網路抓取新內容,這種做法對網站的影響是好是壞,取決於該網站的商業模式。

一些網站營運商可能會發現,AI 機器人的持續抓取會耗盡他們的後端資源,或推高他們的頻寬成本。其他一些網站營運商如果依賴原創內容獲取收入(例如基於廣告的收入模式),其商業模式可能會受到負面影響,因為 AI 工具可以利用其內容來解答使用者的疑問,而無需使用者存取他們的網站。

機器人管理器解決方案有什麼作用?

機器人管理產品允許善意機器人存取網站資產,封鎖惡意機器人,並協助網站管理員管理他們與 AI 爬蟲和工具的關係Cloudflare Bot Management 使用機器學習和整個網路中流量的行為分析來偵測惡意機器人,同時自動並持續地允許將善意機器人列入允許清單。透過受管理 robots.txt,Cloudflare 可以自動修改網站 robots.txt 檔案,以表達網站管理員的偏好。此外,藉助 Cloudflare 的依爬行次數付費功能,Cloudflare 還使網站管理員能夠允許或封鎖特定的 AI 爬蟲,甚至可以按爬取次數向這些爬蟲的營運商收費。

常見問題集

什麼是「良性」機器人?

良性機器人是一種電腦程式,能在網際網路上自動執行任務,且不具刻意惡意或對網站造成損害。常見的範例包括:為網頁建立索引並協助網站獲得流量的搜尋引擎爬蟲、用來查找盜版內容的著作權機器人,以及檢查網站是否中斷服務的網站監控機器人。

為什麼管理良性機器人很重要?

網站的機器人管理策略需要區分良性機器人和惡意機器人。允許良性機器人(例如搜尋引擎爬蟲)存取網站至關重要,這樣網站才能出現在搜尋結果中。同時,一些良性機器人(例如 AI 爬蟲)可能會傳送大量請求,如果不加以明確指示,可能會增加網站的頻寬成本或耗盡後端伺服器資源。

什麼是 robots.txt 檔案?

robots.txt 檔案是 Web 伺服器上的一個文字檔案,用於為機器人提供規則。這些規則可以指定允許機器人爬取哪些頁面、可以追蹤哪些連結以及爬取網站的頻率。它是良性機器人管理的基礎,但有些機器人可能會忽略這些規則。

如何控制哪些機器人可以存取我的網站?

兩種常見的方法是允許清單和封鎖清單。允許清單類似於訪客清單;它列出了允許存取您網站的機器人,而其他所有機器人都會被封鎖。封鎖清單則相反;它列出了禁止存取的特定機器人,而其他所有機器人則被允許存取。

使用允許清單是否足以阻擋惡意機器人?

僅靠允許清單並不一定足夠。惡意機器人有时會偽造自己的身分,藉此繞過允許清單的限制。因此,允許清單應與其他技術搭配使用,例如行為分析或機器學習,以便偵測出惡意的機器人行為。

機器人管理解決方案如何提供幫助?

機器人管理解決方案旨在允許良性機器人存取網站,封鎖惡意機器人,並幫助網站擁有者管理與不同類型爬蟲的互動。例如,Cloudflare Bot Management 利用機器學習和行為分析來偵測惡意機器人,同時自動維護一個經過驗證的良性機器人允許清單。