防止 AI 模型被濫用,首先要採取架構安全措施,例如防護措施、資料驗證、提示驗證和資料丟失預防 (DLP)。
閱讀本文後,您將能夠:
複製文章連結
人工智慧 (AI) 系統功能強大,且許多已嵌入關鍵的業務流程中。因此,AI 濫用可能危及應用程式和基礎架構,使組織面臨合規和聲譽風險,甚至在極端情況下危及生命。為了防止濫用,AI 模型必須設定防護措施、存取控制、提示驗證以及其他安全措施。架構上的選擇,例如在基於 AI 的應用程式基礎架構中納入「人為介入」(HITL),也可以減輕濫用的風險。
AI 濫用是指將 AI 模型用於模型架構師預期目的以外的用途,特別是出於惡意或欺詐的目的。隨著 AI 模型變得越來越有效,防止 AI 濫用也變得越來越重要。許多 AI 專家擔心 AI 可能被流氓國家和恐怖分子利用(這些群體可能已經在使用 AI 來推進他們的事業)。
OWASP 大型語言模型 (LLM) 十大風險列出了 AI 模型可能被濫用的一些方式,例如透過提示插入來操縱其行為、敏感資料揭露,以及透過入侵下游應用程式依賴的 LLM 來引入供應鏈漏洞。
除了這些風險之外,個人可能試圖利用 AI 模型來存取或產生危險或非法的內容,從武器製作教學到有害的露骨素材皆有。
對於依賴 AI 的日常使用者和企業來說,防止 AI 濫用對於保護其資料、品牌和客戶以及遵守資料隱私法規至關重要。
攻擊者可以利用 AI 模型來協助進行多種類型的網路攻擊。生成式 AI 模型和 AI 智慧體能夠發現軟體漏洞,在某些情況下甚至包括零時差漏洞。它們可以編寫惡意程式碼程式。它們可以透過編寫網路釣魚訊息來協助社交工程攻擊,並且可能能夠識別網路釣魚的目標。自主式 AI 應用程式可以自主運作長期的網路釣魚活動、勒索軟體攻擊以及其他網路攻擊,從而增強進階持續性威脅 (APT) 和有組織犯罪集團的能力。
即使是設有安全護欄的生成式 AI 模型,仍可能因為提示插入、越獄等手法而被濫用,讓惡意人士得以繞過限制,達成其目的。
為了防止個人和團體將 AI 應用程式用於其預期目的之外的用途,AI 應用程式和模型的開發人員應在整個開發和部署過程中整合多項安全措施。
在模型上線生產之前,它需要經過訓練。要防止 AI 濫用,第一步就是驗證訓練資料,確保其中不含偏見資料、私人資料,或任何可能導致非預期、未授權行為的隱藏後門程式。
由於精煉模型需要龐大的訓練資料,這些資料往往來自多種來源,使得訓練資料容易遭受供應鏈攻擊。此外,惡意人士也可能透過資料投毒攻擊蓄意破壞訓練資料,目的是引入偏見或後門程式。資料投毒者可能直接入侵組織外部的資料庫,或由內部人員(內鬼)竄改訓練資料。
除了資料驗證外,以下安全防護措施也有助於防範資料投毒攻擊:
許多組織並不自行訓練 LLM。對於依賴 LLM 提供者的企業來說,瞭解他們採取了哪些安全措施來保護其模型免受資料投毒攻擊非常重要。
LLM 提供者的客戶通常使用檢索增強生成 (RAG) 來針對其使用案例最佳化 LLM 的效能。驗證並保護用於 RAG 的內部資料集也至關重要。
AI 防護措施是一組政策與控制機制,用來確保 AI 模型運作時不會超出預先設定的界限。舉例來說,防護措施可以允許一個模型撰寫電子郵件,但阻止它撰寫網路釣魚電子;或者允許模型編寫一個功能函式,但阻止它撰寫漏洞利用程式碼。
防護措施應涵蓋 AI 模型的所有層面,從前述的訓練資料,一路延伸到應用程式基礎架構。
大多數將 AI 整合至對外應用程式的組織,通常是使用既有的 AI 模型。在這種情況下,應用程式與基礎架構防護措施是組織最能直接掌控的部分。同時,也應主動瞭解模型提供者在其模型中內建的防護措施。
AI 模型特別容易受到提示插入攻擊:這類攻擊透過欺騙性的提示誘導模型違反其防護措施。除了蓄意攻擊外,有些使用者輸入的提示本身也可能違反模型的服務條款,例如要求生成非法、危險或露骨的內容。
提示驗證的目的,就是確保提示中不含有害或具誤導性的請求。就像 API 結構描述驗證會封鎖不符合 API 結構描述的非法請求一樣,提示驗證能在提示送達 AI 模型前,先行辨識並封鎖不安全的內容。
人為介入 (HITL) 是一種可降低「無人監督 AI 模型決策」風險的架構方法。HITL 讓人類管理者持續參與 AI 工作流程,以便核准模型做出的決策。模型可以透過直接的人類回饋進行訓練,也可以設定成在對某個提示的回應信心度偏低時,主動尋求人類協助。
資料丟失預防 (DLP) 指的是一類能夠阻止機密資料離開安全環境的技術。DLP 可分析個別的 API 請求與 AI 提示,並運用多種技術(如資料指紋識別、關鍵字比對、模式比對等)來辨識敏感與機密資訊,必要時可封鎖相關請求。
DLP 也可限制在特定網頁或應用程式中複製貼上內容,防止內部人員將公司機密資訊輸入到外部的 LLM 中。
只有在組織能全面掌握可能發生 AI 濫用且可能產生影響的範圍時,才能有效預防濫用。AI 模型經常會在未被察覺或未經授權的情況下,被嵌入到應用程式的基礎架構中,這與許多開發人員面臨的影子 API 挑戰類似。影子 AI 偵測可協助組織找出存在 AI 濫用風險的位置,以便部署適當的防護措施與安全機制。
Cloudflare AI Security Suite 可協助組織發現影子 AI、保護模型免遭濫用、保護 AI 智慧體的存取權,並防止資料外洩。這讓組織在加速導入 AI 的同時,仍能維持安全性。深入瞭解 AI Security Suite。
當個人或團體將 AI 模型用於其原始設計目的以外的用途,特別是為了進行欺騙、非法或有害的行為時,即構成 AI 濫用。這包括使用這些工具來產生危險或受限內容,或協助實施詐騙計畫。
惡意人士可利用生成式 AI 撰寫惡意程式碼、找出軟體漏洞,甚至發掘零時差漏洞。他們也會使用這些工具自動化社交工程攻擊,例如產生具有說服力的網路釣魚訊息,並辨識可用於長期魚叉式網路釣魚攻擊的潛在目標。此外,針對生成式 AI 模型的提示插入攻擊,也可能讓攻擊者取得機密資訊。
安全性應從訓練階段就開始,首先驗證訓練資料,確保其中不含偏見、私人資訊或隱藏後門程式。AI 模型開發人員還應使用多元資料來源、對資料存取套用最低權限原則,並採用對抗性訓練,協助模型辨識具誤導性的輸入。
防護措施是一組必要的政策與控制機制,用來確保 AI 的行為保持在預先定義的安全範圍內。
提示驗證就像一個篩選器,能在有害或具欺騙性的請求送達 AI 模型前先行識別並加以阻擋。這個程序有助於防止提示插入攻擊,也就是使用者試圖誘導系統繞過其安全機制的行為。