Comment empêcher l’utilisation abusive de l’IA ?

La prévention de l’utilisation abusive des modèles d’IA commence par des mesures de sécurité architecturales, telles que : des garde-fous, la validation des données, la validation des invites et la prévention des pertes de données (DLP).

Objectifs d’apprentissage

Cet article s'articule autour des points suivants :

  • Décrire les conséquences de l’utilisation abusive de l’IA
  • Citer certaines des technologies qui peuvent empêcher l’utilisation abusive de l’IA

Copier le lien de l'article

Résumé de l’article :

  • Mettez en place des couches de sécurité robustes pour éviter l’utilisation abusive de l’IA, en insistant sur la protection des données sensibles et en empêchant l’exploitation des grands modèles de langage (LLM) par injection d’invites ou par exfiltration de données.
  • Établissez des cadres de gouvernance et de surveillance exhaustifs pour mettre fin à la mauvaise utilisation de l’IA et veillez à ce que les systèmes automatisés ne soient pas détournés à des fins de création de deepfakes, de diffusion de mésinformation ou de lancement de cyberattaques sophistiquées.
  • Sécurisez l’ensemble du cycle de vie de l’IA en neutralisant les vulnérabilités lors de la formation et du déploiement des modèles, ce qui est essentiel pour éviter l’utilisation abusive de l’IA et pour préserver l’intégrité de l’organisation en dépit des menaces en constante évolution.

Comment empêcher l’utilisation abusive de l’IA ?

Les systèmes d’intelligence artificielle (IA) sont puissants, et beaucoup sont intégrés à des processus qui sont essentiels pour l’entreprise. Par conséquent, l’utilisation abusive de l’IA peut compromettre les applications et l’infrastructure, exposer les entreprises à des risques liés à la conformité et d’atteinte à la réputation — et, dans des cas extrêmes, peut mettre des vies en danger. Pour empêcher toute utilisation abusive, les modèles d’IA doivent mettre en place des garde-fous, des mesures de contrôle des accès, la validation des invites et d’autres mesures de sécurité. Les choix architecturaux, tels que l’intégration de l’intervention humaine (HITL) dans l’infrastructure des applications basées sur l’IA, peuvent également atténuer les risques d’utilisation abusive.

Qu’est-ce que le mésusage de l’IA ?

L’utilisation abusive de l’IA désigne l’utilisation des modèles d’IA à des fins autres que celles prévues par les architectes du modèle, notamment à des fins malveillantes ou frauduleuses. Les modèles d’IA continuant de gagner en efficacité, il est important de prévenir l’utilisation abusive de l’IA. De nombreux experts en IA sont préoccupés par l’utilisation potentielle de l’IA par des États voyous et des terroristes (qui utilisent probablement déjà l’IA pour faire avancer leurs causes).

Le Top 10 de l’OWASP des risques liés aux pour les grands modèles linguistiques (LLM) énumèrent certaines des façons dont les modèles d’IA peuvent être utilisés à mauvais escient, telles que l’injection d’invites pour manipuler leur comportement, la divulgation de données sensibles et l’introduction de vulnérabilités dans la chaîne d’approvisionnement en compromettant un LLM sur lequel reposent les applications en aval.

Au-delà de ces risques, des individus peuvent tenter d’utiliser des modèles d’IA pour accéder à des contenus dangereux ou illégaux ou en générer, qu’il s’agisse d’instructions permettant de construire une arme ou de contenus explicites malveillants.

Pour les utilisateurs quotidiens et les entreprises qui ont recours à l’IA, la prévention des utilisations abusives de l’IA est importante pour protéger leurs données, leur marque et leurs clients, ainsi que pour garantir la conformité avec les réglementations sur la protection des données.

Comment l’IA générative peut-elle être détournée dans l’ingénierie sociale et d’autres attaques ?

Les acteurs malveillants peuvent utiliser les modèles d’IA pour lancer de nombreux types de cyberattaques. Les modèles d’IA générative et les agents IA peuvent identifier les vulnérabilités des logiciels, y compris, dans certains cas, les exploitations de vulnérabilités zero-day. Ils peuvent écrire des programmes de logiciels malveillants. Ils peuvent contribuer aux campagnes d’ingénierie sociale en créant des messages de phishing et peuvent être en mesure d’identifier les cibles de phishing. Les applications d’IA agentique pourraient mener de manière autonome des campagnes de phishing à long terme, des campagnes de rançongiciel et d’autres cyberattaques, renforçant ainsi les menaces persistantes avancées (APT) et les groupes criminels organisés.

Même les modèles d’IA générative disposant de garde-fous de sécurité peuvent être utilisés ainsi à mauvais escient, grâce à des techniques telles que l’injection d’invites et le débridage, qui permettent aux acteurs malveillants d’utiliser les modèles à leurs propres fins.

Stratégies pour prévenir l’utilisation abusive de l’IA

Pour empêcher les individus et les groupes d’utiliser des applications d’IA à des fins autres que celles prévues, les développeurs d’applications et de modèles d’IA doivent intégrer un certain nombre de mesures de sécurité tout au long du processus de développement et de déploiement.

Validation des données d’entraînement

Avant qu’un modèle ne soit mis en production, il est entraîné. Prévenir l’utilisation abusive de l’IA commence par la validation des données d’entraînement afin de garantir que les données d’entraînement d’un modèle ne contiennent pas de données biaisées, de données confidentielles ou de portes dérobées cachées qui permettraient un comportement non autorisé inattendu.

Compte tenu du grand nombre de données d’entraînement nécessaires pour affiner un modèle, ces dernières proviennent la plupart du temps de sources variées, ce qui rend les données d’entraînement vulnérables aux attaques sur la chaîne d’approvisionnement. Mais les acteurs malveillants peuvent également employer des attaques par empoisonnement de données pour corrompre les données d’entraînement, dans le but d’introduire un biais ou des portes dérobées à dessein. Les empoisonnements de données peuvent également s’introduire directement dans des bases de données depuis l’extérieur de l’entreprise, et des menaces internes peuvent corrompre les données d’entraînement.

Au-delà de la validation des données, ces mesures de sécurité permettent de prévenir les attaques par empoisonnement des données :

  • Principe du moindre privilège : l’application de ce principe Zero Trust aux magasins de données d’entraînement permet de garantir que seuls les personnes et les systèmes qui ont absolument besoin d’y accéder y ont accès. Cela réduit le risque de voir ces données d’entraînement exploitées par des acteurs malveillants extérieurs.
  • Diversité des sources de données : le fait de puiser dans des sources de données d’entraînement multiples permet de corriger le biais qui peut être présent dans les données provenant d’une source unique.
  • Surveillance et audit : le suivi des modifications apportées aux données d’entraînement stockées permet aux organisations de retracer les activités suspectes et de déterminer si un ensemble de données d’entraînement a été compromis.
  • Entraînement antagoniste : il s’agit d’entraîner un modèle d’IA à reconnaître des entrées intentionnellement trompeuses.

De nombreuses organisations n'entraînent pas elles-mêmes les LLM. Pour les entreprises qui se trouvent en aval des fournisseurs de LLM, il est important de comprendre les mesures de sécurité qu’elles ont prises pour défendre leurs modèles contre l’empoisonnement des données.

Les clients des fournisseurs de LLM utilisent généralement la génération augmentée par récupération (RAG) pour optimiser les performances des LLM pour leurs cas d’utilisation. La validation et la sécurisation des ensembles de données internes utilisés pour la génération augmentée par récupération sont également essentielles.

Garde-fous spécifiques à l'IA

Les garde-fous de l’IA sont des politiques et des contrôles qui garantissent que les modèles d’IA restent dans des limites prédéfinies. Les garde-fous, par exemple, peuvent permettre à un modèle d’écrire un e-mail mais l’empêcher d’écrire un e-mail de phishing. Ou encore, elles peuvent permettre à un modèle de coder une fonction, mais l’empêcher d’écrire une faille de sécurité.

Les garde-fous doivent défendre les modèles d’IA sur tous les aspects, des données d’entraînement (comme il est décrit ci-dessus) à l’infrastructure des applications.

  • Garde-fous de l’infrastructure : il s’agit de protéger les charges de travail d’IA dans le cloud à l’aide de mesures de sécurité cloud-native efficaces, telles que la protection des API, la sécurité du réseau, le chiffrement, ainsi que la gestion des identités et des accès (IAM).
  • Garde-fous des applications : les modèles d’IA sont généralement intégrés aux applications destinées aux utilisateurs par le biais d’API. Ces dernières peuvent appliquer des politiques visant à bloquer les contenus nuisibles ou dangereux capables de franchir les garde-fous des modèles.
  • Garde-fous du modèle : il s’agit d’affiner un modèle pour plus de précision et de l’optimiser en fonction de l’objectif prévu. Les modèles doivent être entraînés sur ce qui est considéré comme un type de réponse indésirable afin d’éviter de les produire pendant l’inférence.

La plupart des entreprises qui intègrent l’IA à leurs applications accessibles au public intègrent des modèles d’IA préexistants. Dans ces cas, les garde-fous des applications et de l’infrastructure sont les aspects sur lesquels ils disposent du contrôle le plus direct. Ils doivent également chercher à comprendre les garde-fous que les fournisseurs de modèles ont intégrés à leurs modèles.

Validation d’invite

Les modèles d’IA sont particulièrement vulnérables aux attaques par injection d’invites : des invites trompeuses qui incitent un modèle à passer outre ses garde-fous. En dehors des attaques délibérées, certaines invites d’utilisateurs peuvent enfreindre les conditions d’utilisation du modèle, par exemple des demandes de contenu illégal, dangereux ou explicite.

La validation des invites permet de garantir que les invites ne contiennent pas de requêtes dangereuses ou trompeuses. Tout comme la validation du schéma d’une API bloque les requêtes illégitimes qui ne se conforment pas au schéma de l’API, la validation des invites identifie et bloque les contenus dangereux présents dans les invites avant qu’ils n’atteignent le modèle d’IA.

Human-in-the-loop (HITL) (Humain dans la boucle)

L’approche humaine-in-the-loop (HITL) est une solution architecturale applicable pour réduire les risques liés à la prise de décision non supervisée avec un modèle d’IA. Elle maintient des responsables humains dans le cadre des flux de travail de l’IA afin qu’ils puissent approuver les décisions prises par les modèles d’IA. Les modèles peuvent être entraînés avec des retours humains directs, ou configurés de façon à demander l’assistance humaine lorsqu'ils ne peuvent pas faire de prédictions totalement fiables concernant la réponse correcte à une invite.

Protection contre les pertes de données (DLP)

La prévention des pertes de données (DLP) désigne une catégorie de technologies qui peuvent empêcher les données confidentielles de quitter les environnements sécurisés. La solution DLP peut examiner des requêtes d’API et des invites d’IA individuelles et, grâce à une multitude de techniques, dont l’analyse des empreintes numériques des données, la correspondance de mots-clés et la correspondance de logiques récurrentes, elle peut identifier les données sensibles et confidentielles et au besoin bloquer les requêtes.

La solution DLP peut également limiter les fonctions de copier-coller depuis certaines pages web ou applications afin d’empêcher des acteurs internes d’introduire des informations internes dans des LLM externes.

Détection de l’IA clandestine

L’utilisation abusive de l’IA ne peut être évitée que si les entreprises disposent d’une vision complète des endroits où une telle utilisation abusive est possible et susceptible d'engendrer des conséquences. Les modèles d’IA finissent souvent par être intégrés à l’infrastructure des applications à des endroits inattendus ou non autorisés, à l'instar des API fantômes auxquelles sont confrontés de nombreux développeurs d’applications. La détection de l’IA clandestine aide les entreprises à déterminer où se situent les risques d’utilisation abusive de l’IA afin qu’elles puissent mettre en place les garde-fous et les mesures de sécurité qui s'imposent.

Comment prévenir l’utilisation abusive de l’IA avec Cloudflare

La Cloudflare AI Security Suite permet aux entreprises d’identifier l’IA clandestine, de protéger leurs modèles contre les abus, de sécuriser l’accès des agents IA et de bloquer l’exposition des données. Cela permet aux organisations d’accélérer l’adoption de l’IA tout en garantissant la sécurité. En savoir plus sur la AI Security Suite.

 

FAQ

Qu’entend-on par utilisation abusive de l’intelligence artificielle ?

On parle de mauvaise utilisation de l’IA lorsque des individus ou des groupes emploient des modèles pour des activités qui ne correspondent pas à leur conception initiale, en particulier à des fins trompeuses, illégales ou nuisibles. Cela comprend l’utilisation de ces outils pour créer des contenus dangereux ou interdits, ou pour faciliter les opérations frauduleuses.

Comment les acteurs malveillants peuvent-ils utiliser les modèles d’IA générative pour compromettre la cybersécurité ?

Les acteurs malveillants peuvent tirer parti de l’IA générative pour écrire des logiciels malveillants, repérer les failles dans les logiciels et déceler les exploitations de vulnérabilités zero-day. Ils utilisent également ces outils pour automatiser l’ingénierie sociale, en générant des messages de phishing convaincants et en identifiant les cibles potentielles pour des campagnes de phishing ciblé à long terme. Par ailleurs, les modèles d’IA générative peuvent permettre aux acteurs malveillants de mettre la main sur des informations confidentielles.

Comment les développeurs peuvent-ils sécuriser un modèle avant qu’il n’atteigne la phase de production ?

La sécurité commence pendant la phase d’entraînement par la validation des données afin qu’elles ne soient pas biaisées, ne contiennent pas d’informations privées ni de portes dérobées dissimulées. Les développeurs de modèles d’IA doivent également utiliser diverses sources de données, appliquer le principe du moindre privilège à l’accès aux données et utiliser un entraînement antagoniste pour permettre au modèle de reconnaître les entrées trompeuses.

Que sont les garde-fous spécifiques de l’IA ?

Les garde-fous constituent des politiques et des contrôles essentiels qui maintiennent le comportement de l’IA dans des limites sûres et prédéfinies.

Comment la validation des invites permet-elle de prévenir les violations de la sécurité ?

La validation des invites agit comme un filtre qui identifie et bloque les requêtes trompeuses ou nuisibles avant qu’elles n’atteignent le modèle d’IA. Ce processus permet d’arrêter les attaques par injection d’invites, dans lesquelles les utilisateurs tentent de tromper le système pour contourner ses mesures de sécurité.