Para evitar el uso indebido de los modelos de IA, el primer paso es implementar medidas de seguridad arquitectónicas como límites de protección, validación de datos, validación de prompts y sistemas de prevención de pérdida de datos (DLP).
Después de leer este artículo podrás:
Copiar el enlace del artículo
Los sistemas de inteligencia artificial (IA) tienen gran capacidad y muchos están integrados en los procesos empresariales críticos. En consecuencia, el uso indebido de la IA puede comprometer aplicaciones e infraestructura, exponer a las organizaciones a riesgos de cumplimiento normativo y reputación y, en casos extremos, incluso poner en peligro vidas. Para prevenir un uso indebido, los modelos de IA necesitan implementar medidas de protección, controles de acceso, validación de prompts y otras medidas de seguridad. Las decisiones arquitectónicas, como incorporar la intervención humana (HITL) en la infraestructura de aplicaciones basadas en IA, también pueden mitigar los riesgos de uso indebido.
Se considera uso indebido de la IA cuando los modelos se emplean con objetivos diferentes a los definidos por sus diseñadores, en particular con fines maliciosos o fraudulentos. Con el avance de la eficacia de los modelos de IA, resulta cada vez más importante prevenir su uso indebido.Numerosos especialistas en IA expresan preocupación por el uso potencial de la IA por parte de estados hostiles y organizaciones terroristas (actores que probablemente ya la emplean para impulsar sus objetivos).
Los 10 principales riesgos de OWASP para los modelos lingüísticos de gran tamaño (LLM) enumeran algunas de las formas en que los modelos de IA pueden ser mal utilizados, como la inyección de prompts para manipular su comportamiento, la divulgación de datos sensibles y la introducción de vulnerabilidades en la cadena de suministro al comprometer un LLM del que dependen las aplicaciones posteriores.
Más allá de estos riesgos, algunas personas podrían intentar usar modelos de IA para acceder o generar contenido peligroso o ilegal, desde instrucciones para fabricar un arma hasta contenido explícito dañino.
Para los usuarios habituales y las empresas que dependen de la IA, es importante evitar el uso indebido de la IA para proteger sus datos, su marca y sus clientes, así como para mantener el cumplimiento normativo de la privacidad de los datos.
Los atacantes pueden utilizar modelos de IA para ayudar en muchos tipos de ciberataques. Los modelos de IA generativa y los agentes de IA pueden encontrar vulnerabilidades de software, incluidas, en algunos casos, vulnerabilidades zero day. Pueden escribir programas de malware. Pueden ayudar en las campañas de ingeniería social con mensajes de phishing, y pueden identificar objetivos de phishing. Las aplicaciones de IA agéntica podrían operar de forma autónoma campañas de phishing a largo plazo, campañas de ransomware y otros ciberataques, potenciando las amenazas persistentes avanzadas (APT) y los grupos delictivos organizados.
Incluso los modelos de IA generativa con medidas de seguridad pueden ser utilizados de esta manera, gracias a técnicas como la inyección de prompts y el jailbreak que permiten a las partes malintencionadas aprovechar los modelos para sus propios fines.
Para evitar que las personas y los grupos utilicen las aplicaciones de IA para fines distintos a los previstos, los desarrolladores de aplicaciones y modelos de IA deben integrar una serie de medidas de seguridad en todo el proceso de desarrollo e implementación.
Antes de que un modelo esté en producción, se entrena. La prevención del uso indebido de la IA comienza con la validación de los datos de entrenamiento, para garantizar que estos datos no contengan información sesgada, datos privados ni puertas traseras ocultas que permitan comportamientos inesperados o no autorizados.
Debido a que se necesitan muchos datos de entrenamiento para refinar un modelo, estos suelen provenir de una variedad de orígenes, lo que hace que los datos de entrenamiento sean vulnerables a los ataques a la cadena de suministro. Sin embargo, actores maliciosos también podrían utilizar ataques de envenenamiento de datos para corromper los datos de entrenamiento, con el objetivo de introducir sesgos o puertas traseras de manera intencional.Los envenenadores de datos también pueden entrar directamente en las bases de datos desde afuera de la organización, o las amenazas internas también pueden corromper los datos de entrenamiento.
Más allá de la validación de datos, estas medidas de seguridad ayudan a prevenir los ataques de envenenamiento de datos:
Muchas organizaciones no entrenan sus propios LLM. Para las empresas que dependen de proveedores de LLM, es importante comprender qué medidas de seguridad han implementado para defender sus modelos contra el envenenamiento de datos.
Los clientes de los proveedores de LLM suelen utilizar la generación aumentada por recuperación (RAG) para optimizar el rendimiento de LLM para sus casos de uso. También es fundamental validar y proteger los conjuntos de datos internos que se utilizan para RAG.
Las medidas de seguridad de la IA son políticas y controles que garantizan que los modelos de IA se mantengan dentro de límites predefinidos. Las medidas de seguridad, por ejemplo, pueden permitir que un modelo escriba un correo electrónico, pero evitar que escriba un correo electrónico de phishing. O bien, pueden permitir que un modelo codifique una función, pero evitar que escriba una explotación de vulnerabilidades.
Las medidas de seguridad deben proteger los modelos de IA en todos los aspectos, desde los datos de entrenamiento (como se describió anteriormente) hasta la infraestructura de la aplicación.
La mayoría de las organizaciones que incorporan IA en sus aplicaciones públicas están integrando modelos de IA preexistentes. Las medidas de seguridad de las aplicaciones y la infraestructura, en estos casos, son las áreas en las que tienen mayor control directo. También deben tratar de comprender las medidas de seguridad que los proveedores de LLM han incorporado en sus modelos.
Los modelos de IA son especialmente vulnerables a los ataques de inyección de prompts: indicaciones que engañan a un modelo para que actúe fuera de sus límites de seguridad. Aparte de los ataques deliberados, algunos prompts de usuario pueden infringir los términos del servicio del modelo, como solicitudes de contenido ilegal, peligroso o explícito.
La validación de prompts ayuda a garantizar que los prompts no contengan solicitudes dañinas o engañosas. Así como la validación del esquema de la API bloquea las solicitudes ilegítimas que no se ajustan al esquema de la API, la validación de prompts identifica y bloquea el contenido no seguro antes de que lleguen al modelo de IA.
La intervención humana en el proceso (HITL) es una manera de reducir los riesgos de la toma de decisiones autónomas de la IA. Con HITL, los gerentes humanos siguen participando en el proceso de la IA y pueden validar las decisiones que esta toma. Los modelos pueden entrenarse con retroalimentación directa de humanos, o configurarse para solicitar asistencia humana cuando solo pueden hacer predicciones de baja confianza sobre la respuesta adecuada a un prompt.
Prevención de pérdida de datos (DLP) hace referencia a una categoría de tecnologías que pueden evitar que los datos confidenciales salgan de entornos seguros. DLP puede analizar las llamadas API individuales y los prompts de IA, y al usar una variedad de técnicas, como la huella digital de datos, la coincidencia de palabras clave y la coincidencia de patrones, DLP puede identificar datos confidenciales y bloquear solicitudes cuando sea necesario.
DLP también puede restringir las operaciones de copiar y pegar desde determinadas páginas web o aplicaciones para evitar que los usuarios internos introduzcan información interna en los LLM externos.
El uso indebido de la IA solo se puede evitar si las organizaciones tienen una visibilidad total de dónde se hace ese uso indebido y qué áreas puede afectar.Los modelos de IA se suelen integrar en la infraestructura de la aplicación en lugares inesperados o no autorizados, similar al desafío de Shadow API que enfrentan muchos desarrolladores de aplicaciones. La detección de Shadow AI ayuda a las organizaciones a determinar dónde están los riesgos de uso indebido de la IA para poder implementar las medidas de protección y seguridad adecuadas.
Cloudflare AI Security Suite permite a las organizaciones detectar Shadow AI, proteger los modelos del uso indebido, asegurar el acceso de los agentes de IA y bloquear la exposición de datos. Esto permite a las organizaciones acelerar su ritmo de adopción de IA mientras mantienen la seguridad. Más información sobre AI Security Suite.
El uso indebido de la IA se produce cuando individuos o grupos utilizan modelos para actividades ajenas a su diseño original, en particular, con fines engañosos, ilegales o perjudiciales. Esto incluye el uso de estas herramientas para crear contenido peligroso o restringido, o para facilitar esquemas fraudulentos.
Los actores maliciosos pueden aprovechar la IA generativa para escribir malware, identificar fallas de software y detectar vulnerabilidades zero-day. También utilizan estas herramientas para automatizar la ingeniería social generando mensajes de phishing convincentes e identificando objetivos potenciales para campañas de spear phishing a largo plazo. Además, los ataques de inyección de prompts contra los modelos de IA generativa pueden permitir a los atacantes descubrir información confidencial.
La seguridad comienza durante la fase de entrenamiento con la validación de los datos para garantizar que no contengan sesgos, información privada o puertas traseras ocultas. Los desarrolladores de modelos de IA también deben utilizar diversas fuentes de datos, aplicar el principio de privilegios mínimos al acceso a los datos y utilizar el entrenamiento adversario para ayudar al modelo a reconocer las entradas engañosas.
Las medidas de seguridad son políticas y controles esenciales que garantizan que la IA se mantenga dentro de límites seguros y predefinidos.
La validación de prompts actúa como un filtro que identifica y bloquea las solicitudes engañosas o dañinas antes de que lleguen al modelo de IA. Este proceso ayuda a detener los ataques de inyección de prompts, donde los usuarios intentan engañar al sistema para que pase por alto sus medidas de seguridad.