Como evitar o uso indevido de IA

Evitar o uso indevido de modelos de IA começa com medidas de segurança arquitetônicas, como proteções, validação de dados, validação de prompts e prevenção contra perda de dados (DLP).

Objetivos de aprendizado

Após ler este artigo, você será capaz de:

  • Descrever os impactos do uso indevido de IA
  • Listar algumas das tecnologias que podem evitar o uso indevido de IA

Copiar o link do artigo

Resumo do artigo:

  • Implementar camadas de segurança robustas para evitar o uso indevido da IA, com foco na proteção de dados sensíveis e na prevenção da exploração de grandes modelos de linguagem por meio de injeção de prompts ou exfiltração de dados.
  • Estabelecer estruturas de governança e monitoramento abrangentes para impedir o uso indevido da IA, garantindo que os sistemas automatizados não sejam cooptados para gerar deepfakes, disseminar desinformação ou lançar ataques cibernéticos sofisticados.
  • Proteger todo o ciclo de vida da IA neutralizando vulnerabilidades no treinamento e implantação de modelos, o que é essencial para evitar o uso indevido da IA e manter a integridade organizacional contra ameaças em evolução.

Como evitar o uso indevido de IA

Os sistemas de inteligência artificial (IA) são poderosos e muitos estão incorporados em processos essenciais das empresas. Consequentemente, o uso indevido da IA pode comprometer aplicativos e infraestrutura, expor as organizações a riscos de conformidade e reputação e, em casos extremos, até colocar vidas em risco. Para evitar o uso indevido, os modelos de IA devem ter proteções, controle de acesso, validação de prompts e outras medidas de segurança implementadas. Escolhas arquitetônicas, como a incorporação de intervenção humana (HITL) na infraestrutura de aplicativos baseados em IA, também podem mitigar os riscos do uso indevido.

O que é uso indevido de IA?

O uso indevido de IA é a utilização de modelos de IA para fins diferentes dos pretendidos pelos arquitetos dos modelos, especialmente para fins maliciosos ou fraudulentos. À medida que os modelos de IA continuam a se tornar mais eficazes, a prevenção do uso indevido de IA torna-se cada vez mais importante. Muitos especialistas em IA estão preocupados com os possíveis usos da IA por Estados autoritários e terroristas (grupos que provavelmente já usam a IA para promover suas causas).

Os Top 10 riscos do OWASP para grandes modelos de linguagem (LLMs) descrevem algumas das maneiras pelas quais os modelos de IA podem ser indevidamente utilizados, como injeção de prompts para manipular seu comportamento, divulgação de dados sensíveis e introdução de vulnerabilidades da cadeia de suprimentos ao comprometer um LLM do qual aplicativos downstream dependem.

Além desses riscos, os indivíduos podem tentar usar modelos de IA para acessar ou gerar conteúdo perigoso ou ilegal, desde instruções para construir uma arma até conteúdo explícito prejudicial.

Para usuários comuns e empresas que dependem de IA, evitar o uso indevido da IA é importante para proteger seus dados, sua marca e seus clientes, além de manter a conformidade com as regulamentações de privacidade de dados.

Como a IA generativa pode ser mal utilizada em engenharia social e outros ataques?

Os invasores podem usar modelos de IA para ajudar em muitos tipos de ataques cibernéticos. Modelos de IA generativa e agentes de IA podem encontrar vulnerabilidades de software, incluindo, em alguns casos, explorações de dia zero. Eles podem escrever programas de malware. Podem auxiliar em campanhas de engenharia social criando mensagens de phishing e podem ser capazes de identificar alvos de phishing. Os aplicativos de IA agêntica podem operar de forma autônoma campanhas de phishing de longo prazo, de ransomware e outros ataques cibernéticos, fortalecendo ameaças persistentes avançadas (APTs) e grupos criminosos organizados.

Mesmo os modelos de IA generativa com proteções de segurança podem ser usados indevidamente dessa forma, graças a técnicas como injeção de prompts e jailbreaking, que permitem que partes maliciosas aproveitem os modelos para seus próprios fins.

Estratégias para prevenir o uso indevido de IA

Para evitar que indivíduos e grupos usem aplicativos de IA para outros fins que não os pretendidos, os desenvolvedores de aplicativos e modelos de IA devem integrar uma série de medidas de segurança durante todo o processo de desenvolvimento e implantação.

Validação de dados de treinamento

Antes de um modelo entrar em produção, ele é treinado. A prevenção do uso indevido de IA começa com a validação dos dados de treinamento para garantir que eles não contenham dados tendenciosos, privados ou backdoors ocultos que permitam comportamentos não autorizados inesperados.

Como são necessários muitos dados de treinamento para refinar um modelo, eles tendem a vir de várias fontes, deixando os dados de treinamento vulneráveis a ataques à cadeia de suprimentos. Mas partes maliciosas também podem usar ataques de envenenamento de dados para corromper dados de treinamento, com o objetivo de introduzir viés ou backdoors intencionalmente. Os envenenadores de dados também podem invadir diretamente bancos de dados de fora da organização, ou ameaças internas podem corromper os dados de treinamento.

Além da validação de dados, essas medidas de segurança ajudam a evitar ataques de envenenamento de dados:

  • Princípio do menor privilégio: aplicar esse princípio de zero trust a armazenamentos de dados de treinamento ajuda a garantir que apenas pessoas e sistemas que realmente precisam de acesso, o tenham. Isso reduz o risco de que os dados de treinamento sejam comprometidos por invasores externos.
  • Fontes de dados diversificadas: extrair dados de treinamento de várias fontes ajuda a corrigir os vieses que possam estar presentes nos dados de uma única fonte.
  • Monitoramento e auditoria: rastrear alterações nos dados de treinamento armazenados permite que as organizações identifiquem atividades suspeitas e verifiquem se um conjunto de dados de treinamento foi comprometido.
  • Treinamento adversarial: esta técnica envolve treinar um modelo de IA para reconhecer entradas intencionalmente enganosas.

Muitas organizações não treinam seus próprios LLMs. Para empresas que dependem de provedores de LLM, é importante entender quais medidas de segurança eles adotaram para proteger seus modelos contra envenenamento de dados.

Os clientes de provedores de LLM normalmente usam geração aumentada de recuperação (RAG) para otimizar o desempenho de LLMs para seus casos de uso. Validar e proteger os conjuntos de dados internos usados para o RAG também é essencial.

Proteções de IA

As proteções de IA são políticas e controles que garantem que os modelos de IA permaneçam dentro de limites predefinidos. Por exemplo, as proteções podem permitir que um modelo escreva um e-mail, mas impedir que ele escreva um e-mail de phishing. Ou podem permitir que um modelo codifique uma função, mas impedi-lo de escrever uma exploração de vulnerabilidade.

As proteções devem defender os modelos de IA em todos os aspectos, desde dados de treinamento (conforme descrito acima) até a infraestrutura de aplicativos.

  • Proteções de infraestrutura: envolve a proteção de cargas de trabalho de IA em nuvem com medidas eficazes de segurança nativa de nuvem, como proteção de APIs, segurança de rede, criptografia e gerenciamento de identidade e acesso (IAM).
  • Proteção de aplicativos: os modelos de IA geralmente são integrados a aplicativos voltados para o usuário por meio de APIs, e as APIs podem aplicar políticas para bloquear conteúdo prejudicial ou perigoso que ultrapasse os as proteções de modelo.
  • Proteções de modelo: trata-se de ajustar um modelo para precisão e otimizá-lo para o propósito a que se destina. Os modelos devem ser treinados para identificar quais tipos de respostas são indesejáveis, de modo que evitem produzir essas respostas durante a inferência.

A maioria das organizações que incorporam a IA em seus aplicativos voltados ao público está integrando modelos de IA preexistentes. Nesses casos, as proteções de aplicativos e infraestrutura são as áreas sobre as quais elas têm mais controle direto. Eles também devem procurar entender as proteções que os provedores de modelos incorporaram em seus modelos.

Validação de prompts

Os modelos de IA são especialmente vulneráveis a ataques de injeção de prompts: prompts enganosos que levam um modelo a ultrapassar suas proteções. Além de ataques deliberados, alguns prompts de usuários podem violar os Termos de Serviço do modelo, como solicitações de conteúdo ilegal, perigoso ou explícito.

A validação de prompts ajuda a garantir que os prompts não contenham solicitações prejudiciais ou enganosas. Assim como a validação de esquema de APIs bloqueia solicitações ilegítimas que não estão em conformidade com o esquema, a validação de prompts identifica e bloqueia conteúdo inseguro em prompts antes que eles cheguem ao modelo de IA.

Envolvimento humano no processo (HITL)

O envolvimento humano no processo (HITL) é uma possível abordagem arquitetônica para reduzir os riscos da tomada de decisões por modelos de IA não supervisionados. O HITL mantém os gerentes humanos integrados ao fluxo de trabalho da IA para que possam aprovar decisões tomadas pelos modelos de IA. Os modelos podem ser treinados com feedback humano direto ou configurados para solicitar assistência humana quando só podem fazer previsões de baixa confiança sobre a resposta apropriada a um prompt.

Prevenção contra perda de dados (DLP)

Prevenção contra perda de dados (DLP) refere-se a uma categoria de tecnologias que podem impedir que dados confidenciais saiam de ambientes protegidos. A DLP pode analisar chamadas de API individuais e prompts de IA e, usando uma infinidade de técnicas, incluindo impressão digital de dados, correspondência de palavras-chave e correspondência de padrões, a DLP pode identificar dados sensíveis e confidenciais e bloquear solicitações quando necessário.

A DLP também pode restringir a cópia e colagem de determinadas páginas web ou aplicativos para evitar que insiders alimentem informações internas em LLMs externos.

Detecção de IA não autorizada

O uso indevido da IA só pode ser evitado se as organizações tiverem uma visão completa de onde esse uso indevido pode ser possível e pode ter um impacto. Os modelos de IA muitas vezes acabam incorporados à infraestrutura de aplicativos em locais inesperados ou não autorizados, semelhante ao desafio da API oculta enfrentado por muitos desenvolvedores de aplicativos. A detecção da IA não autorizada ajuda as organizações a determinar onde estão os riscos de uso indevido da IA, para que possam implementar proteções e medidas de segurança adequadas.

Como evitar o uso indevido de IA com a Cloudflare

O Cloudflare AI Security Suite permite que as organizações descubram IA não autorizada, defendam modelos contra violações, protejam o acesso de agentes de IA e bloqueiem a exposição de dados. Isso permite que as organizações acelerem a taxa de adoção de IA mantendo a segurança. Saiba mais sobre o AI Security Suite.

 

Perguntas frequentes

O que constitui um uso indevido de inteligência artificial?

O uso indevido de IA ocorre quando indivíduos ou grupos empregam modelos para atividades fora do projeto original dos modelos, particularmente para fins enganosos, ilegais ou prejudiciais. Isso inclui o uso dessas ferramentas para criar conteúdo perigoso ou restrito ou para facilitar esquemas fraudulentos.

De que forma os invasores podem usar modelos de IA generativa para comprometer a segurança cibernética?

Agentes maliciosas podem aproveitar a IA generativa para escrever malware, identificar falhas de software e descobrir explorações de dia zero. Eles também usam essas ferramentas para automatizar a engenharia social, gerando mensagens de phishing convincentes e identificando possíveis alvos para campanhas de spear phishing no longo prazo. Além disso, ataques de injeção de prompts contra modelos de IA generativa podem permitir que os invasores descubram informações confidenciais.

Como os desenvolvedores podem proteger um modelo antes que ele chegue à fase de produção?

A segurança começa durante a fase de treinamento, validando os dados para garantir que estejam livres de viés, informações privadas ou backdoors ocultos. Os desenvolvedores de modelos de IA também devem usar diversas fontes de dados, aplicar o princípio do menor privilégio ao acesso aos dados e utilizar treinamento adversarial para ajudar o modelo a reconhecer entradas enganosas.

O que são proteções de IA?

As proteções são políticas e controles essenciais que mantêm o comportamento da IA dentro de limites seguros e predefinidos.

Como a validação de prompts evita as violações de segurança?

A validação de prompts atua como um filtro que identifica e bloqueia solicitações enganosas ou prejudiciais antes que elas cheguem ao modelo de IA. Esse processo ajuda a deter ataques de injeção de prompts, em que os usuários tentam enganar o sistema para escapar de suas medidas de segurança.