Como bloquear crawlers de IA

Alguns web crawlers de IA extraem conteúdo de websites, treinam modelos de linguagem grandes (LLMs) e geram resumos de IA sem o consentimento dos proprietários do conteúdo original. Saiba como bloqueá-los.

Objetivos de aprendizado

Após ler este artigo, você será capaz de:

  • Entenda o que os crawlers de IA fazem
  • Entenda os problemas que os crawlers de IA criam
  • Identifique as etapas para identificar e limitar os crawlers de IA

Copiar o link do artigo

Como bloquear crawlers de IA

Os web crawlers (também conhecidos como raspadores da web) são bots que acessam, baixam ou indexam conteúdo de toda a internet. Alguns desses bots são enviados por mecanismos de pesquisa para indexar e categorizar conteúdo na internet. Outros bots podem ser maliciosos, enviados para coletar e baixar conteúdo sem a permissão do proprietário do site.

Os crawlers de inteligência artificial (IA) são um tipo de web crawler que usa o conteúdo que coleta para treinar modelos de linguagem grandes (LLMs) ou contribuir com as respostas que esses modelos geram.

Os crawlers de IA operam de forma semelhante aos crawlers de mecanismos de pesquisa tradicionais, pois indexam informações e as usam para responder às consultas dos usuários. No entanto, alguns aspectos de sua funcionalidade podem causar problemas para os proprietários de sites. A compreensão desses problemas é o primeiro passo para retomar o controle sobre o conteúdo original.

Quais problemas os crawlers de IA podem causar?

Os crawlers de IA podem criar diversos problemas para os editores de conteúdo. Eles podem:

     
  • Ignorar as políticas do site que protegem o conteúdo: quando os crawlers de IA enviam solicitações HTTP para baixar o conteúdo do site, espera-se que se anunciem ao site e, em seguida, analisem o conteúdo, o texto, os links, os metadados e as tags. Eles devem seguir as políticas do site, os protocolos do arquivo robots.txt e as diretrizes gerais do site. No entanto, muitos crawlers de IA simplesmente ignoram o conjunto de regras e regulamentos de um site específico e pegam tudo o que podem encontrar, com ou sem permissão.
  •  
  • Roubar propriedade intelectual (IP): os crawlers de IA e seus LLMs podem republicar conteúdo original como conteúdo resumido por IA, sem dar o devido crédito. Crawlers e LLMs também podem combinar indiscriminadamente o conteúdo de vários sites, superenfatizando ou subestimando determinado conteúdo sem avaliar adequadamente a precisão ou a importância de certas ideias.
  •  
  • Reduzir os visitantes para conteúdo original: embora os resumos gerados por IA possam conter links para sites originais, os pesquisadores têm menos probabilidade de visitar esses sites quando podem acessar informações resumidas. Como resultado, os proprietários de websites experimentam uma redução no tráfego e uma diminuição na receita proveniente de anúncios.
  •  
  • Introduzir vieses e gerar informações imprecisas: a análise de dados por IA pode amplificar os vieses existentes e a desinformação intencional incluída nos dados coletados, sem avaliar suficientemente essas informações antes de apresentar resumos gerados por IA. Os modelos de IA também são propensos a “alucinações”, nas quais o modelo de IA basicamente inventa as informações que lhe faltam.
  •  
  • Degradar o desempenho do site: quando rastreiam repetidamente um site, os bots podem tornar os servidores mais lentos, aumentar os tempos de carregamento da página e aumentar os custos de largura de banda.

Que medidas os provedores de conteúdo podem adotar para identificar e limitar os crawlers de IA?

A primeira etapa no gerenciamento da atividade de rastreamento de IA é ter uma melhor compreensão e visibilidade dessa atividade. Entender quais crawlers estão acessando seu site, com que frequência eles fazem isso e quantas referências estão enviando ajudará você a definir o restante da sua estratégia.

Em seguida, os proprietários de sites podem implementar uma estratégia de múltiplos níveis para permitir os crawlers que desejam e bloquear o restante. Essas táticas incluem:

     
  • Atualizar o arquivo robots.txt para restringir o acesso de crawlers de IA a determinados conteúdos. Lembre-se, porém, de que alguns crawlers podem continuar a ignorar o arquivo e suas instruções.
  •  
  • Usar metatags para impedir que os crawlers de IA usem todo o site ou partes específicas dele para treinar LLMs.
  •  
  • Distinguir humanos de bots para limitar bots sem prejudicar a experiência dos usuários. Embora os sites tenham usado testes CAPTCHA no passado para provar que os usuários são humanos, tecnologias mais avançadas, como o Cloudflare Turnstile, são capazes de verificar os usuários e, ao mesmo tempo, reduzir a frustração do usuário. Essa é uma excelente forma de limitar os crawlers de IA que ignoram as instruções de um arquivo robots.txt.
  •  
  • Separar bots bons de bots ruins para que você possa continuar aproveitando os bons. Soluções modernas de gerenciamento de bots podem ajudar você a bloquear bots maliciosos, ao mesmo tempo que permitem que outros acessem seu site.
  •  
  • Empregar a limitação de taxa por meio de uma solução de firewall de aplicação web (WAF) para bloquear ou retardar crawlers de IA em caso de tentativas excessivas de acessar determinado conteúdo.
  •  
  • Implantar um WAF para impedir determinados endereços IP conhecidos de crawlers de IA de acessar seu site.
  •  
  • Capturar crawlers com comportamento inadequado usando uma ferramenta como o Labirinto para IA da Cloudflare, que fornece uma mistura de conteúdo sem sentido e um labirinto de links apenas para bots de IA que foram identificados por ignorar o arquivo robots.txt do site.
  •  
  • Bloquear crawlers por padrão para começar do zero. Ao lançar um novo site, você pode optar por bloquear todos os crawlers inicialmente. Em seguida, você pode implementar recursos para identificar crawlers, monitorar o comportamento deles e selecionar quais têm permissão para rastrear seu site, com certas restrições.

Como a Cloudflare ajuda a proteger contra crawlers de IA?

O Cloudflare AI Crawl Control ajuda os proprietários de conteúdo da web a recuperar o controle sobre os crawlers de IA. A Cloudflare está à frente de cerca de 20% de todas os ativos da web, o que lhe confere uma visão aprofundada sobre todos os tipos de atividade de crawlers. Essa visibilidade permite que os proprietários de conteúdo usem o AI Crawl Control para:

     
  • Entender os padrões de rastreamento de IA em seus ativos da web, por crawler, por domínio ou por página
  •  
  • Gerenciar a atividade de crawlers por meio de regras de bloqueio ou permissão
  •  
  • Solicitar pagamento dos crawlers de IA por varredura, seja por meio de respostas HTTP 402 personalizáveis ou de um sistema de pagamento por varredura criado pela Cloudflare

Clique aqui para começar gratuitamente.

Perguntas frequentes

O que são os crawlers de IA e como eles funcionam?

Os crawlers de IA são um tipo de web crawler (ou web scraper) que acessa, baixa e indexa conteúdo da internet. Eles usam conteúdo extraído para treinar modelos de linguagem grandes (LLMs) ou contribuir para as respostas que esses modelos geram.

Quais são os principais problemas que os crawlers de IA podem causar para os proprietários de sites?

Os crawlers de IA podem ignorar as políticas do site (como as encontradas no arquivo robots.txt), roubar propriedade intelectual (IP), reduzir o número de visitantes do conteúdo original, degradar o desempenho do site, introduzir vieses e gerar informações imprecisas.

Que medidas os provedores de conteúdo podem tomar para limitar o acesso de crawlers de IA aos seus sites?

Os provedores de conteúdo podem implementar uma estratégia de várias camadas, que inclui atualizar o arquivo robots.txt, usar metatags para bloquear crawlers de algumas partes de um site, distinguir humanos de bots, empregar a limitação de taxa e capturar crawlers com comportamento inadequado.

Como os provedores de conteúdo podem diferenciar web crawlers bons dos ruins?

Os provedores de conteúdo podem usar soluções modernas de gerenciamento de bots para ajudar a bloquear bots maliciosos, permitindo simultaneamente que crawlers benéficos acessem seu site. Além disso, eles podem começar bloqueando todos os crawlers por padrão em um novo site.

Como o Cloudflare AI Crawl Control ajuda os proprietários de sites a gerenciar a atividade de crawlers de IA?

O Cloudflare AI Crawl Control ajuda os proprietários de conteúdo a entender os padrões de rastreamento, gerenciar a atividade dos crawlers e solicitar pagamento dos proprietários de crawlers de IA.