Como aprimorar modelos de IA com RAG (geração aumentada de recuperação)

Pipelines de geração aumentada de recuperação (RAG) bem construídos podem ajudar as organizações a transformarem dados inativos em direcionadores de negócios decisivos.

Objetivos de aprendizado

Após ler este artigo, você será capaz de:

  • Definir a geração aumentada de recuperação (RAG)
  • Criar pipelines RAG de sucesso
  • Identificar as melhores formas de medir o sucesso de um pipeline de RAG

Copiar o link do artigo

O que é geração aumentada de recuperação (RAG) e por que ela é importante?

A geração aumentada de recuperação (RAG) é uma técnica usada no desenvolvimento de inteligência artificial (IA) que aprimora grandes modelos de linguagem (LLMs), dando-lhes acesso a fontes de dados internas e externas que não foram incluídas em seu treinamento original, como pesquisas de terceiros, documentação de produtos ou a base de conhecimento interna de uma empresa.

Usando a RAG, as equipes podem consultar o conhecimento organizacional autorizado e recursos de terceiros em linguagem natural para evitar interromper colegas ou realizar pesquisas demoradas em sistemas fragmentados.

Como o LLM utiliza dados suplementares em tempo de execução, a probabilidade de alucinações diminui e todos trabalham com a mesma fonte da verdade. O resultado é maior precisão de LLMs, graças a informações fundamentadas e confiáveis.

Quais etapas são necessárias para construir pipelines de RAG bem-sucedidos?

O RAG ajuda as empresas a aprimorar os modelos de IA que utilizam, de fornecedores como OpenAI ou Anthropic, sem o tempo extra, os custos e os recursos técnicos que seriam necessários para retreiná-los com conhecimento específico para o caso de uso pretendido. Portanto, o RAG democratiza o aprimoramento de LLMs.

Felizmente, a criação de pipelines de RAG não requer uma infraestrutura enorme nem profundo conhecimento em aprendizado de máquina. Começar a usar é fácil. O processo simples de três partes começa com a identificação de casos de uso, a seleção de fontes de dados apropriadas e a criação do pipeline de RAG.

Etapa 1: Conceber possíveis casos de uso de RAG

Primeiro, determine quais fontes de dados seriam mais úteis para as equipes acessarem usando prompts de linguagem natural. Concentre-se em pontos de atrito de alto impacto, incluindo recursos que as equipes consultam frequentemente para obter respostas, sistemas onde frequentemente encontram gargalos ou processos onde as mesmas perguntas surgem repetidamente.

Para identificar os casos de uso de RAG mais promissores, formule as seguintes perguntas às equipes internas:

     
  • Quais são as solicitações comuns de conhecimento institucional que residem na mente das pessoas ou em documentos escritos de difícil acesso? Os exemplos incluem procedimentos operacionais padrão e resoluções de problemas comuns. Com a ajuda da RAG, um assistente de cobrança por autoatendimento poderia responder a perguntas comuns dos usuários, como: “Onde posso baixar minhas faturas anteriores?”
  •  
  • Quais perguntas são frequentemente transferidas entre as equipes? Dúvidas sobre a evolução das políticas técnicas, por exemplo, provavelmente surgem com frequência. Usando a RAG, um assistente de política voltado para o cliente pode explicar a política de reembolso da empresa.
  •  
  • Quais arquivos ou tarefas exigem consultas manuais e repetitivas em vários locais, como Confluence, SharePoint e wikis internas? Um assistente de conformidade habilitado por RAG poderia extrair informações das diretrizes de RH para responder: “Quais módulos de treinamento são obrigatórios para novos funcionários na Europa?”
  •  
  • Quais necessidades ou requisitos formais devem ser atendidos? Respostas a auditorias, solicitações de propostas (RFPs) e conformidade são casos de uso comuns. Graças à RAG, um assistente de vendas de RFP pode extrair modelos aprovados para conformidade para gerar respostas de RFP.
  •  
  • Quais informações se aplicam a todos? Os documentos de treinamento e integração da empresa são universalmente úteis, por exemplo. Um guia interativo de integração de clientes pode usar RAG para orientar novos usuários nas etapas de treinamento, recuperando os materiais de instruções mais recentes.

Priorize casos de uso de RAG nos quais a combinação do raciocínio generativo com conhecimento interno e externo possa resolver problemas tangíveis, reduzir a troca de contexto, eliminar tarefas repetitivas e melhorar a consistência entre as equipes.

Etapa 2: Identificar internamente fontes de dados adequadas para o RAG

Os sistemas de RAG são tão fortes quanto os dados que eles recuperam. Portanto, a qualidade, a completude, a governança e a estrutura das fontes de dados disponíveis afetam diretamente a qualidade da resposta.

Dados adequados para RAG atendem aos seguintes critérios:

     
  • Respondem a perguntas comuns: as fontes ideais incluem perguntas frequentes sobre produtos, documentação de políticas, guias de processos internos e mapeamentos de conformidade.
  •  
  • São precisos e mantidos: procuram documentação com propriedade clara e uma frequência de atualização regular.
  •  
  • São suficientemente estruturados para segmentação: arquivos Markdown, PDFs, documentos HTML, arquivos JSON e wikis podem ser divididos em seções lógicas. Se os conjuntos de dados incluírem capturas de tela ou PDFs baseados em images, ferramentas como o Cloudflare Workers AI conseguem converter imagens em vetores que podem ser lidos por LLMs.

Evite fontes de dados que introduzam ruído ou inconsistência, incluindo:

     
  • Dados em formatos não estruturados e desorganizados, por exemplo, threads do Slack ou correntes de e-mail não tratados, a menos que sejam limpos, verificados e formatados.
  •  
  • Conjuntos de dados fluidos e em constante mudança, como painéis com métricas em tempo real.
  •  
  • Arquivos duplicados, conflitantes ou desatualizados, que podem confundir a recuperação e introduzir erros.

Trabalhe com as partes interessadas internas e a equipe de TI para inventariar, remover dados duplicados e atribuir a responsabilidade contínua a cada fonte de dados.

Etapa 3: Construir um pipeline de RAG

Em seguida, processe e organize os conjuntos de dados em uma estrutura que seja adequada para a recuperação semântica. Um fluxo de trabalho de RAG típico inclui cinco partes: ingestão, embedding, armazenamento de banco de dados vetorial, recuperação de consulta e geração de respostas.

1. Ingestão

Comece coletando arquivos e documentos relevantes de repositórios compartilhados, buckets de armazenamento ou sistemas de conteúdo. Em seguida, concentre-se em:

  • Fragmentação: para permitir uma recuperação precisa, divida programaticamente o conteúdo em seções lógicas que criem unidades semanticamente coerentes (por exemplo, parágrafos, títulos, itens de perguntas frequentes e blocos de código).
  • Normalização: limpeza e padronização de dados entre formatos (por exemplo, PDFs para texto, HTML para Markdown).
  •  
  • Marcação de metadados: anexar metadados úteis (por exemplo, proprietário, data de criação, sistema) para auxiliar na recuperação filtrada.

2. Embedding

Use um modelo de embedding, como os modelos de embedding BGE, para converter cada trecho de texto em um vetor numérico que capture seu significado semântico.

3. Armazenamento de banco de dados de vetores

Armazene embeddings e todos os metadados associados em um banco de dados vetorial escalável, como o Cloudflare Vectorize. Isso possibilita a consulta e filtragem eficientes de bases de conhecimento em larga escala.

4. Recuperação de consulta

Quando um usuário envia um prompt, o sistema: converte a consulta em um vetor, pesquisa o banco de dados vetorial em busca de trechos apropriados e semanticamente semelhantes, e aplica filtros baseados em metadados para ajustar a recuperação, por exemplo, limitando o acesso a informações específicas com base na função ou departamento.

5. Geração de respostas

Por fim, os trechos recuperados são injetados no prompt como contexto adicional antes de serem passados para o LLM. O LLM utiliza esse contexto para gerar uma resposta significativa e precisa, fundamentada em dados internos e externos.

Você deve fazer parceria com o departamento de TI na execução e implementação de RAG?

Estabelecer um pipeline de RAG de alta qualidade é um esforço que exige o envolvimento de todos. No entanto, ele depende da TI para: liderar a execução, gerenciar infraestruturas como pipelines de dados, dimensionamento de banco de dados vetorial e controle de acesso e integrar sistemas.

No entanto, a TI não pode ser a única responsável pelo processo. Comece alinhando as equipes multifuncionais, incluindo a equipe de TI, os especialistas no assunto e as partes interessadas da empresa. Em conjunto, essas equipes devem identificar casos de uso e fontes de dados confiáveis, definir padrões de autoridade de conteúdo e atribuir propriedade para garantir que os conjuntos de dados permaneçam precisos e atualizados.

Aplique controles de acesso para restringir dados sensíveis por função do usuário ou unidade de negócios e garanta que as proteções de criptografia e conformidade estejam implementadas em todo o sistema.

Comece com um projeto piloto, itere com base nos resultados e, em seguida, expanda para outras equipes.

Qual é a melhor forma de medir o sucesso do seu pipeline de RAG?

Crie métricas de sucesso no processo desde o início para avaliar a eficácia do sistema de RAG e o valor para a empresa.

Em particular, avalie o sistema em relação a KPIs, como:

  • Precisão da recuperação: os documentos e respostas corretos estão sendo exibidos?
  •  
  • Relevância e fidedignidade da resposta: os usuários estão recebendo respostas atuais e confiáveis?
  •  
  • Latência: as respostas são entregues em um período aceitável?
  •  
  • Adoção e satisfação dos usuários: os funcionários estão realmente usando o sistema e ganhando eficiência?
  •  
  • Governança de dados: as proteções de segurança e conformidade são mantidas à medida que novas fontes são adicionadas?

A avaliação de RAG geralmente envolve intervenção humana para verificar a precisão. Para aprimorar a implementação do pipeline de RAG ao longo do tempo, colete continuamente feedback dos usuários, analise as métricas de desempenho nos logs de consulta e recuperação, analise a qualidade do conteúdo e avalie o progresso em relação aos objetivos da empresa.

Como você pode simplificar a criação de fluxo de trabalho de RAG?

Criar manualmente um pipeline de RAG requer integrar armazenamento, bancos de dados vetoriais, modelos de embedding, LLMs e lógica personalizada de indexação/recuperação, bem como manter o sistema à medida que os dados mudam. Requer tempo e colaboração e a complexidade dessas tarefas pode desviar as equipes de outros projetos de alto impacto. Para algumas organizações, a adoção do RAG torna-se impraticável, apesar de seus benefícios em potencial.

O AI Search da Cloudflare (antigo AutoRAG) pode ajudar.

O AI Search é um pipeline de RAG totalmente gerenciado, construído na plataforma para desenvolvedores da Cloudflare. Em apenas quatro etapas, os usuários podem conectar fontes de dados, como websites corporativos, catálogos de produtos de comércio eletrônico e documentação para desenvolvedores. O AI Search lida com a ingestão, conversão de markdown, fragmentação, embedding e armazenamento no Vectorize. Em seguida, ele executa a recuperação semântica e gera respostas com o Workers AI.

O AI Search remove o pesado fardo de infraestrutura da criação de pipelines de RAG, automatizando a escala, o armazenamento e a inferência de IA, ao mesmo tempo que garante que as fontes de dados internas sejam acessadas de forma segura e apropriada nos sistemas RAG. Além disso, o AI Search reindexa continuamente os dados em segundo plano, mantendo as respostas atualizadas à medida que as fontes internas são atualizadas.

Por que você deve usar o RAG?

Os dados de sua organização são um ativo estratégico enorme. A criação de um pipeline de RAG seguro torna esses dados acessíveis aos membros da equipe e clientes, ao aumentar os LLMs corporativos com as diretrizes, os processos e a base de conhecimento exclusivos que diferenciam sua empresa e o mercado.

Simplificando: o RAG aprimora modelos populares com o conhecimento interno da empresa e recursos de terceiros aprovados para obter vantagem de IA em tempo real.

Seja criando manualmente ou com o AI Search, comece com os casos de uso certos, organize dados de alta qualidade e colabore para fornecer respostas rápidas, precisas e fundamentadas.

Pronto para começar? Crie seu próprio RAG interno em quatro etapas fáceis.

Perguntas frequentes

O que é geração aumentada de recuperação (RAG)?

A geração aumentada por recuperação (RAG) é um método para aprimorar grandes modelos de linguagem (LLMs), fornecendo a eles acesso a fontes de dados internas e externas que não faziam parte de seu treinamento original.

Quais são os principais benefícios de usar o RAG?

O RAG permite que as equipes consultem o conhecimento organizacional e recursos de terceiros usando linguagem natural, o que ajuda a evitar interromper colegas e a reduzir o tempo gasto em buscas manuais. Também democratiza o aprimoramento de modelos de IA de fornecedores como OpenAI ou Anthropic, sem a necessidade do tempo, custo ou recursos técnicos exigidos para um retreinamento completo.

Quais são as etapas para construir um pipeline de RAG?

As etapas para criar um pipeline de RAG são: conceber possíveis casos de uso, identificar fontes de dados apropriadas e criar o pipeline de RAG propriamente dito. A criação do pipeline envolve a ingestão de conteúdo, o uso de um modelo de embedding para converter texto em vetores, o armazenamento de embeddings e metadados em um banco de dados vetorial, a habilitação da recuperação de consultas e a facilitação da geração de respostas.

Quais são alguns exemplos de casos de uso de RAG de alto impacto?

Os casos de uso de RAG de alto impacto incluem a criação de: um assistente de faturamento de autoatendimento, um assistente de políticas voltado para o cliente, um assistente de compliance para diretrizes de RH, um assistente de RFP de vendas e um guia interativo de integração do cliente. Esses casos de uso podem ajudar a resolver problemas concretos, reduzir tarefas repetitivas e melhorar a consistência entre as equipes.

Que tipos de fontes de dados são adequados para um sistema de RAG?

Fontes de dados adequadas para RAG devem ser precisas, mantidas regularmente e estruturadas o suficiente para serem divididas em seções lógicas, como arquivos Markdown, PDFs, documentos HTML ou arquivos JSON. Elas também devem responder a perguntas comuns, como perguntas frequentes sobre produtos ou guias de processos internos.

Quais são as cinco partes de um fluxo de trabalho de RAG típico?

Um fluxo de trabalho de RAG típico consiste em cinco partes: embedding, incorporação, armazenamento de banco de dados vetorial, recuperação de consulta e geração de respostas.

Como você pode medir o sucesso de um pipeline de RAG?

O sucesso de um pipeline de RAG pode ser medido usando indicadores-chave de desempenho (KPIs), como precisão de recuperação, relevância e fidedignidade da resposta, latência, adoção e satisfação de usuários e governança de dados. O feedback contínuo de usuários e a análise de métricas de desempenho podem ajudar a aprimorar a implementação ao longo do tempo.

Qual é o benefício de usar um modelo de embedding em um pipeline de RAG?

Um modelo de embedding, como os modelos de embedding BGE, converte trechos de texto em vetores numéricos que capturam seu significado semântico. Esses vetores são então armazenados em um banco de dados de vetores para consulta e filtragem eficientes.

O que o Cloudflare AI Search faz para simplificar a criação de fluxos de trabalho de RAG?

O Cloudflare AI Search é um pipeline de RAG totalmente gerenciado que automatiza a ingestão, fragmentação, embedding e armazenamento no Vectorize. Ele também lida com a recuperação semântica e a geração de respostas com o Workers AI, o que elimina a necessidade do gerenciamento manual da infraestrutura.