Cómo mejorar los modelos de IA con RAG (Generación aumentada por recuperación)

Las canalizaciones de generación aumentada por recuperación (RAG) bien desarrolladas pueden ayudar a las organizaciones a convertir los datos inactivos en impulsores comerciales decisivos.

Metas de aprendizaje

Después de leer este artículo podrás:

  • Definición de la generación aumentada por recuperación (RAG)
  • Desarrollar procesos RAG exitosos
  • Identificar las mejores maneras de medir el éxito de una canalización RAG

Copiar el enlace del artículo

¿Qué es la generación aumentada por recuperación (RAG) y por qué es valiosa?

La generación aumentada por recuperación (RAG) es una técnica utilizada en el desarrollo de la inteligencia artificial (IA) que mejora los modelos de lenguaje grandes (LLM) al darles acceso a fuentes de datos internas y externas que no se incluyeron en su entrenamiento original; por ejemplo, investigaciones de terceros, documentación de productos o la base de conocimiento interna de una empresa.

Con la RAG, los equipos pueden consultar el conocimiento organizacional autorizado y los recursos de terceros en lenguaje natural para evitar interrumpir a los compañeros o realizar búsquedas que requieren mucho tiempo en sistemas fragmentados.

Dado que el LLM utiliza datos complementarios en tiempo de ejecución, las alucinaciones son menos probables y todos trabajan con la misma fuente de información veraz. El resultado es una mayor precisión del LLM gracias a información confiable y fundamentada.

¿Qué pasos se necesitan para construir canalizaciones RAG exitosas?

La generación aumentada por recuperación (RAG) ayuda a las empresas a mejorar los modelos de IA que utilizan, de proveedores como OpenAI o Anthropic, sin el tiempo, los gastos y los recursos técnicos adicionales que se requerirían para volver a capacitarlos en conocimientos específicos para el caso de uso previsto. Por lo tanto, la RAG democratiza la mejora de los LLM.

Afortunadamente, la creación de canalizaciones RAG no requiere una infraestructura masiva ni una gran experiencia del aprendizaje automático. Así que, empezar es fácil. El proceso sencillo de tres pasos comienza con la identificación de los casos de uso, la selección de fuentes de datos adecuadas y la creación de canalizaciones RAG.

Paso 1: Idear posibles casos de uso de RAG

En primer lugar, determina qué fuentes de datos serían más útiles para que los equipos accedan mediante el uso de prompts en lenguaje natural. Concéntrate en los puntos débiles de alto impacto, incluidos los recursos a los que los equipos recurren con frecuencia para obtener respuestas, los sistemas en los que suelen encontrar cuellos de botella o los procesos en los que las mismas preguntas surgen repetidamente.

Para encontrar los casos de uso de RAG más prometedores, formula las siguientes preguntas a los equipos internos:

     
  • ¿Qué solicitudes habituales de conocimiento institucional residen en la mente de las personas o en documentos escritos de difícil acceso? Los ejemplos incluyen procedimientos operativos estándar y resoluciones a problemas habituales. "Con la ayuda de la RAG, un asistente de facturación de autoservicio podría responder preguntas habituales de los usuarios como: “¿Dónde puedo descargar las facturas anteriores?”
  •  
  • ¿Qué preguntas se escalan frecuentemente entre los equipos? Las consultas sobre políticas técnicas en evolución, por ejemplo, probablemente surjan con frecuencia. Mediante la RAG, un asistente de las políticas de atención al cliente puede explicar la política de reembolso de una empresa.
  •  
  • ¿Qué archivos o tareas requieren consultas manuales y repetitivas en varias ubicaciones, como Confluence, SharePoint y wikis internos? Un asistente de cumplimiento normativo habilitado por la RAG podría consultar las indicaciones de recursos humanos para responder: «¿Qué módulos de formación se requieren para las nuevas contrataciones en Europa?»
  •  
  • ¿Qué necesidades o requisitos formales deben cumplirse? Las respuestas a auditorías, solicitudes de propuestas (RFP) y el cumplimiento normativo son casos de uso habituales. Gracias a la RAG, un asistente de RFP de ventas puede extraer plantillas aprobadas para el cumplimiento normativo con el fin de generar respuestas a las RFP.
  •  
  • ¿Qué información se aplica a todos? Por ejemplo, los documentos de capacitación e incorporación de la empresa son universalmente útiles. Una guía interactiva de incorporación de clientes podría aprovechar RAG para guiar a los nuevos usuarios a través de los pasos de capacitación mediante la recuperación de los materiales de procedimientos más actualizados.

Prioriza los casos de uso de RAG en los que la combinación del razonamiento generativo con el conocimiento interno y externo pueda resolver problemas tangibles, reducir el cambio de contexto, eliminar las tareas repetitivas y mejorar la consistencia entre los equipos.

Paso 2: Identificar internamente fuentes de datos dignas de RAG

Los sistemas RAG son tan sólidos como los datos que recuperan. Por lo tanto, la calidad, la integridad, la gobernanza, y la estructura de las fuentes de datos disponibles impactan directamente en la calidad de la respuesta.

Los datos aptos para RAG cumplen con los siguientes requisitos:

     
  • Responde a preguntas frecuentes: las fuentes ideales incluyen preguntas frecuentes sobre productos, documentación de políticas, guías de procesos internos y mapeos de cumplimiento normativo.
  •  
  • Es precisa y se mantiene actualizada: busca documentación con una clara identificación de la propiedad y una frecuencia de actualización regular.
  •  
  • Posee una estructura adecuada para la fragmentación: los archivos Markdown, los PDF, los documentos HTML, los archivos JSON y las wikis se pueden dividir en secciones lógicas. Si los conjuntos de datos incluyen capturas de pantalla o archivos PDF basados en images, herramientas como Workers AI de Cloudflare pueden convertir images en vectores que luego pueden ser leídos por los LLM.

Evita las fuentes de datos que introduzcan ruido o inconsistencias entre ellas:

     
  • Datos en formatos no estructurados y desordenados, por ejemplo, conversaciones de Slack o cadenas de correo electrónico sin procesar, a menos que se limpien, verifiquen y se les dé formato.
  •  
  • Conjuntos de datos fluidos y en constante cambio, como los paneles con métricas en tiempo real.
  •  
  • Archivos duplicados, conflictivos o desactualizados, que pueden confundir la recuperación e introducir errores.

Colabora con los clientes internos y el departamento de informática para inventariar, eliminar datos duplicados y asignar la propiedad continua a cada fuente de datos.

Paso 3: Crear una canalización RAG

Procesa y organiza los conjuntos de datos en una estructura que sea adecuada para la recuperación semántica. Un flujo de trabajo típico de RAG incluye cinco partes: ingesta, incrustación, almacenamiento de bases de datos vectoriales, recuperación de consultas y generación de respuestas.

1. Ingesta

Comienza recolectando archivos y documentos relevantes de repositorios compartidos, buckets de almacenamiento o sistemas de contenido. Luego, enfócate en:

  • La fragmentación: para permitir una recuperación precisa, divide el contenido mediante programación en secciones lógicas que crean unidades semánticamente coherentes (p. ej., párrafos, encabezados, preguntas frecuentes y bloques de código).
  • La normalización: limpia y estandariza los datos en todos los formatos (p. ej., de PDF a texto, de HTML a Markdown).
  •  
  • El etiquetado de metadatos: añade metadatos útiles (p. ej., propietario, fecha de creación, sistema) para facilitar la recuperación filtrada.

2. Incrustación

Utiliza un modelo de incrustación, como los modelos de incrustación BGE, para convertir cada fragmento de texto en un vector numérico que capture su significado semántico.

3. Almacenamiento de base de datos vectorial

Almacena las incrustaciones y todos los metadatos asociados en una base de datos vectorial escalable, como Vectorize de Cloudflare. Esto permite realizar consultas y filtrados eficientes en bases de conocimiento a gran escala.

4. Recuperación de consultas

Cuando un usuario envía un prompt, el sistema convierte la consulta en un vector, busca en la base de datos vectorial fragmentos apropiados y semánticamente similares, y aplica filtros en función de los metadatos para afinar la recuperación, por ejemplo, mediante la limitación del acceso a información específica basada en la función o el departamento.

5. Generación de respuestas

Finalmente, los fragmentos recuperados se inyectan en los prompts como contexto adicional antes de pasarlos al LLM. El LLM utiliza este contexto para generar una respuesta significativa y precisa que se basa en datos internos y externos.

¿Deberías trabajar junto con el departamento de informática para la ejecución e implementación de RAG?

Poner en marcha una canalización RAG valiosa requiere un esfuerzo conjunto. Sin embargo, depende del equipo de informática para: liderar la ejecución, gestionar infraestructuras como canalizaciones de datos, escalado de bases de datos vectoriales y control de acceso, e integrar sistemas.

Sin embargo, el equipo de informática no puede ser el único dueño del proceso. Comienza por alinear los equipos multifuncionales, incluidos los de informática, los expertos en la materia y las partes interesadas de la empresa. En conjunto, estos equipos deben identificar casos de uso y fuentes de datos confiables, definir estándares de autoridad de contenido y asignar la propiedad para garantizar que los conjuntos de datos se mantengan precisos y actualizados.

Implementa controles de acceso para restringir los datos confidenciales según la función del usuario o la unidad de negocio, y asegúrate de que existan protecciones de cifrado y cumplimiento normativo en todo el sistema.

Comienza con un piloto, reitera según los resultados y luego escala entre equipos.

¿Cuál es la mejor manera de medir el éxito de tu canalización RAG?

Incorpora métricas de éxito en el proceso desde el principio para evaluar la efectividad del sistema RAG y su valor comercial.

En particular, evalúa el sistema con respecto a los KPI como:

  • La precisión de la recuperación: ¿Se muestran los documentos y las respuestas correctos?
  •  
  • La relevancia y veracidad de las respuestas: ¿Reciben los usuarios respuestas actuales y confiables?
  •  
  • La latencia: ¿Las respuestas se entregan en un plazo aceptable?
  •  
  • La adopción y satisfacción del usuario: ¿Los empleados están realmente utilizando el sistema y aumentando la eficiencia?
  •  
  • La gobernanza de los datos:¿Se mantienen las medidas de seguridad y el cumplimiento normativo mientras se agregan nuevas fuentes?

La evaluación RAG suele requerir la validación humana en el circuito para verificar la precisión. Para mejorar la implementación de la canalización RAG a lo largo del tiempo, solicita de forma continua comentarios de los usuarios, analiza las métricas de rendimiento en los registros de consulta y recuperación, revisa la higiene del contenido y evalúa el progreso con respecto a los objetivos comerciales.

¿Cómo puedes simplificar la creación de flujos de trabajo RAG?

La creación manual de una canalización RAG requiere integrar el almacenamiento, la bases de datos vectoriales, los modelos de incrustación, los LLM y la lógica personalizada de indexación y recuperación, además de mantener el sistema a medida que los datos cambian. Se requiere tiempo y colaboración, y la complejidad de estas tareas puede desviar a los equipos de otros proyectos de alto impacto. Para algunas organizaciones, esto hace que la adopción de RAG sea poco práctica, a pesar de sus beneficios potenciales.

AI Search (anteriormente AutoRAG) de Cloudflare puede ayudar.

AI Search es una canalización RAG totalmente gestionada, creada en la plataforma de desarrollo de Cloudflare. En tan solo cuatro pasos, los usuarios pueden conectar fuentes de datos como sitios web corporativos, catálogos de productos de comercio electrónico y documentación para desarrolladores. AI Search gestiona la ingesta, la conversión de Markdown, la fragmentación, la incrustación y el almacenamiento en Vectorize. Luego, realiza la recuperación semántica y genera respuestas con Workers AI.

AI Search elimina la pesada carga de infraestructura que implica la creación de canalizaciones RAG, automatiza la escala, el almacenamiento y la inferencia de IA, mientras garantiza el acceso a las fuentes de datos internas de forma segura y adecuada dentro de los sistemas RAG. Además, AI Search reindexa continuamente los datos en segundo plano, y mantiene las respuestas actualizadas a medida que las fuentes internas se actualizan.

¿Por qué deberías usar RAG?

Los datos de tu organización son un activo estratégico de gran valor. La creación de una canalización RAG segura permite que los miembros del equipo y los clientes accedan a estos datos, mejorando los LLM corporativos con las instrucciones, los procesos y la base de conocimiento únicos que diferencian a tu empresa y a tu mercado.

En pocas palabras: RAG mejora los modelos conocidos con el conocimiento interno de la empresa y recursos de terceros aprobados para obtener una ventaja de la IA en tiempo real.

Ya sea que desarrolles manualmente o con AI Search, comienza con los casos de uso correctos, selecciona los datos de alta calidad y colabora para ofrecer respuestas rápidas, precisas y con fundamento.

¿Todo listo para empezar? Crea tu propio RAG interno en cuatro sencillos pasos.

Preguntas frecuentes

¿Qué es la generación aumentada por recuperación (RAG)?

La generación aumentada por recuperación (RAG) es un método para mejorar los modelos de lenguaje grandes (LLM) al proporcionarles acceso a fuentes de datos internas y externas que no formaban parte de su entrenamiento original.

¿Cuáles son las principales ventajas de utilizar RAG?

RAG permite a los equipos consultar el conocimiento organizacional y los recursos de terceros utilizando lenguaje natural, lo que ayuda a evitar interrupciones a otros equipos y a reducir el tiempo dedicado a las búsquedas manuales. También democratiza la mejora de los modelos de IA de proveedores como OpenAI o Anthropic, sin necesidad del tiempo, el gasto o los recursos técnicos requeridos para un reentrenamiento completo.

¿Cuáles son los pasos para crear una canalización RAG?

Los pasos para construir una canalización RAG son: identificar posibles casos de uso, identificar las fuentes de datos apropiadas y construir la canalización RAG real. La construcción de canalizaciones implica la ingesta de contenido, mediante el uso de un modelo de incrustación para convertir texto en vectores, almacenar incrustaciones y metadatos en una base de datos vectorial, permitir la recuperación de consultas y facilitar la generación de respuestas.

¿Cuáles son algunos ejemplos de casos de uso de alto impacto para RAG?

Los casos de uso de RAG de alto impacto incluyen la creación de: un asistente de facturación de autoservicio, un asistente de políticas de atención al cliente, un asistente de cumplimiento normativo para las directrices de RR. HH., un asistente de RFP de ventas y una guía interactiva de incorporación de clientes. Estos casos de uso pueden ayudar a resolver problemas tangibles, reducir las tareas repetitivas y mejorar la consistencia entre los equipos.

¿Qué tipo de fuentes de datos son adecuadas para un sistema RAG?

Las fuentes de datos aptas para RAG deben ser precisas, mantenerse periódicamente y estar lo suficientemente estructuradas como para dividirse en secciones lógicas, como archivos Markdown, PDF, documentos HTML o archivos JSON. También deben responder preguntas habituales, como las preguntas frecuentes del producto o las guías de procesos internos.

¿Cuáles son las cinco partes de un flujo de trabajo típico de RAG?

Un flujo de trabajo típico de RAG consta de cinco etapas: ingesta, incrustación, almacenamiento de bases de datos vectoriales, recuperación de consultas y generación de respuestas.

¿Cómo se puede medir el éxito de una canalización RAG?

El éxito de una canalización RAG se puede medir con indicadores clave de rendimiento (KPI), como la precisión de la recuperación, la relevancia y la veracidad de la respuesta, la latencia, la adopción y la satisfacción del usuario, y la gobernanza de datos. El análisis continuo de la retroalimentación del usuario y las métricas de rendimiento puede ayudar a mejorar la implementación con el tiempo.

¿Cuál es la ventaja de utilizar un modelo de incrustación en una canalización RAG?

Un modelo de incrustación, como los modelos de incrustación BGE, convierte fragmentos de texto en vectores numéricos que capturan su significado semántico. Estos vectores se almacenan en una base de datos vectorial para una consulta y un filtrado eficientes.

¿Qué hace AI Search de Cloudflare para simplificar de la creación de flujos de trabajo RAG?

AI Search de Cloudflare es una canalización RAG totalmente administrada que automatiza la ingesta, la fragmentación, la incorporación y el almacenamiento en Vectorize. También gestiona la recuperación semántica y la generación de respuestas con Workers AI, lo que elimina la necesidad de la gestión manual de la infraestructura.