Las canalizaciones de generación aumentada por recuperación (RAG) bien desarrolladas pueden ayudar a las organizaciones a convertir los datos inactivos en impulsores comerciales decisivos.
Después de leer este artículo podrás:
Copiar el enlace del artículo
La generación aumentada por recuperación (RAG) es una técnica utilizada en el desarrollo de la inteligencia artificial (IA) que mejora los modelos de lenguaje grandes (LLM) al darles acceso a fuentes de datos internas y externas que no se incluyeron en su entrenamiento original; por ejemplo, investigaciones de terceros, documentación de productos o la base de conocimiento interna de una empresa.
Con la RAG, los equipos pueden consultar el conocimiento organizacional autorizado y los recursos de terceros en lenguaje natural para evitar interrumpir a los compañeros o realizar búsquedas que requieren mucho tiempo en sistemas fragmentados.
Dado que el LLM utiliza datos complementarios en tiempo de ejecución, las alucinaciones son menos probables y todos trabajan con la misma fuente de información veraz. El resultado es una mayor precisión del LLM gracias a información confiable y fundamentada.
La generación aumentada por recuperación (RAG) ayuda a las empresas a mejorar los modelos de IA que utilizan, de proveedores como OpenAI o Anthropic, sin el tiempo, los gastos y los recursos técnicos adicionales que se requerirían para volver a capacitarlos en conocimientos específicos para el caso de uso previsto. Por lo tanto, la RAG democratiza la mejora de los LLM.
Afortunadamente, la creación de canalizaciones RAG no requiere una infraestructura masiva ni una gran experiencia del aprendizaje automático. Así que, empezar es fácil. El proceso sencillo de tres pasos comienza con la identificación de los casos de uso, la selección de fuentes de datos adecuadas y la creación de canalizaciones RAG.
En primer lugar, determina qué fuentes de datos serían más útiles para que los equipos accedan mediante el uso de prompts en lenguaje natural. Concéntrate en los puntos débiles de alto impacto, incluidos los recursos a los que los equipos recurren con frecuencia para obtener respuestas, los sistemas en los que suelen encontrar cuellos de botella o los procesos en los que las mismas preguntas surgen repetidamente.
Para encontrar los casos de uso de RAG más prometedores, formula las siguientes preguntas a los equipos internos:
Prioriza los casos de uso de RAG en los que la combinación del razonamiento generativo con el conocimiento interno y externo pueda resolver problemas tangibles, reducir el cambio de contexto, eliminar las tareas repetitivas y mejorar la consistencia entre los equipos.
Los sistemas RAG son tan sólidos como los datos que recuperan. Por lo tanto, la calidad, la integridad, la gobernanza, y la estructura de las fuentes de datos disponibles impactan directamente en la calidad de la respuesta.
Los datos aptos para RAG cumplen con los siguientes requisitos:
Evita las fuentes de datos que introduzcan ruido o inconsistencias entre ellas:
Colabora con los clientes internos y el departamento de informática para inventariar, eliminar datos duplicados y asignar la propiedad continua a cada fuente de datos.
Procesa y organiza los conjuntos de datos en una estructura que sea adecuada para la recuperación semántica. Un flujo de trabajo típico de RAG incluye cinco partes: ingesta, incrustación, almacenamiento de bases de datos vectoriales, recuperación de consultas y generación de respuestas.
1. Ingesta
Comienza recolectando archivos y documentos relevantes de repositorios compartidos, buckets de almacenamiento o sistemas de contenido. Luego, enfócate en:
2. Incrustación
Utiliza un modelo de incrustación, como los modelos de incrustación BGE, para convertir cada fragmento de texto en un vector numérico que capture su significado semántico.
3. Almacenamiento de base de datos vectorial
Almacena las incrustaciones y todos los metadatos asociados en una base de datos vectorial escalable, como Vectorize de Cloudflare. Esto permite realizar consultas y filtrados eficientes en bases de conocimiento a gran escala.
4. Recuperación de consultas
Cuando un usuario envía un prompt, el sistema convierte la consulta en un vector, busca en la base de datos vectorial fragmentos apropiados y semánticamente similares, y aplica filtros en función de los metadatos para afinar la recuperación, por ejemplo, mediante la limitación del acceso a información específica basada en la función o el departamento.
5. Generación de respuestas
Finalmente, los fragmentos recuperados se inyectan en los prompts como contexto adicional antes de pasarlos al LLM. El LLM utiliza este contexto para generar una respuesta significativa y precisa que se basa en datos internos y externos.
Poner en marcha una canalización RAG valiosa requiere un esfuerzo conjunto. Sin embargo, depende del equipo de informática para: liderar la ejecución, gestionar infraestructuras como canalizaciones de datos, escalado de bases de datos vectoriales y control de acceso, e integrar sistemas.
Sin embargo, el equipo de informática no puede ser el único dueño del proceso. Comienza por alinear los equipos multifuncionales, incluidos los de informática, los expertos en la materia y las partes interesadas de la empresa. En conjunto, estos equipos deben identificar casos de uso y fuentes de datos confiables, definir estándares de autoridad de contenido y asignar la propiedad para garantizar que los conjuntos de datos se mantengan precisos y actualizados.
Implementa controles de acceso para restringir los datos confidenciales según la función del usuario o la unidad de negocio, y asegúrate de que existan protecciones de cifrado y cumplimiento normativo en todo el sistema.
Comienza con un piloto, reitera según los resultados y luego escala entre equipos.
Incorpora métricas de éxito en el proceso desde el principio para evaluar la efectividad del sistema RAG y su valor comercial.
En particular, evalúa el sistema con respecto a los KPI como:
La evaluación RAG suele requerir la validación humana en el circuito para verificar la precisión. Para mejorar la implementación de la canalización RAG a lo largo del tiempo, solicita de forma continua comentarios de los usuarios, analiza las métricas de rendimiento en los registros de consulta y recuperación, revisa la higiene del contenido y evalúa el progreso con respecto a los objetivos comerciales.
La creación manual de una canalización RAG requiere integrar el almacenamiento, la bases de datos vectoriales, los modelos de incrustación, los LLM y la lógica personalizada de indexación y recuperación, además de mantener el sistema a medida que los datos cambian. Se requiere tiempo y colaboración, y la complejidad de estas tareas puede desviar a los equipos de otros proyectos de alto impacto. Para algunas organizaciones, esto hace que la adopción de RAG sea poco práctica, a pesar de sus beneficios potenciales.
AI Search (anteriormente AutoRAG) de Cloudflare puede ayudar.
AI Search es una canalización RAG totalmente gestionada, creada en la plataforma de desarrollo de Cloudflare. En tan solo cuatro pasos, los usuarios pueden conectar fuentes de datos como sitios web corporativos, catálogos de productos de comercio electrónico y documentación para desarrolladores. AI Search gestiona la ingesta, la conversión de Markdown, la fragmentación, la incrustación y el almacenamiento en Vectorize. Luego, realiza la recuperación semántica y genera respuestas con Workers AI.
AI Search elimina la pesada carga de infraestructura que implica la creación de canalizaciones RAG, automatiza la escala, el almacenamiento y la inferencia de IA, mientras garantiza el acceso a las fuentes de datos internas de forma segura y adecuada dentro de los sistemas RAG. Además, AI Search reindexa continuamente los datos en segundo plano, y mantiene las respuestas actualizadas a medida que las fuentes internas se actualizan.
Los datos de tu organización son un activo estratégico de gran valor. La creación de una canalización RAG segura permite que los miembros del equipo y los clientes accedan a estos datos, mejorando los LLM corporativos con las instrucciones, los procesos y la base de conocimiento únicos que diferencian a tu empresa y a tu mercado.
En pocas palabras: RAG mejora los modelos conocidos con el conocimiento interno de la empresa y recursos de terceros aprobados para obtener una ventaja de la IA en tiempo real.
Ya sea que desarrolles manualmente o con AI Search, comienza con los casos de uso correctos, selecciona los datos de alta calidad y colabora para ofrecer respuestas rápidas, precisas y con fundamento.
¿Todo listo para empezar? Crea tu propio RAG interno en cuatro sencillos pasos.
La generación aumentada por recuperación (RAG) es un método para mejorar los modelos de lenguaje grandes (LLM) al proporcionarles acceso a fuentes de datos internas y externas que no formaban parte de su entrenamiento original.
RAG permite a los equipos consultar el conocimiento organizacional y los recursos de terceros utilizando lenguaje natural, lo que ayuda a evitar interrupciones a otros equipos y a reducir el tiempo dedicado a las búsquedas manuales. También democratiza la mejora de los modelos de IA de proveedores como OpenAI o Anthropic, sin necesidad del tiempo, el gasto o los recursos técnicos requeridos para un reentrenamiento completo.
Los pasos para construir una canalización RAG son: identificar posibles casos de uso, identificar las fuentes de datos apropiadas y construir la canalización RAG real. La construcción de canalizaciones implica la ingesta de contenido, mediante el uso de un modelo de incrustación para convertir texto en vectores, almacenar incrustaciones y metadatos en una base de datos vectorial, permitir la recuperación de consultas y facilitar la generación de respuestas.
Los casos de uso de RAG de alto impacto incluyen la creación de: un asistente de facturación de autoservicio, un asistente de políticas de atención al cliente, un asistente de cumplimiento normativo para las directrices de RR. HH., un asistente de RFP de ventas y una guía interactiva de incorporación de clientes. Estos casos de uso pueden ayudar a resolver problemas tangibles, reducir las tareas repetitivas y mejorar la consistencia entre los equipos.
Las fuentes de datos aptas para RAG deben ser precisas, mantenerse periódicamente y estar lo suficientemente estructuradas como para dividirse en secciones lógicas, como archivos Markdown, PDF, documentos HTML o archivos JSON. También deben responder preguntas habituales, como las preguntas frecuentes del producto o las guías de procesos internos.
Un flujo de trabajo típico de RAG consta de cinco etapas: ingesta, incrustación, almacenamiento de bases de datos vectoriales, recuperación de consultas y generación de respuestas.
El éxito de una canalización RAG se puede medir con indicadores clave de rendimiento (KPI), como la precisión de la recuperación, la relevancia y la veracidad de la respuesta, la latencia, la adopción y la satisfacción del usuario, y la gobernanza de datos. El análisis continuo de la retroalimentación del usuario y las métricas de rendimiento puede ayudar a mejorar la implementación con el tiempo.
Un modelo de incrustación, como los modelos de incrustación BGE, convierte fragmentos de texto en vectores numéricos que capturan su significado semántico. Estos vectores se almacenan en una base de datos vectorial para una consulta y un filtrado eficientes.
AI Search de Cloudflare es una canalización RAG totalmente administrada que automatiza la ingesta, la fragmentación, la incorporación y el almacenamiento en Vectorize. También gestiona la recuperación semántica y la generación de respuestas con Workers AI, lo que elimina la necesidad de la gestión manual de la infraestructura.