Bien conçus, les pipelines de génération augmentée par récupération (RAG) permettent aux organisations de transformer des données inactives en moteurs d’activité déterminants.
Cet article s'articule autour des points suivants :
Copier le lien de l'article
La génération augmentée par récupération (RAG) est une technique utilisée dans le développement de l’intelligence artificielle (IA) qui améliore les grands modèles de langage (LLM) en leur donnant accès à des sources de données internes et externes qui n’étaient pas prévues dans leur entraînement initial, par exemple, des recherches tierces, de la documentation produit ou la base de connaissances interne d’une entreprise.
Grâce à la RAG, les équipes peuvent interroger les connaissances organisationnelles de référence et les ressources tierces en langage naturel, afin d’éviter d’interrompre leurs collègues ou d’effectuer des recherches chronophages dans des systèmes fragmentés.
Le LLM utilisant des données enrichies pour l’exécution, les hallucinations sont moins probables et tout le monde travaille à partir de la même source de vérité. Le résultat est une plus grande précision des LLM grâce à des informations fiables et fondées.
La RAG aide les entreprises à améliorer les modèles d'IA qu'elles utilisent et qui proviennent de fournisseurs tels qu'OpenAI ou Anthropic, en s'épargnant le temps, les dépenses et les ressources techniques supplémentaires qui seraient nécessaires pour les ré-entraîner avec les connaissances spécifiques au scénario d'utilisation prévu. Par conséquent, la RAG démocratise l'amélioration des LLM.
Heureusement, la création de pipelines RAG ne nécessite aucune infrastructure colossale ni expertise en apprentissage automatique et en profondeur. La prise en main est donc facile. Le processus simple, en trois étapes, commence par l'identification des scénarios d'utilisation, la sélection des sources de données indiquées et la création du pipeline RAG.
Commencez par déterminer les sources de données auxquelles il serait le plus utile aux équipes d'accéder à l'aide d'invites en langage naturel. Concentrez-vous sur les points de friction à fort impact, notamment les ressources que les équipes consultent fréquemment pour obtenir des réponses, les systèmes où elles rencontrent souvent des blocages, ou les processus qui font sans cesse l'objet des mêmes questions.
Pour identifier les scénarios d'utilisation RAG les plus prometteurs, posez les questions suivantes à vos équipes internes :
Donnez la priorité aux scénarios d'utilisation de la RAG pour lesquels la combinaison du raisonnement génératif avec des connaissances internes et externes permet de résoudre des problèmes concrets, de réduire les changements de contexte, d'éliminer les tâches répétitives et d'améliorer la cohérence entre les équipes.
La solidité des systèmes RAG dépend de la qualité des données qu’ils extraient. Par conséquent, la qualité, l’exhaustivité, la gouvernance et la structure des sources de données disponibles ont une incidence directe sur la qualité de la réponse.
Les données dignes d'intérêt de RAG répondent aux critères suivants :
Évitez les sources de données qui introduisent du bruit ou de l'incohérence, notamment :
Collaborez avec les parties prenantes internes et le service informatique pour répertorier, dédupliquer et attribuer la propriété en continu à chaque source de données.
Ensuite, traitez et organisez les ensembles de données dans une structure adaptée à la recherche sémantique. Un flux de travail RAG typique comprend cinq parties : l'ingestion, l'intégration, le stockage de base de données vectorielle, l'extraction de requêtes et la génération de réponses.
1. Ingestion
Commencez par collecter les fichiers et documents utiles dans les référentiels partagés, les compartiments de stockage ou les systèmes de contenu. Concentrez-vous ensuite sur les points suivants :
2. Intégration
Utilisez un modèle d'intégration, tel que les modèles d'intégration BGE, pour convertir chaque segment de texte en un vecteur numérique qui capture sa signification sémantique.
3. Stockage de base de données vectorielle
Stockez les intégrations et toutes les métadonnées associées dans une base de données vectorielle évolutive, telle que Cloudflare Vectorize. Cela permet d'interroger et de filtrer efficacement les bases de connaissances à grande échelle.
4. Récupération de requête
Lorsqu'un utilisateur soumet une invite, le système : convertit la requête en un vecteur ; recherche dans la base de données vectorielle les blocs pertinents et sémantiquement similaires ; et applique des filtres fondés sur les métadonnées pour affiner la récupération, par exemple, en limitant l'accès à des informations spécifiques en fonction du rôle ou du service
5. Génération de réponse
Enfin, les blocs récupérés sont injectés dans l'invite comme du contexte supplémentaire avant d'être transmis au LLM. Le LLM utilise ce contexte pour générer une réponse significative et précise, reposant sur des données internes et externes.
La mise en place d'un pipeline RAG performant implique la mobilisation de toutes les équipes. Cependant, l'informatique est nécessaire pour : diriger l'exécution ; gérer l'infrastructure, comme les pipelines de données, l'évolutivité des bases de données vectorielles et le contrôle des accès ; et intégrer les systèmes.
Cependant, l'équipe informatique ne peut pas gérer ce processus seule. Commencez par aligner les équipes transversales, notamment l'équipe informatique, les experts et les acteurs commerciaux. Ensemble, ces équipes doivent identifier les scénarios d'utilisation et les sources de données fiables, définir des normes d'autorité de contenu et attribuer la propriété afin de garantir que les ensembles de données restent exacts et à jour.
Mettez en place des contrôles d’accès pour limiter l’accès aux données sensibles en fonction du rôle de l’utilisateur ou de l’unité métier, et vérifiez que des mesures de protection relatives au chiffrement et à la conformité sont en place dans l’ensemble du système.
Commencez par un projet pilote, itérez en fonction des résultats, puis déployez au sein des équipes.
Intégrez des indicateurs de réussite au processus dès le départ afin d'évaluer l'efficacité du système RAG et sa valeur opérationnelle.
Évaluez en particulier le système à l'aune de KPI tels que :
L'évaluation RAG implique souvent une validation avec intervention humaine pour attester de l'exactitude. Pour améliorer la mise en œuvre du pipeline RAG au fil du temps, sollicitez en permanence des commentaires auprès des utilisateurs, analysez les indicateurs de performance dans les journaux de requêtes et de récupération, examinez l'hygiène du contenu et évaluez les progrès par rapport aux objectifs métier.
La création manuelle d'un pipeline RAG est une opération impliquant le stockage, les bases de données vectorielles, les modèles d'intégration, les LLM et une logique d'indexation/récupération personnalisée, sans oublier de garantir la persistance du système lors des modifications des données. Elle exige du temps et de la collaboration. Qui plus est, ces tâches étant complexes, elles occupent les équipes au détriment d'autres projets dont l'importance est déterminante. Pour certaines organisations, c'est ce qui rend l'adoption de la RAG difficile, malgré ses avantages potentiels.
Cloudflare AI Search (anciennement AutoRAG) peut vous aider.
AI Search est un pipeline RAG entièrement géré, fondé sur la plateforme de développement Cloudflare. En quatre étapes seulement, les utilisateurs peuvent connecter des sources de données telles que les sites web d'entreprise, les catalogues de produits d'e-commerce et la documentation pour développeurs. AI Search gère l'ingestion, la conversion Markdown, le découpage, l'intégration et le stockage dans Vectorize. Il effectue ensuite une extraction sémantique et génère des réponses avec Workers AI.
En automatisant la mise à l'échelle, le stockage et l'inférence de l'IA, AI Search évite la fastidieuse opération d'infrastructure que représente la création de pipelines RAG tout en garantissant que les sources de données internes restent accessibles de manière sécurisée et indiquée au sein des systèmes RAG. De plus, AI Search réindexe continuellement les données en arrière-plan ; les réponses suivent ainsi les mises à jour des sources internes.
Les données de votre organisation représentent un atout stratégique majeur. La mise en place d'un pipeline RAG sécurisé rend ces données accessibles aux membres de l'équipe et aux clients en enrichissant les LLM d'entreprise avec des directives, processus et base de connaissances uniques qui différencient votre entreprise et votre marché.
Pour présenter les choses simplement : la technique RAG améliore les modèles courants en y intégrant les connaissances internes de l'entreprise et les ressources tierces approuvées, ce qui donne lieu à un profit en temps réel en matière d'IA.
Que vous développiez manuellement ou avec AI Search, commencez par les bons scénarios d'utilisation, sélectionnez des données de grande qualité et collaborez pour fournir des réponses rapides, précises et étayées.
Prêt à vous lancer ? Créez votre propre RAG interne en quatre étapes simples.
La génération augmentée par récupération (RAG) est une méthode permettant d'améliorer les grands modèles linguistiques (LLM) en leur fournissant un accès à des sources de données internes et externes qui ne faisaient pas partie de leur entraînement initial.
La RAG permet aux équipes d'interroger les connaissances de l'organisation et les ressources tierces avec le langage naturel, ce qui évite d'interrompre les collègues et réduit le temps consacré aux recherches manuelles. Elle démocratise également l'amélioration des modèles d'IA de fournisseurs tels qu'OpenAI ou Anthropic, en économisant le temps, les dépenses ou les ressources techniques requises pour une remise à niveau complète.
Les étapes de construction d'un pipeline RAG sont les suivantes : concevoir des cas d'utilisation potentiels, identifier les sources de données appropriées et construire le pipeline RAG. La construction d'un pipeline comprend l'ingestion de contenu, l'utilisation d'un modèle d'intégration pour convertir le texte en vecteurs, le stockage des intégrations et des métadonnées dans une base de données vectorielle, la récupération de requêtes et la génération de réponses.
Les scénarios d'utilisation RAG à fort impact comprennent la création de : un assistant de facturation en libre-service, un assistant de politique en contact direct avec la clientèle, un assistant de conformité pour les directives RH, un assistant d'appel d'offres commercial et un guide d'intégration client interactif. Ces scénarios d'utilisation peuvent aider à résoudre des problèmes tangibles, à alléger les tâches répétitives et à améliorer la cohérence entre les équipes.
Les sources de données adaptées à la RAG doivent être précises, régulièrement mises à jour et suffisamment structurées pour être divisées en sections logiques, telles que les fichiers Markdown, les PDF, les documents HTML ou les fichiers JSON. Elles doivent également répondre aux questions courantes, comme les FAQ produit ou les guides de processus internes.
Un flux de travail RAG typique se compose de cinq parties : ingestion, intégration, stockage de base de données vectorielle, extraction de requêtes et génération de réponse.
Le succès d'un pipeline RAG peut être mesuré à l'aide d'indicateurs clés de performance (KPI) tels que la précision de la récupération, l'intérêt et l'exactitude des réponses, la latence, l'adoption et la satisfaction des utilisateurs, et la gouvernance des données. L'analyse continue des indicateurs de performance et les commentaires des utilisateurs peuvent contribuer à améliorer la mise en œuvre au fil du temps.
Un modèle d'intégration, tel que les modèles d'intégration BGE, convertit les blocs de texte en vecteurs numériques qui capturent leur signification sémantique. Ces vecteurs sont ensuite stockés dans une base de données vectorielle pour que l'interrogation et le filtrage soient efficacesX.
Cloudflare AI Search est un pipeline RAG entièrement géré qui automatise l'ingestion, le découpage, l'intégration et le stockage dans Vectorize. La solution gère également la récupération sémantique et la génération de réponses avec Workers AI, ce qui élimine toute nécessité de gestion manuelle de l'infrastructure.