Comment améliorer les modèles d'IA avec la RAG (génération augmentée par récupération)

Bien conçus, les pipelines de génération augmentée par récupération (RAG) permettent aux organisations de transformer des données inactives en moteurs d’activité déterminants.

Objectifs d’apprentissage

Cet article s'articule autour des points suivants :

  • Définir la génération augmentée par récupération (RAG)
  • Créer des pipelines RAG performants
  • Identifier les meilleures façons de mesurer le succès d'un pipeline RAG

Copier le lien de l'article

Qu’est-ce que la génération augmentée par récupération (RAG) et en quoi est-elle extrêmement utile ?

La génération augmentée par récupération (RAG) est une technique utilisée dans le développement de l’intelligence artificielle (IA) qui améliore les grands modèles de langage (LLM) en leur donnant accès à des sources de données internes et externes qui n’étaient pas prévues dans leur entraînement initial, par exemple, des recherches tierces, de la documentation produit ou la base de connaissances interne d’une entreprise.

Grâce à la RAG, les équipes peuvent interroger les connaissances organisationnelles de référence et les ressources tierces en langage naturel, afin d’éviter d’interrompre leurs collègues ou d’effectuer des recherches chronophages dans des systèmes fragmentés.

Le LLM utilisant des données enrichies pour l’exécution, les hallucinations sont moins probables et tout le monde travaille à partir de la même source de vérité. Le résultat est une plus grande précision des LLM grâce à des informations fiables et fondées.

Quelles sont les étapes nécessaires pour construire des pipelines RAG performants ?

La RAG aide les entreprises à améliorer les modèles d'IA qu'elles utilisent et qui proviennent de fournisseurs tels qu'OpenAI ou Anthropic, en s'épargnant le temps, les dépenses et les ressources techniques supplémentaires qui seraient nécessaires pour les ré-entraîner avec les connaissances spécifiques au scénario d'utilisation prévu. Par conséquent, la RAG démocratise l'amélioration des LLM.

Heureusement, la création de pipelines RAG ne nécessite aucune infrastructure colossale ni expertise en apprentissage automatique et en profondeur. La prise en main est donc facile. Le processus simple, en trois étapes, commence par l'identification des scénarios d'utilisation, la sélection des sources de données indiquées et la création du pipeline RAG.

Étape 1 : Concevoir des scénarios d'utilisation potentiels pour la RAG

Commencez par déterminer les sources de données auxquelles il serait le plus utile aux équipes d'accéder à l'aide d'invites en langage naturel. Concentrez-vous sur les points de friction à fort impact, notamment les ressources que les équipes consultent fréquemment pour obtenir des réponses, les systèmes où elles rencontrent souvent des blocages, ou les processus qui font sans cesse l'objet des mêmes questions.

Pour identifier les scénarios d'utilisation RAG les plus prometteurs, posez les questions suivantes à vos équipes internes :

     
  • Quelles sont les demandes courantes en connaissances institutionnelles qui sont présentes dans les esprits ou dans des documents difficilement accessibles ? Un certain nombre d'exemples concernent les procédures opérationnelles standard et les solutions aux problèmes courants. Grâce à la RAG, un assistant de facturation en libre-service peut répondre aux questions courantes des utilisateurs, telles que : « Où puis-je télécharger mes anciennes factures ? »
  •  
  • Quelles questions sont fréquemment transférées entre les équipes ? Les questions concernant l’évolution des politiques techniques, par exemple, sont fréquemment posées. Grâce à la RAG, un assistant consacré aux politiques en contact direct avec la clientèle peut expliquer la politique de remboursement d’une entreprise.
  •  
  • Quels fichiers ou tâches nécessitent d’effectuer des requêtes manuelles et répétitives à plusieurs endroits, tels que Confluence, SharePoint et les wikis internes ? Un assistant de conformité qui se fonde sur la RAG peut extraire des directives RH pour répondre à la question suivante : « Quels modules de formation sont requis pour les nouvelles recrues en Europe ? »
  •  
  • Quels sont les besoins ou les exigences formels qui doivent être satisfaits ? Les réponses aux audits, les demandes de propositions (RFP) et la conformité sont des scénarios d’utilisation courants. Grâce à la RAG, un assistant de réponse aux appels d’offres peut extraire des modèles dont la conformité a été approuvée afin de générer des réponses aux appels d’offres.
  •  
  • Quelles informations s'appliquent à tous ? Les documents de formation et d'intégration de l'entreprise sont universellement utiles, par exemple. Un guide d'intégration client interactif peut tirer parti de la RAG pour guider les nouveaux utilisateurs à travers les étapes de formation en récupérant les documents pratiques les plus récents.

Donnez la priorité aux scénarios d'utilisation de la RAG pour lesquels la combinaison du raisonnement génératif avec des connaissances internes et externes permet de résoudre des problèmes concrets, de réduire les changements de contexte, d'éliminer les tâches répétitives et d'améliorer la cohérence entre les équipes.

Étape 2 : Identifier en interne les sources de données utiles pour la RAG

La solidité des systèmes RAG dépend de la qualité des données qu’ils extraient. Par conséquent, la qualité, l’exhaustivité, la gouvernance et la structure des sources de données disponibles ont une incidence directe sur la qualité de la réponse.

Les données dignes d'intérêt de RAG répondent aux critères suivants :

     
  • Elle répond aux questions courantes : les sources idéales sont les FAQ de produit, la documentation liée aux politiques, les guides de processus internes et les cartographies de conformité.
  •  
  • Elle est précise et tenue à jour : recherchez la documentation dont vous êtes certain de la propriété et dont la cadence de mise à jour est régulière.
  •  
  • Elle est suffisamment structurée pour être décomposée : les fichiers Markdown, les PDF, les documents HTML, les fichiers JSON et les wikis peuvent tous être divisés en sections logiques. Si les ensembles de données comprennent des captures d’écran ou des PDF basés sur des images, des outils tels que Cloudflare Workers AI peuvent convertir les images en vecteurs qui sont ensuite lisibles par les LLM.

Évitez les sources de données qui introduisent du bruit ou de l'incohérence, notamment :

     
  • Les données dans des formats non structurés et désordonnés, par exemple les fils de discussion Slack ou les chaînes d’e-mails bruts, doivent être nettoyées, vérifiées et mises en forme
  •  
  • Les ensembles de données dynamiques et en constante évolution, tels que les tableaux de bord avec des indicateurs en temps réel
  •  
  • Les fichiers en double, conflictuels ou obsolètes, ce qui peut compliquer la récupération et introduire des erreurs

Collaborez avec les parties prenantes internes et le service informatique pour répertorier, dédupliquer et attribuer la propriété en continu à chaque source de données.

Étape 3 : Créer un pipeline RAG

Ensuite, traitez et organisez les ensembles de données dans une structure adaptée à la recherche sémantique. Un flux de travail RAG typique comprend cinq parties : l'ingestion, l'intégration, le stockage de base de données vectorielle, l'extraction de requêtes et la génération de réponses.

1. Ingestion

Commencez par collecter les fichiers et documents utiles dans les référentiels partagés, les compartiments de stockage ou les systèmes de contenu. Concentrez-vous ensuite sur les points suivants :

  • Découpe : pour permettre une extraction précise, divisez le contenu en sections logiques afin de créer des unités sémantiquement cohérentes (par exemple, des paragraphes, des titres, des éléments de FAQ et des blocs de code).
  • Normalisation : nettoyez et uniformisez les données dans tous les formats (par exemple, des PDF au format texte, du HTML au format Markdown).
  •  
  • Balises de métadonnées : Ajoutez des métadonnées utiles (par exemple, propriétaire, date de création, système) pour prendre en charge la récupération filtrée.

2. Intégration

Utilisez un modèle d'intégration, tel que les modèles d'intégration BGE, pour convertir chaque segment de texte en un vecteur numérique qui capture sa signification sémantique.

3. Stockage de base de données vectorielle

Stockez les intégrations et toutes les métadonnées associées dans une base de données vectorielle évolutive, telle que Cloudflare Vectorize. Cela permet d'interroger et de filtrer efficacement les bases de connaissances à grande échelle.

4. Récupération de requête

Lorsqu'un utilisateur soumet une invite, le système : convertit la requête en un vecteur ; recherche dans la base de données vectorielle les blocs pertinents et sémantiquement similaires ; et applique des filtres fondés sur les métadonnées pour affiner la récupération, par exemple, en limitant l'accès à des informations spécifiques en fonction du rôle ou du service

5. Génération de réponse

Enfin, les blocs récupérés sont injectés dans l'invite comme du contexte supplémentaire avant d'être transmis au LLM. Le LLM utilise ce contexte pour générer une réponse significative et précise, reposant sur des données internes et externes.

Faut-il s'associer au service informatique pour l'exécution et le déploiement de la RAG ?

La mise en place d'un pipeline RAG performant implique la mobilisation de toutes les équipes. Cependant, l'informatique est nécessaire pour : diriger l'exécution ; gérer l'infrastructure, comme les pipelines de données, l'évolutivité des bases de données vectorielles et le contrôle des accès ; et intégrer les systèmes.

Cependant, l'équipe informatique ne peut pas gérer ce processus seule. Commencez par aligner les équipes transversales, notamment l'équipe informatique, les experts et les acteurs commerciaux. Ensemble, ces équipes doivent identifier les scénarios d'utilisation et les sources de données fiables, définir des normes d'autorité de contenu et attribuer la propriété afin de garantir que les ensembles de données restent exacts et à jour.

Mettez en place des contrôles d’accès pour limiter l’accès aux données sensibles en fonction du rôle de l’utilisateur ou de l’unité métier, et vérifiez que des mesures de protection relatives au chiffrement et à la conformité sont en place dans l’ensemble du système.

Commencez par un projet pilote, itérez en fonction des résultats, puis déployez au sein des équipes.

Quelle est la meilleure façon de mesurer le succès de votre pipeline RAG ?

Intégrez des indicateurs de réussite au processus dès le départ afin d'évaluer l'efficacité du système RAG et sa valeur opérationnelle.

Évaluez en particulier le système à l'aune de KPI tels que :

  • Précision de la récupération : les bons documents et les bonnes réponses sont-ils mis en évidence ?
  •  
  • Intérêt et exactitude des réponses : les utilisateurs reçoivent-ils des réponses à jour et fiables ?
  •  
  • Latence : les réponses sont-elles fournies dans un délai acceptable ?
  •  
  • Adoption et satisfaction des utilisateurs : les employés utilisent-ils réellement le système et gagnent-ils en efficacité ?
  •  
  • Gouvernance des données : les garde-fous de sécurité et de conformité sont-ils effectifs lorsque de nouvelles sources sont ajoutées ?

L'évaluation RAG implique souvent une validation avec intervention humaine pour attester de l'exactitude. Pour améliorer la mise en œuvre du pipeline RAG au fil du temps, sollicitez en permanence des commentaires auprès des utilisateurs, analysez les indicateurs de performance dans les journaux de requêtes et de récupération, examinez l'hygiène du contenu et évaluez les progrès par rapport aux objectifs métier.

Comment simplifier la création de flux de travail RAG ?

La création manuelle d'un pipeline RAG est une opération impliquant le stockage, les bases de données vectorielles, les modèles d'intégration, les LLM et une logique d'indexation/récupération personnalisée, sans oublier de garantir la persistance du système lors des modifications des données. Elle exige du temps et de la collaboration. Qui plus est, ces tâches étant complexes, elles occupent les équipes au détriment d'autres projets dont l'importance est déterminante. Pour certaines organisations, c'est ce qui rend l'adoption de la RAG difficile, malgré ses avantages potentiels.

Cloudflare AI Search (anciennement AutoRAG) peut vous aider.

AI Search est un pipeline RAG entièrement géré, fondé sur la plateforme de développement Cloudflare. En quatre étapes seulement, les utilisateurs peuvent connecter des sources de données telles que les sites web d'entreprise, les catalogues de produits d'e-commerce et la documentation pour développeurs. AI Search gère l'ingestion, la conversion Markdown, le découpage, l'intégration et le stockage dans Vectorize. Il effectue ensuite une extraction sémantique et génère des réponses avec Workers AI.

En automatisant la mise à l'échelle, le stockage et l'inférence de l'IA, AI Search évite la fastidieuse opération d'infrastructure que représente la création de pipelines RAG tout en garantissant que les sources de données internes restent accessibles de manière sécurisée et indiquée au sein des systèmes RAG. De plus, AI Search réindexe continuellement les données en arrière-plan ; les réponses suivent ainsi les mises à jour des sources internes.

Pourquoi devriez-vous utiliser RAG ?

Les données de votre organisation représentent un atout stratégique majeur. La mise en place d'un pipeline RAG sécurisé rend ces données accessibles aux membres de l'équipe et aux clients en enrichissant les LLM d'entreprise avec des directives, processus et base de connaissances uniques qui différencient votre entreprise et votre marché.

Pour présenter les choses simplement : la technique RAG améliore les modèles courants en y intégrant les connaissances internes de l'entreprise et les ressources tierces approuvées, ce qui donne lieu à un profit en temps réel en matière d'IA.

Que vous développiez manuellement ou avec AI Search, commencez par les bons scénarios d'utilisation, sélectionnez des données de grande qualité et collaborez pour fournir des réponses rapides, précises et étayées.

Prêt à vous lancer ? Créez votre propre RAG interne en quatre étapes simples.

FAQ

Qu'est-ce que la génération augmentée par récupération (RAG) ?

La génération augmentée par récupération (RAG) est une méthode permettant d'améliorer les grands modèles linguistiques (LLM) en leur fournissant un accès à des sources de données internes et externes qui ne faisaient pas partie de leur entraînement initial.

Quels sont les principaux avantages liés à l’utilisation de la RAG ?

La RAG permet aux équipes d'interroger les connaissances de l'organisation et les ressources tierces avec le langage naturel, ce qui évite d'interrompre les collègues et réduit le temps consacré aux recherches manuelles. Elle démocratise également l'amélioration des modèles d'IA de fournisseurs tels qu'OpenAI ou Anthropic, en économisant le temps, les dépenses ou les ressources techniques requises pour une remise à niveau complète.

Quelles sont les étapes de la construction d'un pipeline RAG ?

Les étapes de construction d'un pipeline RAG sont les suivantes : concevoir des cas d'utilisation potentiels, identifier les sources de données appropriées et construire le pipeline RAG. La construction d'un pipeline comprend l'ingestion de contenu, l'utilisation d'un modèle d'intégration pour convertir le texte en vecteurs, le stockage des intégrations et des métadonnées dans une base de données vectorielle, la récupération de requêtes et la génération de réponses.

Quels sont les exemples de cas d'utilisation à fort impact pour RAG ?

Les scénarios d'utilisation RAG à fort impact comprennent la création de : un assistant de facturation en libre-service, un assistant de politique en contact direct avec la clientèle, un assistant de conformité pour les directives RH, un assistant d'appel d'offres commercial et un guide d'intégration client interactif. Ces scénarios d'utilisation peuvent aider à résoudre des problèmes tangibles, à alléger les tâches répétitives et à améliorer la cohérence entre les équipes.

Quels types de sources de données sont adaptés à un système RAG ?

Les sources de données adaptées à la RAG doivent être précises, régulièrement mises à jour et suffisamment structurées pour être divisées en sections logiques, telles que les fichiers Markdown, les PDF, les documents HTML ou les fichiers JSON. Elles doivent également répondre aux questions courantes, comme les FAQ produit ou les guides de processus internes.

Quelles sont les cinq parties d'un flux de travail RAG standard ?

Un flux de travail RAG typique se compose de cinq parties : ingestion, intégration, stockage de base de données vectorielle, extraction de requêtes et génération de réponse.

Comment mesurer le succès d’un pipeline RAG ?

Le succès d'un pipeline RAG peut être mesuré à l'aide d'indicateurs clés de performance (KPI) tels que la précision de la récupération, l'intérêt et l'exactitude des réponses, la latence, l'adoption et la satisfaction des utilisateurs, et la gouvernance des données. L'analyse continue des indicateurs de performance et les commentaires des utilisateurs peuvent contribuer à améliorer la mise en œuvre au fil du temps.

Quels sont les avantages liés à l'utilisation d'un modèle d'intégration dans un pipeline RAG ?

Un modèle d'intégration, tel que les modèles d'intégration BGE, convertit les blocs de texte en vecteurs numériques qui capturent leur signification sémantique. Ces vecteurs sont ensuite stockés dans une base de données vectorielle pour que l'interrogation et le filtrage soient efficacesX.

Que fait Cloudflare AI Search pour simplifier la création des workflows RAG ?

Cloudflare AI Search est un pipeline RAG entièrement géré qui automatise l'ingestion, le découpage, l'intégration et le stockage dans Vectorize. La solution gère également la récupération sémantique et la génération de réponses avec Workers AI, ce qui élimine toute nécessité de gestion manuelle de l'infrastructure.