Le pipeline di Retrieval Augmented Generation (RAG) ben progettate possono aiutare le organizzazioni a trasformare i dati inattivi in fattori di business decisivi.
Dopo aver letto questo articolo sarai in grado di:
Copia link dell'articolo
La Retrieval Augmented Generation (RAG) è una tecnica utilizzata nello sviluppo dell'intelligenza artificiale (IA) che migliora i Large Language Model (LLM) fornendo loro accesso a origini dati interne ed esterne non incluse nel loro addestramento originale, ad esempio, ricerche di terzi, documentazione di prodotto o knowledge base interne di un'azienda.
Utilizzando la tecnologia RAG, i team possono interrogare origini autorevoli di conoscenza aziendale e risorse di terzi in linguaggio naturale, evitando così di interrompere i colleghi o di eseguire ricerche complesse e dispendiose in termini di tempo in sistemi frammentati.
Poiché l'LLM utilizza dati integrati in fase di esecuzione, le allucinazioni sono meno probabili e tutti lavorano basandosi sulla stessa fonte di verità. Il risultato è una maggiore accuratezza dell'LLM grazie a informazioni affidabili e fondate.
La RAG aiuta le aziende a migliorare i modelli IA che utilizzano, da fornitori come OpenAI o Anthropic, senza il tempo, i costi e le risorse tecniche aggiuntive necessari per riaddestrarli su conoscenze specifiche per il caso d'uso previsto. Pertanto, la RAG democratizza il potenziamento degli LLM.
Per fortuna, la creazione di pipeline RAG non richiede un'infrastruttura enorme o una solida esperienza di machine learning. Quindi, iniziare è facile. Il semplice processo in tre fasi inizia con l'identificazione dei casi d'uso, la selezione delle origini dati appropriate e la creazione della pipeline RAG.
Innanzitutto, determina quali origini dati sarebbero più utili per i team per accedere tramite prompt in linguaggio naturale. Concentrati sui punti di attrito ad alto impatto, incluse le risorse a cui i team fanno riferimento di frequente per trovare risposte, i sistemi in cui si verificano spesso colli di bottiglia o i processi in cui emergono ripetutamente le stesse domande.
Per trovare i casi d'uso RAG più promettenti, poni ai team interni le seguenti domande:
Dai priorità ai casi d'uso di RAG in cui la combinazione del ragionamento generativo con la conoscenza interna ed esterna può risolvere problemi concreti, ridurre il cambio di contesto, eliminare le attività ripetitive e migliorare la coerenza tra i team.
I sistemi RAG sono validi solo quanto i dati che recuperano. Pertanto, la qualità, la completezza, la governance e la struttura delle origini dati disponibili influiscono direttamente sulla qualità delle risposte.
I dati utili per la RAG tengono conto di quanto segue:
Evita le origini dati che introducono rumore o incongruenze, tra cui:
Collabora con gli stakeholder interni e il reparto IT per effettuare l'inventario, deduplicare e assegnare la titolarità continua a ogni origine dati.
Successivamente, elabora e organizza i set di dati in una struttura adatta al recupero semantico. Un tipico flusso di lavoro RAG include cinque parti: acquisizione, integrazione, archiviazione di database vettoriali, recupero di query e generazione di risposte.
1. Acquisizione
Inizia raccogliendo file e documenti pertinenti da repository condivisi, bucket di archiviazione o sistemi di gestione dei contenuti. Quindi concentrati su:
2. Integrazione
Utilizza un modello di integrazione, come i modelli di integrazione BGE, per convertire ogni blocco di testo in un vettore numerico che ne acquisisce il significato semantico.
3. Archiviazione di database vettoriali
Archivia le integrazioni e tutti i metadati associati in un database vettoriale scalabile, come Cloudflare Vectorize. In questo modo, si abilita l'interrogazione e il filtraggio efficienti per knowledge base su larga scala.
4. Recupero di query
Quando un utente invia un prompt, il sistema: converte la query in un vettore; cerca nel database vettoriale blocchi appropriati e semanticamente simili; e applica filtri basati sui metadati per ottimizzare il recupero, ad esempio limitando l'accesso a informazioni specifiche in base al ruolo o al reparto.
5. Generazione di risposte
Infine, i blocchi recuperati vengono inoculati nel prompt come contesto aggiuntivo prima di essere passati all'LLM. L'LLM utilizza questo contesto per generare una risposta significativa e accurata, basata su dati interni ed esterni.
Sostenere una preziosa pipeline RAG è uno sforzo pratico. Tuttavia, si affida all'IT per: guidare l'esecuzione, gestire infrastrutture come pipeline di dati, scalabilità dei database vettoriali e controllo degli accessi e integrare i sistemi.
Eppure, l'IT non può gestire il processo da solo. Inizia allineando i team interfunzionali, tra cui il team IT, gli esperti in materia e gli stakeholder aziendali. Insieme, questi team devono identificare casi d'uso e origini dati attendibili, definire standard di autorità dei contenuti e assegnare la titolarità per garantire che i set di dati rimangano accurati e aggiornati.
Applica i controlli di accesso per limitare i dati sensibili in base al ruolo utente o alla business unit e assicurati che le protezioni di crittografia e conformità siano attive in tutto il sistema.
Inizia con un progetto pilota, itera in base ai risultati, quindi estendi a tutti i team.
Integra le metriche di successo nel processo fin dall'inizio per valutare l'efficacia del sistema RAG e il valore aziendale.
In particolare, valuta il sistema rispetto a KPI come:
La valutazione RAG spesso include la convalida human-in-the-loop per verificarne l'accuratezza. Per migliorare l'implementazione della pipeline RAG nel tempo, raccogli continuamente i feedback degli utenti, analizza le metriche di prestazioni sui log di query e recupero, rivedi la qualità dei contenuti e valuta i progressi rispetto agli obiettivi aziendali.
La creazione manuale di una pipeline RAG richiede l'integrazione di archiviazione, database vettoriali, modelli di integrazione, LLM e logiche personalizzate di indicizzazione/recupero, oltre alla manutenzione del sistema al variare dei dati. Richiede tempo e collaborazione, e la complessità di queste attività può distogliere i team da altri progetti ad alto impatto. Per alcune organizzazioni, questo rende l'adozione della RAG impraticabile, malgrado i suoi potenziali vantaggi.
Cloudflare AI Search (precedentemente AutoRAG) può aiutarti.
AI Search è una pipeline RAG completamente gestita, creata sulla piattaforma per sviluppatori di Cloudflare. In soli quattro passaggi, gli utenti possono connettere origini dati quali siti web aziendali, cataloghi di prodotti di e-commerce e documentazione per sviluppatori. AI Search gestisce l'acquisizione, la conversione markdown, la suddivisione in blocchi, l'integrazione e l'archiviazione in Vectorize. Quindi, esegue il recupero semantico e genera risposte con Workers AI.
AI Search elimina il pesante onere infrastrutturale della creazione di pipeline RAG automatizzando la scalabilità, l'archiviazione e l'inferenza IA, garantendo al contempo che le origini dati interne siano accessibili in modo sicuro e appropriato all'interno dei sistemi RAG. Inoltre, AI Search reindicizza continuamente i dati in background, mantenendo le risposte aggiornate non appena le origini interne vengono aggiornate.
I dati della tua organizzazione sono un'enorme risorsa strategica. La creazione di una pipeline RAG sicura rende questi dati accessibili ai membri dei team e ai clienti, potenziando gli LLM aziendali con le linee guida, i processi e la knowledge base unici che differenziano la tua azienda e il tuo mercato.
In parole semplici, la RAG potenzia i modelli più diffusi con la conoscenza interna dell'azienda e risorse di terzi approvate, per un vantaggio IA in tempo reale.
Che la realizzazione avvenga manualmente o con AI Search, è necessario iniziare con i casi d'uso corretti, curare dati di alta qualità e collaborare per fornire risposte rapide, accurate e pertinenti.
Tutto pronto per iniziare? Crea la tua RAG interna in quattro semplici passaggi.
La Retrieval-Augmented Generation (RAG) è un metodo per migliorare i Large Language Model (LLM), fornendo loro l'accesso a origini dati interne ed esterne non incluse nell'addestramento originale.
La RAG consente ai team di interrogare le conoscenze organizzative e le risorse di terzi utilizzando il linguaggio naturale, il che può aiutare a evitare interruzioni ai colleghi e ridurre il tempo dedicato alle ricerche manuali. Inoltre, democratizza il miglioramento dei modelli IA di fornitori come OpenAI o Anthropic, senza il tempo, i costi o o le risorse tecniche necessari per un riaddestramento completo.
I passaggi per la creazione di una pipeline RAG sono i seguenti: concepire potenziali casi d'uso, identificare le origini dati appropriate e creare la pipeline RAG vera e propria. La creazione di pipeline include l'acquisizione di contenuti, l'utilizzo di un modello di integrazione per convertire il testo in vettori, l'archiviazione di integrazioni e metadati in un database vettoriale, l'abilitazione del recupero di query e l'agevolazione della generazione di risposte.
I casi d'uso della RAG ad alto impatto includono la creazione di un assistente di fatturazione self-service, un assistente per i criteri rivolto ai clienti, un assistente di conformità per le linee guida delle risorse umane, un assistente RFP per le vendite e una guida interattiva all'onboarding dei clienti. Questi casi d'uso possono contribuire a risolvere problemi concreti, ridurre le attività ripetitive e migliorare la coerenza fra i team.
Le origini dati adatte per la RAG devono essere accurate, regolarmente aggiornate e sufficientemente strutturate da poter essere suddivise in sezioni logiche, come file markdown, PDF, documenti HTML o file JSON. Devono anche rispondere a domande comuni, come quelle frequenti sui prodotti o le guide ai processi interni.
Un tipico flusso di lavoro RAG è composto da cinque parti: acquisizione, integrazione, archiviazione in un database vettoriale, recupero di query e generazione di risposte.
Il successo di una pipeline RAG può essere misurato utilizzando indicatori chiave di prestazioni (KPI) quali accuratezza del recupero, pertinenza e accuratezza delle risposte, latenza, adozione e soddisfazione degli utenti e governance dei dati. L'analisi continua dei feedback degli utenti e delle metriche di prestazioni può contribuire a migliorare l'implementazione nel tempo.
Un modello di integrazione, come i modelli di integrazione BGE, converte blocchi di testo in vettori numerici che ne catturano il significato semantico. Questi vettori vengono quindi archiviati in un database vettoriale per query e filtri efficienti.
Cloudflare AI Search è una pipeline RAG completamente gestita che automatizza l'acquisizione, la suddivisione in blocchi, l'integrazione e l'archiviazione in Vectorize. Gestisce anche il recupero semantico e la generazione di risposte con Workers AI, il che elimina la necessità di una gestione manuale dell'infrastruttura.