Gut konzipierte RAG (Retrieval Augmented Generation)-Pipelines können Unternehmen dabei helfen, ungenutzte Daten in maßgebliche Geschäftstreiber zu verwandeln.
Nach Lektüre dieses Artikels können Sie Folgendes:
Link zum Artikel kopieren
Bei Retrieval Augmented Generation (RAG) handelt es sich um ein Verfahren, das bei der Entwicklung künstlicher Intelligenz (KI) verwendet wird. Es verbessert Large Language Models (LLM), indem es ihnen Zugriff auf interne und externe Datenquellen gewährt, die nicht in ihrem ursprünglichen Training enthalten waren – beispielsweise externes Forschungsmaterial, Produktdokumentation oder die interne Wissensdatenbank eines Unternehmens.
Mithilfe von RAG können Mitarbeitende in natürlicher Sprache maßgebliches Unternehmenswissen und Ressourcen von Drittanbietern selbst abrufen. Damit vermeiden sie es, Kollegen nicht bei der Arbeit zu stören oder zeitaufwendige Suchen in fragmentierten Systemen durchzuführen.
Da das LLM beim seinem Einsatz zusätzliche Daten verwendet, sind Halluzinationen weniger wahrscheinlich. Außerdem nehmen alle auf das gleiche Wissensfundament Bezug. Man erhält verlässlichere Antworten von dem LLM, weil dieses auf fundierte Informationen zugreifen kann.
RAG hilft Unternehmen, die von ihnen verwendeten KI-Modelle von Anbietern wie OpenAI oder Anthropic zu verbessern, ohne den zusätzlichen Zeit-, Kosten- und technischen Ressourcenaufwand, der für das Retraining auf spezifisches Wissen für den beabsichtigten Anwendungsfall erforderlich wäre. Daher demokratisiert RAG die LLM-Verbesserung.
Glücklicherweise erfordert der Aufbau von RAG-Pipelines keine umfangreiche Infrastruktur oder tiefgreifende Expertise im Bereich Machine Learning. Der Einstieg ist deshalb kein Problem. Es handelt sich um einen einfachen Prozess in drei Schritten: die Ermittlung von Anwendungsfällen, die Auswahl geeigneter Datenquellen und die Erstellung der eigentlichen RAG-Pipeline.
Ermitteln Sie zunächst, welche Datenquellen für Teams am hilfreichsten wären, wenn sie diese mithilfe von Natural Language Prompting abrufen könnten. Konzentrieren Sie sich auf Reibungspunkte mit hoher Auswirkung, einschließlich Ressourcen, die Teams häufig für Antworten heranziehen, Systeme, in denen sie oft auf Engpässe stoßen, oder Prozesse, bei denen immer wieder dieselben Fragen auftauchen.
Um die vielversprechendsten RAG-Anwendungsfälle zu finden, stellen Sie die folgenden Fragen an Ihre internen Teams:
Priorisieren Sie RAG-Anwendungsfälle, bei denen die Kombination von generativem Denken mit internem und externem Wissen konkrete Probleme lösen, Kontextwechsel reduzieren, repetitive Aufgaben eliminieren und die Durchgängigkeit zwischen Teams verbessern kann.
RAG-Systeme sind nur so gut wie die Daten, auf die sie zugreifen. Deshalb wirken sich die Qualität, Vollständigkeit, Governance und Struktur der verfügbaren Datenquellen direkt auf die Qualität der Antwort aus.
RAG-würdige Daten müssen folgende Kriterien erfüllen:
Vermeiden Sie Datenquellen, die Rauschen oder Inkonsistenzen verursachen, einschließlich:
Arbeiten Sie mit internen Stakeholdern und der IT zusammen, um alle Datenquellen zu erfassen, zu bereinigen und eine fortlaufende Verantwortlichkeit zuzuweisen.
Verarbeiten und organisieren Sie als Nächstes Datensätze in einer Struktur, die für die semantische Suche geeignet ist. Ein typischer RAG-Workflow umfasst fünf Schritte: Erfassung, Einbettung, Speicherung in einer Vektordatenbank, Abfrageabruf und Antwortgenerierung.
1. Erfassung
Beginnen Sie mit dem Sammeln relevanter Dateien und Dokumente aus gemeinsam genutzten Repositories, Speicher-Buckets oder Content-Systemen. Konzentrieren Sie sich dann auf:
2. Einbettung
Verwenden Sie ein Einbettungsmodell, wie z. B. BGE-Einbettungsmodelle, um jeden Textblock in einen numerischen Vektor umzuwandeln, der seine semantische Bedeutung erfasst.
3. Vektordatenbankspeicher
Speichern Sie Einbettungen und alle zugehörigen Metadaten in einer skalierbaren Vektordatenbank, wie z. B. Cloudflare Vectorize. Dies ermöglicht eine effiziente Abfrage und Filterung für umfangreiche Wissensdatenbanken.
4. Abfrageabruf
Wenn ein Nutzer einen Prompt sendet, wandelt das System die Abfrage in einen Vektor um, durchsucht die Vektordatenbank nach geeigneten, semantisch ähnlichen Blöcken und wendet Filter auf der Grundlage von Metadaten an, um die Abruffunktion zu optimieren, beispielsweise um den Zugriff auf bestimmte Informationen anhand von Rolle oder Abteilung zu beschränken.
5. Antwortgenerierung
Schließlich werden die abgerufenen Chunks als zusätzlicher Kontext in den Prompt eingefügt, bevor sie an das LLM weitergeleitet werden. Das LLM nutzt diesen Kontext, um eine sinnvolle und genaue Antwort zu generieren, die auf internen und externen Daten basiert.
Die Entwicklung einer wertvollen RAG-Pipeline ist eine gemeinschaftliche Aufgabe, die das Engagement aller erfordert. Sie ist jedoch auf die IT angewiesen, um die Umsetzung zu leiten, die Infrastruktur – etwa Datenpipelines, Skalierung der Vektordatenbank und Zugriffskontrollen – zu verwalten und Systeme zu integrieren.
Und doch kann die IT-Abteilung den Prozess nicht allein verantworten. Beginnen Sie mit der Abstimmung von funktionsübergreifenden Teams, einschließlich IT, Fachexperten und Interessenvertretern. Gemeinsam sollten diese Teams Anwendungsfälle und vertrauenswürdige Datenquellen identifizieren, Standards für die Inhaltsautorität definieren und Verantwortlichkeiten zuweisen, um sicherzustellen, dass Datensätze korrekt und aktuell bleiben.
Wenden Sie Zugriffskontrollen an, damit nur Nutzer in relevanten Positionen oder Geschäftsbereichen Zugriff auf sensible Daten haben. Sorgen Sie außerdem dafür, dass das gesamte System mit Verschlüsselungs- und Compliance-Leitplanken ausgestattet ist.
Beginnen Sie mit einem Pilotprojekt, weiten Sie auf Grundlage der dort verzeichneten Ergebnisse den Anwendungsbereich aus und nehmen Sie zu guter Letzt eine abteilungsübergreifende Skalierung vor.
Integrieren Sie von Anfang an Erfolgskennzahlen in den Prozess, um die Effektivität und den geschäftlichen Nutzen des RAG-Systems zu evaluieren.
Bewerten Sie das System insbesondere anhand von KPIs, wie beispielsweise:
Die RAG-Bewertung beinhaltet häufig eine Human-in-the-Loop-Validierung, um die Genauigkeit zu überprüfen. Um die Implementierung der RAG-Pipeline im Laufe der Zeit zu verbessern, ist es wichtig, kontinuierlich Nutzer-Feedback einzuholen, Performance-Metriken in Bezug auf Abfrage- und Abrufprotokolle zu analysieren, die Inhaltshygiene zu überprüfen und den Fortschritt im Hinblick auf die Geschäftsziele zu bewerten.
Der manuelle Aufbau einer RAG-Pipeline erfordert das Zusammenfügen von Speicher, Vektordatenbanken, Einbettungsmodellen, LLMs und benutzerdefinierter Indizierungs- bzw. Abruflogik sowie die Wartung des Systems bei Datenänderungen. Dies erfordert Zeit und Zusammenarbeit, und die Komplexität dieser Aufgaben kann Teams von anderen wichtigen Projekten ablenken. Für einige Organisationen ist die Einführung von RAG trotz ihrer potenziellen Vorteile unpraktisch.
Die Cloudflare-Lösung AI Search (früher AutoRAG) hilft hier weiter.
AI Search ist eine vollständig verwaltete RAG-Pipeline, die auf der Entwicklerplattform von Cloudflare aufgebaut ist. In nur vier Schritten können Nutzer Datenquellen wie Unternehmenswebsites, E-Commerce-Produktkataloge und Entwicklerdokumenten verbinden. AI Search übernimmt Aufnahme, Markdown-Konvertierung, Chunking, Einbettung und Speicherung in Vectorize. Anschließend führt sie eine semantische Abfrage durch und generiert Antworten mit Workers AI.
AI Search beseitigt die hohe Infrastrukturbelastung beim Aufbau von RAG-Pipelines, indem Skalierung, Speicherung und KI-Inferenz automatisiert werden – bei gleichzeitig sicherem und regelkonformem Zugriff auf interne Datenquellen innerhalb der RAG-Systeme. Zusätzlich reindiziert AI Search kontinuierlich Daten im Hintergrund, wodurch Antworten aktuell bleiben, wenn interne Quellen aktualisiert werden.
Die Daten Ihres Unternehmens sind ein wichtiger strategischer Vorteil. Der Aufbau einer sicheren RAG-Pipeline ermöglicht den Teammitgliedern und Kunden den Zugriff auf diese Daten, indem die LLMs des Unternehmens mit den spezifischen Richtlinien, Prozessen und der Wissensdatenbank erweitert werden, die Ihr Unternehmen und Ihren Markt differenzieren.
Einfach ausgedrückt: RAG verbessert gängige Modelle durch internes Unternehmenswissen und freigegebene Ressourcen von Drittanbietern, um einen KI-Vorteil in Echtzeit zu erzielen.
Ob manuell oder mit AI Search entwickelt wird, beginnen Sie mit den richtigen Anwendungsfällen, kuratieren Sie hochwertige Daten und arbeiten Sie zusammen, um schnelle, genaue und fundierte Antworten zu liefern.
Kann's losgehen? Erstellen Sie Ihren eigenen internen RAG in vier einfachen Schritten.
Retrieval-Augmented Generation (RAG) ist eine Methode zur Verbesserung großer Sprachmodelle (LLMs), indem ihnen der Zugriff auf interne und externe Datenquellen ermöglicht wird, die nicht Teil ihres ursprünglichen Trainings waren.
RAG ermöglicht es Teams, Organisationswissen und Ressourcen von Drittanbietern mithilfe natürlicher Sprache abzufragen. Dies kann dazu beitragen, Unterbrechungen der Kollegen zu vermeiden und den Zeitaufwand für manuelle Suchen zu reduzieren. Es demokratisiert auch die Verbesserung von KI-Modellen von Anbietern wie OpenAI oder Anthropic, ohne dass der Zeit-, Kosten- oder technische Ressourcenaufwand für ein vollständiges Neutraining erforderlich ist.
Die Schritte zum Aufbau einer RAG-Pipeline sind: Konzipierung potenzieller Anwendungsfälle, Identifizierung geeigneter Datenquellen und Erstellung der eigentlichen RAG-Pipeline. Der Pipelineaufbau umfasst die Aufnahme von Inhalten, die Verwendung eines Einbettungsmodells zur Konvertierung von Text in Vektoren, die Speicherung von Einbettungen und Metadaten in einer Vektordatenbank, die Ermöglichung des Abrufens von Abfragen und die Erleichterung der Antwortgenerierung.
Zu den wichtigsten Anwendungsfällen für RAG gehören die Erstellung von: Self-Service-Abrechnungsassistenten, kundenorientierten Richtlinienassistenten, Compliance-Assistenten für Personalrichtlinien, RFP-Assistenten für den Vertrieb und interaktiven Leitfäden zum Onboarding von Kunden. Diese Anwendungsfälle können dazu beitragen, konkrete Probleme zu lösen, repetitive Aufgaben zu reduzieren und die Konsistenz zwischen den Teams zu verbessern.
RAG-fähige Datenquellen sollten präzise und regelmäßig gewartet sein sowie über eine Struktur verfügen, die es ermöglicht, sie in logische Abschnitte zu unterteilen, wie beispielsweise Markdown-Dateien, PDFs, HTML-Dokumente oder JSON-Dateien. Sie sollten auch häufig gestellte Fragen beantworten, wie Produkt-FAQs oder Anleitungen zu internen Prozessen.
Ein typischer RAG-Workflow besteht aus fünf Teilen: Erfassung, Einbettung Speicherung in einer Vektordatenbank, Abfrageabruf und Antwortgenerierung.
Der Erfolg einer RAG-Pipeline kann anhand von Schlüssel-Performance-Indikatoren (KPIs) wie Abrufgenauigkeit, Antwortrelevanz und Faktentreue, Latenzzeit, Nutzerakzeptanz und -zufriedenheit sowie Daten-Governance gemessen werden. Kontinuierliches Nutzerfeedback und die Analyse von Performance-Metriken können dazu beitragen, die Implementierung im Laufe der Zeit zu verbessern.
Ein Einbettungsmodell, wie z. B. BGE-Einbettungsmodelle, wandelt Textblöcke in numerische Vektoren um, die ihre semantische Bedeutung erfassen. Diese Vektoren werden dann zur effizienten Abfrage und Filterung in einer Vektordatenbank gespeichert.
Cloudflare AI Search ist eine vollständig verwaltete RAG-Pipeline, die die Aufnahme, Chunking, Einbettung und Speicherung von Daten in Vectorize automatisiert. Sie übernimmt auch die semantische Abfrage und Antwortgenerierung mit Workers AI, wodurch die Notwendigkeit für eine manuelle Infrastrukturverwaltung entfällt.