Künstliche Intelligenz

Was ist Retrieval-Augmented Generation (RAG)? Einfach erklaert

Was ist Retrieval-Augmented Generation (RAG)? Einfach erklaert

Wer sich in den letzten Jahren mit KI-Chatbots wie ChatGPT, Gemini oder Copilot beschäftigt hat, ist früher oder später über den Begriff Retrieval-Augmented Generation, kurz RAG, gestolpert. Das Konzept klingt zunächst technisch, steckt aber inzwischen hinter vielen alltäglichen KI-Funktionen – von der Websuche innerhalb eines Chatbots bis zur unternehmensinternen KI-Assistenz, die auf firmeneigene Dokumente zugreifen kann.

Um RAG zu verstehen, hilft ein Blick auf das grundlegende Problem klassischer Sprachmodelle: Ein Large Language Model wie GPT oder Gemini wird auf einem riesigen, aber zu einem bestimmten Zeitpunkt eingefrorenen Datensatz trainiert. Alles, was das Modell "weiß", basiert auf diesen Trainingsdaten – aktuelle Ereignisse, firmeninterne Dokumente oder sehr spezifisches Fachwissen, das nicht Teil der Trainingsdaten war, kennt das Modell schlicht nicht. Stattdessen neigen Sprachmodelle in solchen Fällen dazu, plausibel klingende, aber inhaltlich falsche Antworten zu erfinden – ein Phänomen, das in der Fachsprache als Halluzination bezeichnet wird.

Genau hier setzt Retrieval-Augmented Generation an. Anstatt sich ausschließlich auf das im Modell gespeicherte Wissen zu verlassen, wird bei einer RAG-Anfrage zunächst eine Suche in einer externen Wissensquelle durchgeführt – das kann eine Websuche sein, eine unternehmensinterne Dokumentendatenbank oder eine spezialisierte Sammlung an Fachliteratur. Die relevantesten gefundenen Textausschnitte werden anschließend zusammen mit der ursprünglichen Nutzerfrage an das Sprachmodell übergeben, das seine Antwort dann auf Basis dieser aktuellen, konkreten Informationen formuliert, statt sich ausschließlich auf sein antrainiertes Wissen zu verlassen.

Technisch läuft dieser Prozess in mehreren Schritten ab. Zunächst wird die Nutzeranfrage in eine mathematische Repräsentation, einen sogenannten Embedding-Vektor, umgewandelt. Dieser Vektor wird mit einer vorab erstellten Datenbank ähnlicher Vektoren verglichen, die aus den verfügbaren Dokumenten generiert wurden – man spricht hier von einer Vektordatenbank. Die inhaltlich ähnlichsten Textabschnitte werden aus dieser Datenbank abgerufen und dem Sprachmodell als zusätzlicher Kontext mitgegeben. Das Modell generiert daraufhin seine Antwort, wobei es die bereitgestellten Textausschnitte als Grundlage nutzt und im besten Fall sogar konkrete Quellenangaben liefert.

Der große Vorteil dieses Ansatzes liegt auf der Hand: Statt ein komplettes Sprachmodell neu zu trainieren, um es auf dem neuesten Stand zu halten oder mit unternehmensspezifischem Wissen auszustatten – ein aufwendiger und teurer Prozess – lässt sich einfach die zugrunde liegende Wissensdatenbank aktualisieren. Neue Dokumente werden hinzugefügt, veraltete entfernt, und das Sprachmodell selbst bleibt unverändert, greift aber bei der nächsten Anfrage automatisch auf die aktualisierten Informationen zu.

In der Praxis begegnet man RAG-Systemen inzwischen an vielen Stellen, oft ohne es bewusst wahrzunehmen. Wenn ein Chatbot wie ChatGPT oder Gemini für eine Anfrage im Internet recherchiert und anschließend mit Quellenangaben antwortet, handelt es sich im Kern um eine Form von RAG. Auch viele Unternehmens-Chatbots, die Fragen zu internen Handbüchern, Kundendaten oder Produktdokumentationen beantworten, basieren auf diesem Prinzip – häufig kombiniert mit zusätzlichen Sicherheitsmechanismen, die verhindern sollen, dass sensible Informationen versehentlich preisgegeben werden.

Ein häufiges Missverständnis ist, dass RAG Halluzinationen vollständig verhindert. Das stimmt nicht ganz: Auch mit bereitgestelltem Kontext kann ein Sprachmodell theoretisch noch immer Informationen erfinden oder die bereitgestellten Textausschnitte falsch interpretieren. RAG reduziert das Risiko von Halluzinationen jedoch erheblich, weil das Modell konkrete, überprüfbare Textgrundlagen erhält, statt komplett aus dem eigenen, möglicherweise lückenhaften Trainingswissen zu schöpfen. Die Qualität der Antwort hängt dabei stark von der Qualität und Relevanz der abgerufenen Dokumente ab – ein schlecht gepflegter Dokumentenbestand führt auch bei RAG-Systemen zu unzuverlässigen Antworten.

Für Unternehmen, die eigene KI-Assistenten aufbauen möchten, hat sich RAG als praktikabler Mittelweg zwischen zwei Extremen etabliert: dem vollständigen Neutraining eines Modells, das enorme Rechenressourcen erfordert, und der reinen Nutzung eines allgemeinen Chatbots ohne jeglichen Zugriff auf firmenspezifisches Wissen. Zahlreiche Software-Anbieter bieten inzwischen fertige RAG-Frameworks an, die den Aufbau einer Vektordatenbank und die Anbindung an gängige Sprachmodelle deutlich vereinfachen, sodass auch kleinere Unternehmen ohne eigenes KI-Team solche Systeme umsetzen können.

Für Privatanwender bleibt das Konzept meist im Hintergrund, beeinflusst aber direkt die Qualität der genutzten KI-Tools. Wer verstehen möchte, warum ein Chatbot bei einer Frage zu aktuellen Ereignissen plötzlich präzise mit Quellenangaben antwortet, während er bei rein aus dem Trainingswissen beantworteten Fragen gelegentlich ungenau bleibt, kennt jetzt den technischen Hintergrund: Im ersten Fall arbeitet vermutlich ein RAG-System im Hintergrund, im zweiten verlässt sich das Modell ausschließlich auf sein eingefrorenes Trainingswissen.

Ein weiterer wichtiger Aspekt betrifft die sogenannte Chunking-Strategie, also die Frage, wie ein langes Dokument in kleinere Textabschnitte zerlegt wird, bevor es in der Vektordatenbank gespeichert wird. Wird ein Dokument in zu große Abschnitte zerteilt, enthält jeder Chunk möglicherweise zu viele unterschiedliche Themen, was die Relevanz-Suche ungenauer macht. Werden die Abschnitte dagegen zu klein gewählt, geht wichtiger Kontext verloren, der zum Verständnis einzelner Sätze notwendig gewesen wäre. Die optimale Chunk-Größe hängt stark von der Art der Dokumente ab – juristische Verträge erfordern beispielsweise eine andere Strategie als technische Handbücher oder Produktkataloge, und viele produktive RAG-Systeme nutzen inzwischen adaptive Verfahren, die Chunk-Grenzen an natürlichen Absatz- oder Kapitelgrenzen ausrichten, statt starr nach Zeichenanzahl zu schneiden.

Auch das sogenannte Reranking spielt in ausgereiften RAG-Systemen eine wichtige Rolle. Nach der ersten, meist schnellen Vektorsuche werden die gefundenen Kandidaten-Textabschnitte oft noch einmal durch ein spezialisiertes, präziseres Modell bewertet und neu sortiert, bevor die besten Treffer tatsächlich an das Sprachmodell weitergegeben werden. Dieser zweistufige Ansatz kombiniert die Geschwindigkeit einer einfachen Vektorsuche mit der höheren Genauigkeit eines aufwendigeren Bewertungsmodells und verbessert die Antwortqualität messbar, insbesondere bei komplexen oder mehrdeutigen Anfragen.

Langfristig entwickelt sich das Feld rund um RAG rasant weiter. Neuere Ansätze experimentieren mit sogenannten agentenbasierten RAG-Systemen, bei denen die KI selbstständig entscheidet, ob und wie oft sie zusätzliche Informationen abrufen muss, statt bei jeder Anfrage automatisch eine feste Anzahl an Textausschnitten heranzuziehen. Solche Systeme können mehrere Suchschritte hintereinander ausführen, Zwischenergebnisse bewerten und bei Bedarf gezielt nachrecherchieren – ein Verhalten, das dem schrittweisen Vorgehen eines menschlichen Rechercheurs deutlich näherkommt als die klassische, einstufige RAG-Pipeline der ersten Generation.

Für Einsteiger, die selbst mit RAG experimentieren möchten, gibt es inzwischen zahlreiche Open-Source-Werkzeuge, die den Einstieg deutlich erleichtern und keine tiefen Programmierkenntnisse mehr voraussetzen, um erste eigene Wissensdatenbanken an ein bestehendes Sprachmodell anzubinden.

Wer sich intensiver mit dem Thema beschäftigen möchte, findet in der Dokumentation gängiger KI-Plattformen mittlerweile ausführliche technische Leitfäden, die den Aufbau eigener RAG-Pipelines Schritt für Schritt erklären, inklusive konkreter Codebeispiele für die gängigsten Programmiersprachen.

Weiterführend: ChatGPT, Gemini und Copilot im Vergleich, Copilot+ PC erklärt und Was NPUs wirklich bringen.