Glossar · RAG und Wissensmanagement
Wissensstufe: GrundlageRetrieval-Augmented Generation
Retrieval-Augmented Generation ist ein Verfahren, bei dem ein Sprachmodell vor der Antwort passende Textstellen aus einem Dokumentenbestand erhält und sie nutzt.
Auch: RAG
Einfach erklärt
Ein Sprachmodell ohne RAG antwortet wie jemand in der mündlichen Prüfung: aus dem Gedächtnis. Mit RAG darf es vorher in genau den Akten nachschlagen, die zur Frage passen.
Was technisch passiert
Der Begriff geht auf ein Paper von Lewis und Kollegen aus dem Jahr 2020 zurück. Es unterscheidet das parametrische Gedächtnis, das in den Gewichten eines Modells steckt, vom nichtparametrischen, einem durchsuchbaren Index aus Texten. RAG verbindet beide.
Ein RAG-System arbeitet in zwei Phasen. Bei der Aufnahme werden Dokumente in Abschnitte zerlegt. Ein Embedding-Modell übersetzt jeden Abschnitt in einen Vektor, der zusammen mit Metadaten wie Dateiname und Seitenzahl in einer Vektordatenbank landet. Stellt jemand eine Frage, wird auch sie in einen Vektor übersetzt. Die Suche liefert die inhaltlich nächstliegenden Abschnitte, häufig ergänzt um eine klassische Stichwortsuche. Diese Abschnitte gehen gemeinsam mit der Frage an das Sprachmodell, das daraus die Antwort formuliert und angeben kann, worauf sie beruht.
Die Qualität hängt deshalb stärker an der Suche als am Modell. Findet die Suche die falschen Abschnitte, schreibt das Modell eine flüssige, aber unzutreffende Antwort. Wie Dokumente zerlegt werden, welches Embedding-Modell rechnet und welche Zugriffsrechte gelten, sind die eigentlichen Stellschrauben eines solchen Systems.
In der Praxis
AI SolutionX baut RAG-Architekturen als Wissens- und Dokumenten-KI. Handbücher, Verträge und Projektdokumentation werden in natürlicher Sprache abfragbar, und jede Antwort kommt mit der Fundstelle. Das eigene System SUFAWI arbeitet nach diesem Prinzip: Es kombiniert Qdrant und Meilisearch zu einer hybriden Suche und verarbeitet alles auf eigener Hardware. Für den Forschungsverbund aus vier DGX Spark ist Private RAG einer der vorgesehenen Einsätze – große vertrauliche Wissensräume, bei denen neben dem Sprachmodell auch Suche und Embeddings im Haus bleiben.
Wann ist das sinnvoll?
- Wenn Antworten auf eigenen Unterlagen beruhen müssen, die sich regelmäßig ändern.
- Wenn nachvollziehbar sein soll, aus welchem Dokument eine Aussage stammt.
- Wenn Berechtigungen gelten: Die Suche lässt sich auf Abschnitte beschränken, die die fragende Person sehen darf.
- Weniger geeignet, wenn ein Modell einen bestimmten Schreibstil oder ein festes Ausgabeformat lernen soll; dafür ist Fine-Tuning der passendere Weg.
Nicht verwechseln mit
- Fine-Tuning
- Beim Fine-Tuning wird das Modell mit eigenen Daten nachtrainiert, das Wissen steckt danach in den Gewichten. RAG lässt das Modell unverändert und liefert das Wissen bei jeder Anfrage neu, sodass geänderte Dokumente sofort wirken.
- Langes Kontextfenster
- Ein großes Kontextfenster erlaubt, viele Dokumente direkt mitzuschicken. Die Auswahl ersetzt das nicht: Jedes zusätzliche Token kostet Rechenzeit, und ein großer Bestand passt ohnehin nicht vollständig hinein.
Quellen
- Lewis et al. (2020): Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks · abgerufen am
- Qdrant Documentation: Hybrid Queries · abgerufen am
Fachlich geprüft am · Alle Begriffe im Glossar