Zum Inhalt springen
KI verstehen & prompten·Fortgeschritten

Retrieval Augmented Generation

Auch bekannt als: RAG, Retrieval-Augmented Generation

Retrieval Augmented Generation heißt wörtlich, dass Wissen zur Antwortzeit von außen in den Kontext des Sprachmodells geholt wird. Der Begriff umfasst Index-Suche, Graph-RAG, Agentic RAG und Tool-Abfragen. Umgangssprachlich meint RAG meist die bekannteste Variante mit Embedding, Vektor-Datenbank und Top-k-Treffern.

RAG ist heute das dominierende Muster, um generative KI mit unternehmensspezifischem Wissen zu koppeln. Statt ein Modell auf eigenen Daten zu trainieren, wird zur Antwortzeit Wissen von außen in den Kontext geholt. Mehr sagt der Begriff wörtlich nicht: Die Definition aus der Forschungsarbeit von Lewis et al. (2020) beschreibt eine Aufgabe, keine bestimmte Technik.

Weiter Begriff, enge Gewohnheit

Nach der wörtlichen Definition ist alles RAG, was zur Antwortzeit Kontext von außen holt: die Suche über einen Index, das Navigieren durch Dateien und Wissensgraphen (Agentic RAG, Graph-RAG) und die Tool-Abfrage gegen eine Datenbank. Umgangssprachlich ist RAG aber auf einen einzigen Weg verengt: die Index-Suche, oft gleichgesetzt mit der Vektordatenbank. Das ist die verbreitetste Umsetzung, nicht der Begriff selbst. Dass der weite Begriff trägt, zeigt schon das Fachvokabular: Graph-RAG und Agentic RAG heißen RAG und sind keine Index-Suche.

Klassisches RAG: die bekannteste Pipeline

Wenn von RAG die Rede ist, ist meist diese Pipeline gemeint: Nutzerfrage → Suche in Vektor- oder Volltext-Index → relevante Passagen → als Kontext an das Modell → Antwort mit Quellenbezug.

Warum RAG statt Fine-Tuning

Fine-Tuning verändert das Modell selbst. RAG lässt das Modell unverändert und ergänzt nur den Kontext. Das macht Updates billig (neue Daten indexieren), Zitate möglich (Quellenangabe in der Antwort) und Halluzinationen seltener.

Typische Bausteine der klassischen Pipeline

  • Embedding-Modell: wandelt Texte in Vektoren
  • Vektor-Datenbank: speichert und findet ähnliche Vektoren
  • Retriever: holt Top-k Treffer zur Frage
  • Reranker (optional): sortiert Treffer feiner
  • LLM: generiert die Antwort aus Frage + Kontext

Zuletzt aktualisiert: 5. August 2026