Glossar
RAG (Retrieval-Augmented Generation)
Retrieval-Augmented Generation (RAG) ist eine KI-Architektur, bei der ein großes Sprachmodell seine Antworten nicht aus dem eigenen Trainingswissen generiert, sondern strikt aus einer definierten, aktüllen Dokumentenbasis abruft und anhand dieser Qüllen begründet. Das Ergebnis sind Antworten, die nachvollziehbar, prüfbar und qüllenbelegbar sind, anstatt freier Generierung, die zu sogenannten Halluzinationen führen kann, also zu plausibel klingenden, aber faktisch falschen Aussagen.
Wie RAG funktioniert
RAG-Systeme arbeiten in zwei Schritten:
- Retrieval (Abruf): Die Anfrage einer Person wird in eine numerische Darstellung (Embedding) umgewandelt und gegen eine Vektordatenbank verglichen, in der alle relevanten Dokumente als Embeddings vorliegen. Die semantisch ähnlichsten Textstellen werden abgerufen.
- Generation (Antwortformulierung): Die abgerufenen Textstellen werden dem Sprachmodell als Kontext übergeben. Das Modell formuliert eine Antwort ausschließlich auf Basis dieser Textstellen, nicht aus seinem allgemeinen Trainingswissen. Jede Aussage kann auf eine konkrete Qülle zurückgeführt werden.
Dieses Prinzip der strikten Qüllenbindung unterscheidet RAG fundamental von einem allgemeinen KI-Assistenten, der Antworten frei aus seinen Trainingsdaten generiert.
Warum Qüllenbindung in professionellen Anwendungen unverzichtbar ist
In professionellen, rechtlich relevanten oder sicherheitskritischen Umgebungen ist eine KI ohne Qüllenbindung kaum einsetzbar. Wenn ein Sprachmodell frei antwortet, kann es Informationen erfinden oder veraltete Trainingsdaten verwenden. Für eine Sachbearbeiterin in einer Behörde oder eine Führungskraft, die sich auf das Wissensarchiv eines ausgeschiedenen Mitarbeiters verlässt, ist das nicht akzeptabel.
RAG löst dieses Problem: Das Wissenssystem darf nur auf das zugreifen, was in der eigenen Wissensbasis vorhanden ist, und gibt bei Unklarheit an, welche Qülle welche Information liefert.
Abgrenzung: RAG und allgemeine KI-Assistenten
Ein allgemeiner KI-Chatbot beantwortet Fragen aus seinem Trainingswissen, das beliebige Internetqüllen, Bücher und Daten umfasst und ein festes Trainingsdatum hat. Er kann keine organisationsspezifischen Fragen aus dem Unternehmensarchiv beantworten, weil er darauf keinen Zugriff hat. RAG hingegen wird mit den eigenen Dokumenten der Organisation betrieben: dem Wissensinterview, den hochgeladenen Dokumenten, den Diktataufnahmen. Es antwortet ausschließlich auf dieser Grundlage.
Souveränität und Datenschutz bei RAG
Für Organisationen, die sensible Informationen verwalten, also Behörden, Gesundheitseinrichtungen oder Unternehmen mit vertraulichen Geschäftsdaten, ist die Frage entscheidend, wo die Dokumentenbasis gespeichert ist und wer Zugriff auf die Embeddings hat. In souveränen RAG-Lösungen laufen sowohl die Embedding-Berechnung als auch die Vektordatenbank und das Sprachmodell auf eigener Infrastruktur. Kein Dokument verlässt die Organisation.
RAG in Erfaro
Erfaro setzt RAG als Kern seiner Wissenssuche ein. Alle erfassten Interviewantworten, Dokumente und Diktate werden als Embeddings in einer lokalen Vektordatenbank abgelegt. Wenn ein Nachfolger eine Frage an das Wissenssystem stellt, ruft RAG die relevantesten Passagen ab und formuliert eine Antwort mit strikter Qüllenbindung, so dass jede Aussage auf den originalen Interviewtext oder das hochgeladene Dokument zurückgeführt werden kann. Das Embedding-Verfahren läuft dabei immer lokal, unabhängig vom gewählten Tier. Mehr zur Souveränität bei Erfaro: DSGVO-konformer Wissenstransfer und zur Praxis: Wissenstransfer beim Mitarbeiteraustritt.
Wie Erfaro RAG für nachvollziehbare Wissenssuche einsetzt: Demo anfragen und den Assistenten live erleben.
Häufige Fragen
Was ist RAG (Retrieval-Augmented Generation)?
Retrieval-Augmented Generation ist eine KI-Architektur, bei der ein Sprachmodell Antworten nicht aus dem eigenen Trainingswissen generiert, sondern strikt aus einer definierten Dokumentenbasis abruft. Das verhindert Halluzinationen und macht Antworten nachvollziehbar und qüllenbelegbar.
Warum ist Qüllenbindung bei RAG so wichtig?
Ohne Qüllenbindung können KI-Systeme plausibel klingende, aber falsche Antworten generieren. RAG stellt sicher, dass jede Antwort auf konkrete Dokumente zurückgeführt werden kann, was für professionelle und rechtssichere Anwendungen unverzichtbar ist.
Wie funktioniert RAG technisch?
Eine Anfrage wird in eine numerische Darstellung (Embedding) umgewandelt und gegen eine Vektordatenbank verglichen. Die relevantesten Textstellen werden abgerufen und dem Sprachmodell als Kontext übergeben, das daraus eine Antwort formuliert.