Leistung 02
RAG & Wissenszugriff
Antworten aus dem eigenen Bestand, jede mit ihrer Fundstelle. Zitiert wird nur, was der Fragende öffnen darf.
Problem
Woran es hängt
Das Wissen liegt vor: in Bedingungswerken, Anlagendokumentationen, Protokollen, Laufwerken. Nur findet es niemand. Die Volltextsuche trifft Wörter, keine Fragen, und ein Modell ohne Zugriff auf den Bestand antwortet flüssig und falsch. Ein Retrieval, das die Rechte schon beim Indexieren auflöst, führt vom ersten Tag an einen zweiten Rechtebestand.
Grundlagen
Was dahintersteckt
Wie Retrieval arbeitet
Ein Sprachmodell kennt Ihren Rahmenvertrag nicht. Es kennt auch nicht Ihre Anlagendokumentation, Ihre Bedingungswerke und die Protokolle der letzten vier Jahre. Was es kennt, ist die Sprache, in der solche Dokumente geschrieben sind, und genau daraus entsteht das Problem: Ein Modell ohne Zugriff auf Ihren Bestand antwortet flüssig und falsch. Es formuliert einen Absatz, der klingt wie aus Ihrem Vertrag, und keine Zeile davon steht darin.
Retrieval Augmented Generation dreht die Reihenfolge um. Zuerst wird gesucht, dann formuliert. Das Modell bekommt die Abschnitte, die zur Frage passen, und schreibt seine Antwort aus ihnen. Was es nicht bekommt, kann es nicht zitieren. Und was es zitiert, trägt die Stelle, an der es steht.
Der praktische Unterschied zeigt sich an einer einzigen Frage: „Woher weiß ich, dass das stimmt?" Ohne Retrieval gibt es darauf keine Antwort. Mit Retrieval steht sie in der Antwort selbst: Datei, Fassung, Abschnitt, Seite.
Warum die Volltextsuche nicht reicht
Ihre Volltextsuche ist nicht kaputt. Sie beantwortet nur eine andere Frage als die, die Ihre Mitarbeitenden stellen.
Eine Volltextsuche trifft Wörter. Wer „Kündigungsfrist Rahmenvertrag" eingibt, bekommt jedes Dokument, in dem beide Wörter vorkommen, und keines, in dem stattdessen „Vertragsende" und „Ziffer 12" steht. Wer die Frage dagegen so stellt, wie er sie im Kopf hat („Bis wann müssen wir kündigen, wenn der Vertrag im März ausläuft?"), bekommt in einer Volltextsuche gar nichts.
Retrieval sucht nach Bedeutung. Jeder Abschnitt Ihres Bestands wird in eine Zahlenfolge überführt, die seine Aussage abbildet; die Frage wird in dieselbe Form gebracht, und gesucht wird nach Nähe. „Vertragsende" und „Kündigungsfrist" liegen darin dicht beieinander, auch wenn kein Wort übereinstimmt.
Das ersetzt die Volltextsuche nicht. In der Praxis stehen beide nebeneinander: Wer eine Belegnummer sucht, will einen exakten Treffer, und den liefert die Volltextsuche besser. Wer eine Frage hat, will einen Abschnitt, der sie beantwortet.
Der Schnitt entscheidet, nicht das Modell
Die häufigste Fehleinschätzung in RAG-Projekten betrifft die Reihenfolge der Stellschrauben. Diskutiert wird das Einbettungsmodell. Entschieden wird an der Zerlegung.
Ein Dokument wird nicht als Ganzes durchsucht, sondern in Abschnitten. Wie diese Abschnitte geschnitten sind, bestimmt, was gefunden wird. Zu klein geschnitten, verliert ein Abschnitt seinen Zusammenhang: „Die Frist beträgt drei Monate" ohne den Satz davor, der sagt, welche Frist gemeint ist. Zu groß geschnitten, verwässert er: Ein Kapitel von acht Seiten liegt in der Bedeutungssuche irgendwo in der Mitte zwischen allen Themen, die darin vorkommen, und wird zu keinem davon der beste Treffer.
Dazwischen liegt viel Handarbeit, und sie lohnt sich. Ein Bedingungswerk schneidet man an Paragraphen, eine Anlagendokumentation an Baugruppen, ein Wiki an Überschriften. Jeder Abschnitt bekommt einen Kontextkopf mit dem Titel des Dokuments, dem Kapitel und der Fassung. Das kostet ein paar Prozent Speicher und hebt die Trefferquote deutlich, weil der Abschnitt dann auch allein verständlich ist.
Gemessen wird das an einer Fragemenge aus dem Fachbereich: dreißig bis fünfzig echte Fragen, jede mit der Stelle, an der die Antwort steht. Danach lässt sich jede Änderung an der Zerlegung dagegen fahren und sehen, ob sie trägt.
Berechtigungen: hinter das Retrieval, nicht davor
Hier scheitern Vorhaben, die technisch längst liefen.
Der naheliegende Weg ist, die Rechte beim Indexieren aufzulösen: Jeder Abschnitt bekommt eine Liste der Rollen, die ihn sehen dürfen, und die Suche filtert darauf. Das ist schnell und führt vom ersten Tag an einen zweiten Rechtebestand: eine Kopie Ihres Verzeichnisses, die veraltet, sobald jemand die Abteilung wechselt. Wer im Verzeichnis aus dem Einkauf herausgenommen wird, sieht das Vertragsarchiv weiterhin, bis jemand neu indexiert.
Der Weg, den wir gehen, prüft bei jeder Anfrage. Das Retrieval holt Kandidaten, ohne Rechte zu kennen; erst danach wird gegen das Verzeichnis geprüft, welche davon der Fragende öffnen darf. Was übrig bleibt, geht ans Modell. Was wegfällt, steht als Verweigerung im Protokoll und nicht als Lücke.
Der Preis dafür sind einige Millisekunden je Anfrage. Der Gewinn ist, dass es nur einen Rechtebestand gibt, und zwar Ihren.
Was eine Antwort tragen muss
Drei Dinge, und alle drei sind nicht verhandelbar.
Die Fundstelle. Datei, Fassung, Abschnitt, Seite. Nicht „laut internen
Dokumenten", sondern rahmenvertrag-2024.pdf, § 7 Abs. 2, S. 14. Wer die
Antwort prüfen will, soll sie in zwei Klicks prüfen können.
Die Gültigkeit. Ein Dokument, das ersetzt wurde, darf nicht mehr zitiert werden, auch wenn es noch im Bestand liegt. Der Filter dafür steht vor dem Modell, nicht dahinter.
Das Eingeständnis. Findet die Suche nichts Passendes, sagt die Antwort das. Ein System, das in diesem Fall trotzdem formuliert, ist gefährlicher als gar keines. Es liefert genau dann eine Auskunft, wenn niemand sie prüfen kann.
Was das kostet und was es einspart
Die Kosten eines Retrieval-Laufs liegen in Bruchteilen eines Cents. Der Aufwand liegt woanders: in der Aufbereitung des Bestands, in der Zerlegung und in der Fragemenge, an der beides gemessen wird. Das ist Projektarbeit und keine Lizenz.
Eingespart wird Suchzeit. Wo heute jemand zwanzig Minuten durch ein Laufwerk klickt, weil er weiß, dass die Antwort irgendwo darin steht, sind es danach zwei. Das rechnet sich nicht bei drei Anfragen im Monat und sehr schnell bei dreißig am Tag, und welcher der beiden Fälle vorliegt, klären wir vor dem Angebot und nicht danach.
Wo es nicht passt
Retrieval ist kein Ersatz für ein Dokumentenmanagement. Wenn Ihr Bestand
aus zwölf Ordnern mit Dateinamen wie Angebot_final_v3_NEU.docx besteht und
niemand sagen kann, welche Fassung gilt, dann löst Retrieval das nicht. Es
zitiert dann eben zuverlässig aus der falschen Fassung.
In diesem Fall ist die erste Maßnahme keine KI, sondern Ordnung. Wir sagen das im Erstgespräch, wenn es so ist.
Typische Architektur
Wie so ein System aufgebaut ist
Die beiden Filter stehen zwischen Kandidaten und Belegen. Dort greifen sie bei jeder Anfrage und kosten wenig. Vor dem Vektorspeicher wären sie eine Kopie des Berechtigungsmodells, die niemand pflegt.
Aufbau eines Wissenszugriffs. Ein Dokument wird in Abschnitte zerlegt, jeder Abschnitt in einen Vektor überführt und in einer Datenbank abgelegt. Eine Frage wird ebenso überführt, die nächstgelegenen Abschnitte werden gesucht, und das Modell formuliert daraus eine Antwort, zusammen mit der Fundstelle, aus der sie stammt.
›Dieselbe Architektur als Textfassung
Bestand (SharePoint, Laufwerke, DMS, Wiki)
│
↓
[Aufbereitung] ─ Text, Struktur, Metadaten, Gültigkeit
│
↓
[Zerlegung] ─ Abschnitte mit Kontextkopf
│
↓
[Einbettung] ──→ Vektorspeicher
│
Frage ───────────────┤
│ ↓
│ Kandidaten (Top 40)
│ │
│ ↓
│ [Filter: Gültigkeit]
│ │
│ ↓
│ [Filter: Leserecht, je Anfrage]
│ │
│ ↓
│ [Reranking] ──→ Belege (Top 6)
│ │
└────────────────→↓
[Modell] ──→ Antwort + FundstellenEinmal je Dokument
Aufnahme eines Dokuments. Ein Bestandsdokument wird in Abschnitte zerlegt, jeder Abschnitt behält Herkunft und Seitenzahl, wird in einen Vektor überführt und in der Datenbank abgelegt. Das geschieht einmal je Dokument und ist kein Training: der Inhalt geht in eine Datenbank, nicht in ein Modell.
Das ist kein Training. Der Inhalt landet in einer Datenbank, die Sie leeren können, nicht in Gewichten, aus denen ihn niemand wieder herausbekommt.
Bei jeder Frage
Beantwortung einer Frage. Die Frage wird in denselben Vektorraum überführt, die nächstgelegenen Abschnitte werden gesucht, und nur diese Abschnitte gehen zusammen mit der Frage an das Modell. Die Antwort trägt die Fundstellen der benutzten Abschnitte. Findet die Suche nichts Passendes, sagt die Antwort das.
Das Modell sieht nie das ganze Archiv, sondern nur die Abschnitte, die die Rolle des Fragenden freigibt. Wer die Personalakte nicht sehen darf, bekommt auch keine Antwort daraus.
Vorgehen
Wie wir arbeiten
Schritt 1
Bestand sichten
Welche Formate, welche Qualität, welche Dubletten. Ein gescanntes Dokument aus den Neunzigern trifft schlechter als ein gepflegtes Wiki. Das sagt die Oberfläche später auch.
Schritt 2
Zerlegung festlegen
Der Schnitt in Abschnitte entscheidet über die Trefferquote mehr als die Wahl des Einbettungsmodells. Wir messen ihn an echten Fragen aus dem Fachbereich.
Schritt 3
Berechtigungen hinter das Retrieval legen
Geprüft wird bei jeder Anfrage gegen das Verzeichnis. Wer ein Dokument nicht öffnen darf, bekommt es auch nicht zitiert.
Schritt 4
Belege erzwingen
Jede Antwort nennt Dokument, Fassung und Stelle. Ohne Fundstelle keine Antwort.
Schritt 5
Messen und nachziehen
Eine Fragemenge aus dem Fachbereich, regelmäßig gefahren. Sie zeigt, ob eine Änderung am Bestand die Trefferquote hebt oder senkt.
Technologien
Was wir dafür einsetzen
- InsideAI
- Qdrant
- pgvector
- Apache Tika
- Azure AD / Keycloak
- Reranking-Modelle
Die Auswahl richtet sich nach Ihrer Umgebung. Produkt- und Anbieternamen sind Marken der jeweiligen Inhaber; ihre Nennung weist auf den Einsatz hin, nicht auf eine geschäftliche Verbindung.
Fragen
Was dazu meistens gefragt wird
Landen unsere Dokumente im Modell?
Nein. Der Inhalt geht in eine Vektordatenbank, nicht in Modellgewichte. Der Unterschied ist praktisch: eine Datenbank können Sie leeren, aus Gewichten bekommt den Inhalt niemand wieder heraus. Auch die Anbieter, über deren europäische Endpunkte wir zugreifen, trainieren mit den übermittelten Inhalten nicht.
Sieht dann jeder alles?
Nein. Die Rechte werden bei jeder einzelnen Anfrage gegen Ihr Verzeichnis geprüft, nicht beim Indexieren. Wer ein Dokument nicht öffnen darf, bekommt es auch nicht zitiert, und die Verweigerung steht als Zeile im Protokoll, nicht als Lücke.
Was passiert, wenn nichts Passendes im Bestand steht?
Dann sagt die Antwort das. Ein System, das in diesem Fall trotzdem formuliert, ist gefährlicher als gar keines: es liefert genau dann eine Auskunft, wenn niemand sie prüfen kann.
Wie gut trifft das Retrieval?
Das lässt sich nur an Ihrem Bestand sagen. Gemessen wird an einer Fragemenge aus dem Fachbereich: dreißig bis fünfzig echte Fragen, jede mit der Stelle, an der die Antwort steht. Diese Menge entsteht im Piloten und bleibt danach das Maß für jede Änderung.
Ersetzt das unsere Volltextsuche?
Nein, es steht daneben. Wer eine Belegnummer sucht, will einen exakten Treffer, und den liefert die Volltextsuche besser. Retrieval beantwortet Fragen, nicht Wortsuchen.
Was ist mit gescannten Altdokumenten?
Die werden per Texterkennung aufbereitet und treffen dann schlechter als ein gepflegtes Wiki. Das ist eine Tatsache über den Bestand und keine über das System, und die Oberfläche sagt es später auch, indem sie die Fundstelle nennt.
Passende Projekte
Wie das in einem Projekt aussieht
- RAG
Wissenszugriff über 30 Jahre Bestandsdokumente
Versicherer, 4.000 Mitarbeitende · Versicherung · 2026
Öffnen
Die anderen drei Leistungen
Kontakt
RAG & Wissenszugriff in Ihrem Haus
Schildern Sie Ihre Ausgangslage. Wir sagen Ihnen, welcher Zuschnitt dazu passt.