Architektur & Praxis

Ein Wissensassistent auf eigenen Dokumenten: Was RAG löst, was nicht, Referenzarchitektur mit EU-Hosting

Von Veröffentlicht 28.09.2026 Aktualisiert 28.09.2026 7 Min. Lesezeit

Kurz gesagt

RAG heißt: Der Assistent sucht zuerst passende Abschnitte in Ihren Dokumenten und formuliert die Antwort nur daraus, mit Quelle. Das löst die Suche in gewachsenen Ablagen, nicht aber veraltete Fassungen oder Auswertungen über alle Dokumente. Unsere Referenzarchitektur hält die Wissensbasis in Frankfurt und prüft Rechte vor jeder Suche. Festpreis ab 4.900 € netto.

Inhalt
  1. Was ist RAG, und welches Problem löst es?
  2. Was löst RAG nicht?
  3. Wie sieht unsere Referenzarchitektur aus?
  4. Wie bleiben Zugriffsrechte in der Antwort erhalten?
  5. Was bedeutet EU-Hosting konkret?
  6. Wie bleibt die Wissensbasis aktuell?
  7. Wann reicht ein fertiges Werkzeug?
  8. Wie prüfen wir, ob der Assistent gut genug ist?

Viele Unternehmen wünschen sich einen Assistenten, der Fragen aus den eigenen Handbüchern, Verträgen und Richtlinien beantwortet. Das Verfahren dahinter heißt RAG. Wir zeigen, was es leistet, wo es an Grenzen stößt und wie wir einen solchen Assistenten mit Hosting in der EU bauen und betreiben.

Was ist RAG, und welches Problem löst es?

RAG steht für Retrieval Augmented Generation, auf Deutsch etwa: Antworten mit vorgeschalteter Suche. Der Begriff stammt aus einem Forschungspapier von Lewis und anderen aus dem Jahr 2020. Das Prinzip: Ein Sprachmodell antwortet nicht aus dem, was es im Training gelernt hat. Es bekommt zu jeder Frage die passenden Textstellen aus Ihren Dokumenten mitgeliefert und formuliert die Antwort daraus.

Das löst ein alltägliches Problem. Die Kündigungsfrist im Rahmenvertrag mit dem Logistiker steht irgendwo in SharePoint, aber die Stichwortsuche findet sie nicht, weil im Vertrag „Beendigung des Vertragsverhältnisses“ steht und nicht „Kündigung“. Eine Suche nach Bedeutung, die Vektorsuche, findet die Stelle trotzdem. Dafür wird jeder Textabschnitt als Zahlenfolge gespeichert, die seine Bedeutung abbildet, ein sogenanntes Embedding. Abschnitte mit ähnlicher Bedeutung liegen in diesem Zahlenraum nah beieinander.

Der zweite Vorteil ist Nachvollziehbarkeit. Weil die Antwort aus konkreten Abschnitten entsteht, kann der Assistent sagen, woher sie kommt. Ein Modell ohne vorgeschaltete Suche kann das nicht.

Was löst RAG nicht?

Hier entstehen die meisten Enttäuschungen. Deshalb gehen wir diese Punkte in jedem Klärungstermin durch, bevor ein Angebot entsteht.

  • Veraltete Ablage. Liegen drei Fassungen derselben Reisekostenrichtlinie im System, findet die Suche womöglich die alte. RAG macht Ihre Ablage durchsuchbar, nicht richtig. Welche Fassung gilt, entscheiden Sie.
  • Auswertungen über alle Dokumente. „Welche Verträge laufen 2027 aus?“ ist keine Suchfrage, sondern eine Auswertung. Die Suche liefert eine Handvoll passender Abschnitte, nicht alle Verträge. Dafür braucht es strukturierte Daten, wie sie unsere Lösung Vertragsdaten und Fristen erfassen erzeugt.
  • Wissen, das nirgends steht. Was nur im Kopf der erfahrenen Kollegin liegt, findet kein Assistent. Die Liste der Fragen ohne Treffer zeigt Ihnen aber, welche Dokumente fehlen.
  • Fehlerfreiheit. RAG senkt das Risiko erfundener Antworten deutlich, schließt es aber nicht aus. Wie wir damit umgehen, beschreiben wir im Artikel Halluzinationen operativ beherrschen.

Wie sieht unsere Referenzarchitektur aus?

Die Architektur hat zwei Abläufe. Der erste läuft im Hintergrund und hält die Wissensbasis aktuell. Der zweite läuft bei jeder einzelnen Frage.

Referenzarchitektur eines Wissensassistenten mit RAGOben der Ablauf Einlesen: Dokumente aus SharePoint oder Google Drive werden aufbereitet und als Abschnitte mit Rechten und Stand in der Wissensbasis auf Supabase in Frankfurt gespeichert. Unten der Ablauf je Frage: Die Frage einer Person mit ihren Gruppen geht durch die Zugriffsprüfung, dann durch die Vektorsuche in der Wissensbasis, das Sprachmodell sieht nur die gefundenen Abschnitte und liefert eine Antwort mit Quellen.EINLESEN, LAUFEND IM HINTERGRUNDDokumenteSharePoint, DriveAufbereitungAbschnitte, RechteWissensbasispgvector, FrankfurtGeänderte und gelöschte Dokumentewerden laufend nachgezogennur erlaubte AbschnitteJE FRAGEFragePerson, GruppenZugriffsprüfungFilter vor der SucheVektorsuchebeste AbschnitteSprachmodellnur FundstellenAntwortmit Quelle, StandDas Modell sieht nur die gefundenen Abschnitte, nie die ganze Ablage.
Referenzarchitektur: Einlesen im Hintergrund, Rechteprüfung vor der Suche, Antwort nur aus Fundstellen mit Quelle.

Aufbereitung: Wo die Qualität entsteht

Wir lesen die freigegebenen Ordner nur lesend aus und zerlegen jedes Dokument in Abschnitte von einigen Absätzen. Zu jedem Abschnitt speichern wir Titel, Pfad, Änderungsdatum und die Gruppen, die das Original öffnen dürfen. Das klingt nach Kleinarbeit, entscheidet aber über die Trefferqualität. Ein Abschnitt wie „Die Frist beträgt drei Monate zum Quartalsende“ ist ohne Zusammenhang wertlos, weil nicht darin steht, welcher Vertrag gemeint ist.

Anthropic hat dazu im September 2024 das Verfahren Contextual Retrieval beschrieben: Jeder Abschnitt bekommt vor dem Speichern einen kurzen Satz zu seinem Zusammenhang, und die Bedeutungssuche wird um eine klassische Stichwortsuche ergänzt. In Anthropics eigenen Tests sank die Fehlerquote beim Abruf der 20 besten Abschnitte damit von 5,7 auf 2,9 Prozent, mit einer zusätzlichen Neusortierung der Treffer auf 1,9 Prozent. Das sind Messungen des Herstellers auf dessen Testdaten, keine Zusage für Ihre Ablage. Wie gut die Suche bei Ihnen trifft, messen wir im Test selbst.

Wissensbasis: Supabase mit pgvector in Frankfurt

Die Abschnitte liegen in Supabase, einer Datenbankplattform auf Basis von PostgreSQL. pgvector ist laut Supabase-Dokumentation eine Erweiterung für PostgreSQL, die Embeddings speichert und nach Ähnlichkeit durchsucht (Stand September 2026). Der Vorteil gegenüber einer separaten Vektordatenbank: Texte, Metadaten, Rechte und Vektoren liegen in einer Datenbank, die Ihre IT kennt, mit Backups und normalem SQL. Für Artikelnummern und exakte Fachbegriffe kombinieren wir die Bedeutungssuche mit einer Volltextsuche, weil eine reine Vektorsuche exakte Kennungen verfehlen kann.

Modell und Antwort

Das Sprachmodell bekommt die Frage und die gefundenen Abschnitte, nicht Ihre Ablage. Es ist angewiesen, nur daraus zu antworten, jede Aussage mit Quelle zu belegen und offen zu sagen, wenn nichts Passendes gefunden wurde. Die Antwort enthält Link und Dokumentstand, damit jeder das Original mit einem Klick prüfen kann.

Wie bleiben Zugriffsrechte in der Antwort erhalten?

Das ist die Frage, die IT-Verantwortliche zuerst stellen, und zu Recht. Ein Assistent, der einer Auszubildenden aus der Gehaltsliste antwortet, ist ein Datenschutzvorfall.

Wir lösen das in der Datenbank, nicht in der Anweisung an das Modell. Supabase beschreibt in der Anleitung RAG with Permissions, wie Row Level Security, also Zugriffsregeln auf Zeilenebene in PostgreSQL, jede Abfrage auf die Abschnitte beschränkt, die die angemeldete Person sehen darf. Laut Dokumentation gilt das auch für die Ähnlichkeitssuche (Stand September 2026). Der Filter greift also, bevor das Modell irgendetwas sieht. Was nicht gefunden wird, kann auch in keiner Antwort landen.

Zwei Details aus der Umsetzung:

  • Die Gruppen kommen aus der Quelle, also aus SharePoint oder Google Drive, und werden bei jedem Abgleich mit übernommen. Ändern Sie eine Berechtigung im Original, gilt sie nach dem nächsten Abgleich auch im Assistenten.
  • Bei gefilterten Suchen über einen Vektorindex können weniger Treffer zurückkommen als angefordert. Die pgvector-Dokumentation von Supabase beschreibt dafür iterative Index-Scans (Stand September 2026). Genau diesen Fall prüfen wir mit Testkonten aus mindestens drei Rollen, bevor wir abnehmen.

Was bedeutet EU-Hosting konkret?

„EU-Hosting“ wird oft zu grob verwendet. Wir trennen drei Fragen.

Wo liegt die Wissensbasis? Bei Supabase wählen wir ausdrücklich die Region Central EU in Frankfurt, technisch eu-central-1. Das ist wichtig, weil die allgemeine Region „Europe“ laut Supabase auch London und Zürich umfasst, die keine EU-Mitgliedstaaten sind (Stand September 2026). Das Projekt läuft in einem Konto auf Ihren Namen.

Was sagt die Region rechtlich? Weniger, als viele denken. Supabase schreibt selbst in seinem Leitfaden zur DSGVO, dass die Wahl der Region den Datenort steuert, eine Anwendung aber nicht allein dadurch DSGVO-konform macht. Backups, Logs, Exporte, Serverfunktionen und Unterauftragsverarbeiter gehören mit in die Betrachtung. Einen Auftragsverarbeitungsvertrag stellt Supabase bereit (Stand September 2026). Die rechtliche Bewertung trifft Ihr Datenschutz, wir liefern Datenflussbild und Unterlagen dafür.

Wo arbeitet das Sprachmodell? Das ist eine eigene Entscheidung, denn das Modell sieht die gefundenen Abschnitte. Wir bieten drei Stufen: als Standard ein Modellanbieter mit Auftragsverarbeitungsvertrag und ohne Training auf Ihren Daten, als Variante Azure OpenAI in einer EU-Region Ihres eigenen Azure-Kontos, und für Daten, die das Haus nicht verlassen dürfen, europäische Modelle wie Mistral in Ihrer Umgebung. Die Stufe legen wir im Angebot fest. Einen Vergleich der Einkaufswege finden Sie im Artikel Azure, Bedrock, Vertex oder Direktzugang, unsere Leistung dazu unter KI-Software und Assistenten.

Wie bleibt die Wissensbasis aktuell?

Ein Assistent, der nach einem halben Jahr aus alten Fassungen antwortet, verliert das Vertrauen seines Teams schneller, als er es gewonnen hat. Die Aktualisierung gehört deshalb von Anfang an zur Architektur:

  • Geänderte Dokumente werden neu eingelesen, ihre alten Abschnitte ersetzt.
  • Gelöschte oder verschobene Dokumente verschwinden aus der Wissensbasis. Wird das vergessen, zitiert der Assistent Dokumente, die es nicht mehr gibt.
  • Jede Antwort nennt den Stand des Dokuments. Wer eine Antwort aus einer Richtlinie von 2023 sieht, merkt es sofort.
  • Die Liste der Fragen ohne Treffer geht regelmäßig an die Verantwortlichen der Inhalte.

Im Betrieb überwachen wir diesen Abgleich und melden, wenn eine Quelle nicht mehr erreichbar ist. Für einen internen Wissensassistenten empfehlen wir Betrieb M für 490 € im Monat.

Wann reicht ein fertiges Werkzeug?

Nicht jedes Wissensproblem braucht eine eigene Architektur. Arbeiten wenige Personen mit einer überschaubaren Zahl von Dokumenten, reichen oft Projekte in Claude oder eigene GPTs in ChatGPT. Wie man die einrichtet, erklärt unser Gründer Jean Hinz auf jeanhinz.io/claude. Wer Microsoft 365 Copilot bereits lizenziert hat und nur Office-Dokumente befragt, sollte das zuerst ausprobieren und spart sich damit den Festpreis.

Eine eigene Wissensbasis lohnt sich, wenn mindestens einer dieser Punkte zutrifft: viele Dokumente in mehreren Quellen, unterschiedliche Berechtigungen im Team, feste Vorgaben zum Datenort oder die Anforderung, dass jede Antwort mit Quelle und Stand nachvollziehbar ist. Die Grenze hängt nicht an der Unternehmensgröße, sondern an Rechten und Nachvollziehbarkeit.

Wie prüfen wir, ob der Assistent gut genug ist?

Vor der Abnahme testen wir mit 50 bis 100 Fragen aus Ihrem Alltag, darunter bewusst schwierige und solche, auf die es in Ihren Dokumenten keine Antwort gibt. Wir messen, ob die richtige Quelle gefunden wurde, ob die Antwort stimmt, ob der Assistent ohne Treffer ehrlich bleibt und ob die Rechteprüfung hält. Wie ein solches Testset aufgebaut ist und welche Werte für die Abnahme gelten, beschreiben wir im Artikel Evaluation vor dem Go-live.

Quellen

  1. 1 Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks , Lewis u. a., arXiv, 22.05.2020
  2. 2 pgvector: Embeddings and vector similarity , Supabase Docs, 28.09.2026
  3. 3 RAG with Permissions , Supabase Docs, 28.09.2026
  4. 4 Available regions , Supabase Docs, 28.09.2026
  5. 5 GDPR compliance and Supabase , Supabase Docs, 28.09.2026
  6. 6 Introducing Contextual Retrieval , Anthropic, 19.09.2024

Prüfhinweis: Zum 31.12.2026 prüfen: Supabase-Dokumentation zu pgvector, Regionen, DSGVO-Leitfaden und RAG with Permissions, dazu Modellstände und Preise im Katalog.

Passende Lösungen aus dem Katalog

Wissen Klasse XL

Interner Wissensassistent

Ihr Team fragt in Teams, Slack oder im Browser und bekommt Antworten aus Ihren Dokumenten, mit Quelle und nur aus dem, was es sehen darf.

  • SharePoint oder Google Drive
  • Microsoft Teams oder Slack
Preis
ab 4.900 €
Lieferzeit
3 bis 5 Wochen

Personal Klasse L

Onboarding-Assistent für neue Mitarbeitende

Ein Assistent in Teams oder Slack beantwortet die Fragen neuer Mitarbeitender aus Ihrem Handbuch und Ihren Richtlinien, mit Quellenangabe und Checklisten für die ersten Wochen.

  • Microsoft Teams oder Slack
  • SharePoint, Google Drive oder Notion als Quelle
Preis
ab 2.490 €
Lieferzeit
10 bis 15 Werktage

Service Klasse L

Website-Assistent mit Wissensbasis

Ein Assistent auf Ihrer Website beantwortet Fragen zu Leistungen, Öffnungszeiten und Preisen aus freigegebenen Inhalten und übergibt an einen Menschen, wenn er an seine Grenze kommt.

  • Ihre Website
  • Wissensbasis aus Website und Dokumenten
Preis
ab 2.490 €
Lieferzeit
10 bis 15 Werktage

Nächster Schritt

Angebot innerhalb eines Werktags

Beschreiben Sie in zwei Sätzen, was automatisch laufen soll. Sie bekommen ein Festpreisangebot mit Lieferzeit, oder eine ehrliche Antwort, wenn ein Werkzeug von der Stange reicht.

Zwei, drei Sätze reichen. Welche Systeme Sie nutzen, hilft uns beim Angebot.

Antwort mit Angebot innerhalb eines Werktags. Netto, für Unternehmen.

Angebot anfordern