Halluzinationen operativ beherrschen: Grounding, Zitierpflicht, Freigabeschritt
Von Jean Hinz Veröffentlicht 28.09.2026 Aktualisiert 28.09.2026 6 Min. Lesezeit
Kurz gesagt
Halluzinationen lassen sich nicht abschalten, aber beherrschen. Wir bauen dafür Schutzschichten: Das Modell antwortet nur aus gefundenen Quellen, jede Aussage braucht einen Beleg, ohne Treffer sagt es das offen, und Entwürfe für Kunden gibt ein Mensch frei. Ein Testset prüft vor dem Go-live, ob die Schichten halten. Test und Abnahme sind in jedem Festpreis ab 990 € netto enthalten.
Inhalt
- Was ist eine Halluzination, und warum entsteht sie?
- Welche Fehler sind im Alltag gefährlich?
- Wie greifen die Schutzschichten ineinander?
- Was bedeutet Grounding in der Praxis?
- Warum bestehen wir auf einer Zitierpflicht?
- Was tut das System, wenn es nichts weiß?
- Wann braucht es einen Freigabeschritt, und wie wirkt er wirklich?
- Wie messen wir, ob die Schichten halten?
- Wann ist der Aufwand übertrieben?
Sprachmodelle erfinden manchmal Dinge, und sie tun es in demselben sicheren Ton, in dem sie richtige Antworten geben. Das lässt sich nicht wegkonfigurieren. Man kann aber ein System so bauen, dass eine erfundene Aussage mit hoher Wahrscheinlichkeit auffällt, bevor sie Schaden anrichtet. Wie wir das tun, beschreiben wir hier Schicht für Schicht.
Was ist eine Halluzination, und warum entsteht sie?
Das US-Normungsinstitut NIST nennt das Phänomen in seinem Profil für generative KI Konfabulation: selbstbewusst vorgetragene, aber falsche Inhalte, umgangssprachlich Halluzinationen. NIST beschreibt sie als natürliche Folge der Bauweise. Sprachmodelle sagen das wahrscheinlich nächste Wort voraus, und das ergibt oft, aber nicht immer, eine richtige Aussage (NIST AI 600-1, Juli 2024).
OpenAI hat im September 2025 eine weitere Ursache beschrieben: Übliche Trainings- und Bewertungsverfahren belohnen Raten stärker als das Eingeständnis von Unsicherheit. Ein Modell, das bei einer unbekannten Antwort rät, schneidet in vielen Tests besser ab als eines, das „weiß ich nicht“ sagt.
Für die Praxis folgt daraus ein klarer Auftrag. Das System um das Modell herum muss Unsicherheit ausdrücklich erlauben, Belege verlangen und riskante Ausgaben aufhalten. Ein Modell allein wird das nicht zuverlässig leisten, egal wie gut es ist.
Welche Fehler sind im Alltag gefährlich?
Nicht jede Halluzination ist gleich teuer. Wir unterscheiden vier Arten, weil jede eine andere Schutzschicht braucht:
- Erfundene Fakten: ein Preis, eine Frist, eine Öffnungszeit, die nirgends steht.
- Falsch zugeordnete Quelle: Die Aussage stimmt, die angegebene Quelle belegt sie aber nicht, oder umgekehrt.
- Veraltete Grundlage: Das Modell zitiert korrekt, aber aus einer überholten Fassung. Streng genommen keine Halluzination, im Ergebnis aber genauso falsch.
- Stille Auslassung: Die Antwort lässt die entscheidende Einschränkung weg, etwa „gilt nur für Neukunden“.
Wie gefährlich ein Fehler ist, hängt davon ab, wohin die Ausgabe geht. Ein falscher Hinweis in einem internen Entwurf kostet eine Minute Korrektur. Ein falscher Preis in einer Mail an einen Kunden kostet Geld oder Vertrauen.
Wie greifen die Schutzschichten ineinander?
Keine einzelne Maßnahme reicht. Wir legen deshalb mehrere Schichten hintereinander, und jede hat einen eigenen Ausgang für Fälle, die sie nicht sicher bestehen: die Prüfliste, in der ein Mensch den Fall übernimmt.
Was bedeutet Grounding in der Praxis?
Grounding heißt: Das Modell stützt seine Antwort auf Material, das wir ihm mitgeben, statt auf sein Trainingswissen. Bei einem Wissensassistenten sind das die gefundenen Abschnitte aus Ihren Dokumenten, das Verfahren dahinter heißt RAG, also Antworten mit vorgeschalteter Suche. Wie das technisch aufgebaut ist, beschreibt der Artikel Ein Wissensassistent auf eigenen Dokumenten.
Anthropic empfiehlt in seiner Dokumentation zur Reduktion von Halluzinationen ausdrücklich, das Modell auf die bereitgestellten Dokumente zu beschränken und ihm zu erlauben, „ich weiß es nicht“ zu sagen (Stand September 2026). Beides steht bei uns in jeder Anweisung.
Die wichtigste Regel aus unserer Umsetzung geht noch weiter: Zahlen kommen aus Systemen, nicht aus dem Modell. Verfügbarkeit und Preis einer Ferienwohnung liest die Lösung aus dem Buchungssystem, Beträge aus der Rechnung, Fristen aus dem Vertrag. Das Modell formuliert den Text drumherum. So kann es keinen Preis erfinden, weil es keinen Preis bestimmen muss.
Warum bestehen wir auf einer Zitierpflicht?
Eine Quelle zu jeder Aussage macht die Antwort prüfbar, für Ihr Team und für uns. Anthropic empfiehlt, das Modell für jede Aussage ein wörtliches Zitat als Beleg nennen zu lassen und Aussagen ohne passendes Zitat zu streichen.
Technisch nutzen wir dafür, wo das Modell es unterstützt, eine eingebaute Zitierfunktion statt einer bloßen Anweisung. Bei Claude heißt sie Citations: Die Schnittstelle liefert zu jeder Aussage die exakte Textstelle aus den mitgegebenen Dokumenten. Laut Anthropic enthalten diese Zitate garantiert gültige Verweise auf die bereitgestellten Dokumente, und in Anthropics eigenen Tests wählt die Funktion deutlich häufiger die relevantesten Stellen als Zitate, die nur per Anweisung erbeten werden (Stand September 2026).
Ein gültiger Verweis heißt aber nicht, dass die Aussage durch die Stelle gedeckt ist. Deshalb prüfen wir zusätzlich: Antworten ohne Beleg werden nicht angezeigt, sondern gehen in die Prüfliste. Im Testset gibt es Fälle, bei denen wir kontrollieren, ob die zitierte Stelle die Aussage wirklich trägt.
Was tut das System, wenn es nichts weiß?
Die Enthaltung ist die unterschätzte Schicht. Findet die Suche keine ausreichend passende Stelle, soll der Assistent das sagen und die zuständige Stelle nennen, statt eine plausible Antwort zusammenzusetzen. Bei Entwurfs-Lösungen bekommen unklare Anfragen gar keinen Entwurf, sondern landen in der Prüfliste.
Das klingt nach weniger Leistung, ist aber der Kern der Sache. Wer die OpenAI-Analyse ernst nimmt, dass Modelle zum Raten neigen, muss dem System einen ehrlichen Ausweg bauen. Die Liste der Fragen ohne Treffer ist zudem ein Nebenprodukt mit Wert: Sie zeigt, welche Dokumente in Ihrer Wissensbasis fehlen.
Wann braucht es einen Freigabeschritt, und wie wirkt er wirklich?
Der Freigabeschritt, in Architektur-Beschreibungen oft Human-in-the-Loop genannt, heißt: Ein Mensch entscheidet, bevor etwas nach außen geht. Bei allen Lösungen, die Entwürfe für Kunden, Gäste oder Bewerbende schreiben, ist er bei uns Standard: Die Lösung schreibt den Entwurf, Sie senden mit einem Klick. Ein Assistent, der live auf Ihrer Website antwortet, hat naturgemäß keinen Freigabeschritt. Dort tragen Grounding, Zitierpflicht und Enthaltung die Last, und bei Unsicherheit übergibt er an einen Menschen.
Ein Freigabeschritt schützt allerdings nur, wenn der Mensch wirklich prüft. NIST beschreibt im selben Profil die Gefahr des Automatisierungsbias: Mit der Zeit verlassen sich Menschen zu stark auf das System und halten seine Ausgaben für besser, als sie sind. Das kann das Risiko von Konfabulationen noch verstärken. Wir gestalten die Freigabe deshalb so, dass Prüfen leicht fällt:
- Quellen und übernommene Zahlen stehen direkt neben dem Entwurf, nicht in einem anderen Fenster.
- Abweichungen vom Üblichen sind markiert, etwa ein ungewöhnlicher Zeitraum oder eine Zusage, die nicht in Ihren Regeln steht.
- Der Anteil unveränderter Entwürfe wird gemessen. Steigt er über Wochen auf fast alle, schauen wir mit Ihnen nach, ob wirklich gelesen wird.
Nach einigen Wochen können einzelne, eng umrissene Standardfälle ohne Freigabe laufen, wenn die Zahlen das tragen. Das entscheiden Sie, schriftlich und je Fallart, nicht wir.
Wie messen wir, ob die Schichten halten?
Mit demselben Testset, das wir vor dem Go-live nutzen. Es enthält bewusst Fragen ohne Antwort in den Dokumenten, Anfragen außerhalb Ihrer Regeln und Fälle mit veralteten Fassungen. Eine selbstbewusste falsche Antwort in diesen Fällen verhindert die Abnahme. Wie Testset, Metriken und Abnahmeprotokoll aufgebaut sind, steht im Artikel Evaluation vor dem Go-live.
Anthropic schreibt selbst, dass die beschriebenen Techniken Halluzinationen deutlich reduzieren, aber nicht vollständig beseitigen, und dass kritische Informationen immer geprüft werden sollten. Im Betrieb ziehen wir deshalb regelmäßig Stichproben, werten die Prüfliste aus und lassen das Testset vor jedem Modellwechsel erneut laufen.
Wann ist der Aufwand übertrieben?
Nicht jede Nutzung braucht alle Schichten. Wer mit einem KI-Werkzeug einen Beitrag vorformuliert und ihn ohnehin selbst überarbeitet, ist sein eigener Freigabeschritt. Dafür genügt ein geschultes Auge, und wie Teams das lernen, zeigt unser Gründer in seinen KI-Workshops auf jeanhinz.io.
Die volle Architektur lohnt sich dort, wo Ausgaben Kunden erreichen, Daten in Systeme geschrieben werden oder viele Menschen sich auf die Antworten verlassen. Genau diese Fälle bauen wir, als Katalog-Lösung oder über unsere Leistung KI-Software und Assistenten.
Quellen
- 1 Reduce hallucinations , Anthropic, Claude Platform Docs, 28.09.2026
- 2 Citations , Anthropic, Claude Platform Docs, 28.09.2026
- 3 Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST AI 600-1 , National Institute of Standards and Technology, 26.07.2024
- 4 Why language models hallucinate , OpenAI, 05.09.2025
Prüfhinweis: Zum 31.12.2026 prüfen: Anthropic-Dokumentation zu Reduce hallucinations und Citations (Funktionsumfang, unterstützte Modelle), Forschungsstand zu Halluzinationen, Revision des NIST AI RMF.