Evaluation vor dem Go-live: Testsets, Metriken, Abnahmekriterien
Von Jean Hinz Veröffentlicht 28.09.2026 Aktualisiert 28.09.2026 7 Min. Lesezeit
Kurz gesagt
Vor dem Go-live testen wir jede KI-Lösung mit echten Fällen aus Ihrem Alltag, meist 20 bis 50, bei Wissensassistenten 50 bis 100 Fragen. Gemessen werden Trefferquote, Anteil unveränderter Entwürfe und das Verhalten im Fehlerpfad. Die Grenzwerte vereinbaren wir vor dem Bau, das Ergebnis steht im Abnahmeprotokoll. Testphase und Protokoll sind in jedem Festpreis ab 990 € netto enthalten.
Inhalt
Eine KI-Lösung, die in der Vorführung überzeugt, kann im Alltag trotzdem scheitern. Der Unterschied zeigt sich erst mit echten Fällen. Deshalb endet bei uns jede Lösung mit einem Test gegen vorher vereinbarte Kriterien und einem Abnahmeprotokoll, und wir beschreiben hier, wie das konkret abläuft.
Warum reicht eine gute Vorführung nicht?
In einer Vorführung sieht man fünf ausgesuchte Beispiele. Im Alltag kommen die Anfrage mit drei Fragen in einer Mail, die Rechnung als schiefes Handyfoto und die Frage, auf die es in keinem Dokument eine Antwort gibt. Sprachmodelle antworten auf alle diese Fälle flüssig, auch auf die, bei denen sie falsch liegen. Ob eine Lösung trägt, sieht man deshalb nicht am besten Beispiel, sondern an der Verteilung über viele echte Fälle.
Evaluation, im Fachjargon kurz Evals, heißt: Man prüft die Ausgaben eines Modells systematisch gegen festgelegte Kriterien. OpenAI vergleicht das in seinem Leitfaden zu Evals mit verhaltensgetriebener Entwicklung in der Softwaretechnik: Erst wird festgelegt, wie sich das System verhalten soll, dann wird gebaut und getestet (Stand September 2026). Genau so gehen wir vor.
Woraus besteht ein gutes Testset?
Ein Testset ist eine Sammlung von Fällen, zu denen vorab feststeht, was das richtige Ergebnis ist. Bei den meisten Lösungen aus unserem Katalog sind das 20 bis 50 echte Fälle aus Ihrem Alltag. Die genaue Zahl steht auf jeder Lösungsseite, weil sie von der Aufgabe abhängt: Für die Sortierung eines Sammelpostfachs nehmen wir 100 bis 200 Mails, weil viele Kategorien vorkommen. Für einen internen Wissensassistenten sind es 50 bis 100 Fragen. Bei seltenen, großen Vorgängen wie Ausschreibungen reichen 5 bis 10 abgeschlossene Fälle, deren Ergebnis Sie kennen.
Echte Fälle sind dabei nicht verhandelbar. Das US-Normungsinstitut NIST fordert in seinem AI Risk Management Framework, dass Leistung und Qualitätskriterien eines KI-Systems unter Bedingungen gemessen werden, die dem späteren Einsatz ähneln, und dass die Grenzen der Übertragbarkeit dokumentiert werden (Abschnitt MEASURE 2.3 und 2.5, Fassung 1.0 vom Januar 2023). Selbst ausgedachte Testfälle sind fast immer zu sauber.
Ein brauchbares Testset mischt drei Arten von Fällen:
- Normalfälle in der Verteilung, wie sie tatsächlich vorkommen. Wenn 60 von 100 Anfragen Verfügbarkeitsfragen sind, sollen es im Testset auch etwa so viele sein.
- Grenzfälle, die Ihr Team als schwierig kennt: unvollständige Angaben, zwei Anliegen in einer Nachricht, ungewöhnliche Formate. Anthropic betont in seiner Dokumentation zu Erfolgskriterien und Tests, dass Tests die reale Verteilung der Aufgaben abbilden und Grenzfälle einschließen sollen (Stand September 2026).
- Fälle für den Fehlerpfad, bei denen die richtige Reaktion lautet: nicht antworten, sondern weiterleiten. Beschwerden, Fragen ohne Grundlage in den Dokumenten, Anfragen außerhalb Ihrer Regeln.
Personenbezogene Daten in den Testfällen behandeln wir wie im Betrieb: in Ihrer Umgebung und mit Auftragsverarbeitungsvertrag. Wie lange das Testset aufbewahrt wird, legen wir mit Ihnen fest.
Welche Metriken messen wir?
Wir messen wenige Werte, die Sie ohne Statistikkenntnisse lesen können. Welche davon zählen, hängt von der Lösung ab.
Trefferquote
Wie viele Fälle hat die Lösung richtig gelöst? Bei einer Klassifikation heißt das: richtige Kategorie. Bei einer Datenerfassung: alle Pflichtfelder korrekt, also Betrag, Datum, Kündigungsfrist. Bei einem Wissensassistenten: richtige Quelle gefunden und Antwort inhaltlich korrekt. Wir zählen je Kategorie getrennt, weil eine gute Gesamtquote eine schwache Kategorie verdecken kann.
Anteil unveränderter Entwürfe
Bei allen Lösungen, die Entwürfe schreiben, fragen wir: Wie viele Entwürfe würde Ihr Team so abschicken, wie viele mit kleinen Änderungen, wie viele müsste es neu schreiben? Diese Dreiteilung ist ehrlicher als eine Schulnote, weil sie direkt zeigt, wie viel Arbeit bleibt. Im Betrieb messen wir denselben Wert weiter, aus dem Vergleich von Entwurf und gesendeter Fassung.
Fehlerpfad
Was passiert, wenn die Lösung etwas nicht kann? Dieser Wert ist uns am wichtigsten. Jeder Fall aus der dritten Gruppe muss in der Prüfliste landen oder zu einer ehrlichen Antwort ohne Treffer führen. Eine selbstbewusste falsche Antwort in diesem Pfad ist ein Fehler, der mehr wiegt als ein verpasster Normalfall. Bei Assistenten mit Rechteprüfung gehört dazu der Test mit Konten aus mindestens drei Rollen: Keine Antwort darf aus einem Dokument stammen, das die fragende Person nicht öffnen darf.
Kosten und Laufzeit je Fall
Nebenbei messen wir, was ein Fall an Modellkosten verursacht und wie lange er dauert. Das macht die Schätzung im Angebot überprüfbar.
Wer bewertet die Ergebnisse?
Anthropic unterscheidet in seiner Dokumentation drei Arten der Bewertung: per Code, durch Menschen und durch ein zweites Sprachmodell (Stand September 2026). Bewertung per Code ist schnell und verlässlich, erfasst aber keine Feinheiten. Menschen bewerten am flexibelsten, aber langsam. Ein Modell als Prüfer skaliert gut, braucht aber klare Bewertungsregeln.
Wir kombinieren das so:
- Code, wo es eine eindeutige richtige Antwort gibt: Kategorie, Betrag, Datum, gefundene Quelle.
- Ihre Fachperson für die Qualität von Entwürfen. Sie markiert je Entwurf: senden, anpassen oder neu schreiben. Bei 20 bis 50 Fällen ist das in ein bis zwei Stunden machbar.
- Ein Modell als Vorsortierung bei großen Testsets, etwa 200 Mails, mit einer Stichprobe, die ein Mensch nachprüft.
Wie sehen Abnahmekriterien aus?
Die Kriterien legen wir im Klärungstermin fest, bevor wir bauen. Anthropic empfiehlt, Erfolgskriterien spezifisch, messbar, erreichbar und relevant zu formulieren, statt „gute Leistung“ zu verlangen. Ein Kriterium hat bei uns immer drei Teile: die Metrik, den Grenzwert und das Testset, auf dem gemessen wird.
Ein Beispiel für die Form, ausdrücklich keine Empfehlung für Ihren Fall: „Mindestens 40 der 50 Testanfragen erhalten einen Entwurf, den die Fachperson senden oder mit kleinen Änderungen senden würde. Alle Fälle aus dem Fehlerpfad landen in der Prüfliste.“ Den ersten Wert setzen Sie nach Ihrem Anspruch. Der zweite ist bei uns immer eine Ja-oder-Nein-Bedingung ohne Toleranz, ebenso die Rechteprüfung.
Werden Kriterien verfehlt, analysieren wir die Ursache, passen Anweisungen, Regeln oder Datenaufbereitung an und lassen das gesamte Testset erneut laufen, nicht nur die fehlgeschlagenen Fälle. Sonst verbessert man einen Fall und verschlechtert unbemerkt zwei andere.
Was steht im Abnahmeprotokoll?
Das Protokoll ist ein bis zwei Seiten lang und gehört zu jedem Festpreis. Es enthält:
- die Version der Lösung, das verwendete Modell und das Datum des Tests,
- Umfang und Zusammensetzung des Testsets, also wie viele Normal-, Grenz- und Fehlerpfadfälle,
- je Kriterium den vereinbarten Grenzwert und den gemessenen Wert,
- die Fälle, die gescheitert sind, mit kurzer Begründung,
- was nicht getestet wurde, etwa Sprachen, Dateiformate oder Mengen, die im Testset nicht vorkamen,
- die Freigabe durch Sie, mit Namen und Datum.
Der Punkt „nicht getestet“ ist der unbequemste und der wichtigste. Auch NIST verlangt, die Grenzen der Übertragbarkeit zu dokumentieren. Wenn das Testset nur deutsche Anfragen enthielt, steht im Protokoll, dass englische nicht geprüft sind.
Was passiert mit dem Testset nach dem Go-live?
Es bleibt im Einsatz. Sprachmodelle werden von den Anbietern aktualisiert und abgelöst, Ihre Dokumente ändern sich, Schnittstellen auch. OpenAI nennt Evals ausdrücklich als wesentlichen Baustein, gerade beim Wechsel auf neue Modelle (Stand September 2026). Im Betrieb lassen wir deshalb dasselbe Testset vor jedem Modellwechsel und nach größeren Anpassungen erneut laufen und vergleichen die Werte mit dem Abnahmeprotokoll. Neue Fehlerfälle aus dem Alltag nehmen wir ins Testset auf, damit derselbe Fehler nicht zweimal unbemerkt durchrutscht.
Dazu kommt die laufende Messung: Anteil unveränderter Entwürfe, Fälle in der Prüfliste, Fragen ohne Treffer. Sinkt ein Wert über Wochen, ist das ein früheres Warnsignal als die erste Beschwerde.
Wann ist so viel Test übertrieben?
Für ein persönliches Werkzeug, das eine Person zum Formulieren nutzt und jede Ausgabe ohnehin liest, braucht es kein Testprotokoll. Da reicht gesunder Menschenverstand, und wie man solche Werkzeuge gut einsetzt, zeigt unser Gründer in seinen Workshops auf jeanhinz.io. Sobald eine Lösung für ein Team läuft, Ausgaben an Kunden gehen oder Daten in Systeme geschrieben werden, lohnt sich der Aufwand. Er ist bei uns im Festpreis enthalten und kostet Sie vor allem ein bis zwei Stunden Ihrer Fachperson.
Wie Testsets bei Wissensassistenten aussehen, beschreiben wir im Artikel Ein Wissensassistent auf eigenen Dokumenten. Warum der Fehlerpfad so viel Gewicht hat, erklärt der Artikel Halluzinationen operativ beherrschen. Und woran Pilotprojekte ohne Testset typischerweise scheitern, steht unter Vom Pilot zur Produktion.
Quellen
- 1 Define success criteria and build evaluations , Anthropic, Claude Platform Docs, 28.09.2026
- 2 Working with evals , OpenAI API Docs, 28.09.2026
- 3 Artificial Intelligence Risk Management Framework (AI RMF 1.0), NIST AI 100-1 , National Institute of Standards and Technology, 26.01.2023
- 4 AI Risk Management Framework , National Institute of Standards and Technology, 28.09.2026
Prüfhinweis: Zum 31.12.2026 prüfen: Anthropic-Dokumentation zu Erfolgskriterien und Tests, OpenAI-Evals-Guide (URLs haben sich 2026 geändert), Revisionsstand des NIST AI RMF, Testumfänge auf den Lösungsseiten.