KI-Agenten

Von Pilot zu Produktion: Die 7 Dinge, die im Pilot fehlen und im Betrieb scheitern

Von Veröffentlicht 28.09.2026 Aktualisiert 28.09.2026 7 Min. Lesezeit

Kurz gesagt

Ein KI-Pilot zeigt, dass eine Aufgabe lösbar ist. Im Betrieb scheitert er meist an sieben fehlenden Dingen: Monitoring, Zuständigkeit, Testset, Kostenlimit, saubere Zugriffe, Fehlerpfad und Dokumentation. Wir bauen diese Punkte bei jedem Agenten von Anfang an mit, als Katalog-Lösung ab 4.900 € netto und im Betrieb L für 790 € im Monat.

Inhalt
  1. Wie oft scheitern KI-Piloten wirklich?
  2. Was unterscheidet einen Pilot von einem Betrieb?
  3. Wer merkt es, wenn der Agent nicht mehr läuft?
  4. Woran messen Sie, ob der Agent gut genug ist?
  5. Was darf ein Vorgang kosten?
  6. Mit welchen Rechten arbeitet der Agent?
  7. Was passiert, wenn etwas schiefgeht?
  8. Was muss am Ende aufgeschrieben sein?

Viele KI-Vorhaben enden nach einer gelungenen Vorführung. Der Pilot hat gezeigt, dass das Modell die Aufgabe lösen kann, aber niemand hat geklärt, wer ihn überwacht, was er kosten darf und was bei einem Fehler passiert. Diese sieben Punkte entscheiden aus unserer Erfahrung, ob aus einem Pilot ein Betrieb wird.

Wie oft scheitern KI-Piloten wirklich?

Belastbare Messungen dazu sind selten. Viele Prozentzahlen, die in Vorträgen und Beiträgen kursieren, lassen sich nicht auf eine Primärquelle mit Methode und Datum zurückführen. Wir nennen deshalb nur zwei Prognosen, beide direkt vom Herausgeber.

Gartner hat am 29.07.2024 prognostiziert, dass mindestens 30 Prozent der Projekte mit generativer KI bis Ende 2025 nach dem Proof of Concept aufgegeben werden. Als Gründe nennt Gartner schlechte Datenqualität, unzureichende Risikokontrollen, steigende Kosten und unklaren Nutzen. Am 25.06.2025 folgte die Prognose, dass über 40 Prozent der Agenten-Projekte bis Ende 2027 eingestellt werden, wegen steigender Kosten, unklarem Nutzen oder unzureichender Risikokontrollen.

Beides sind Prognosen, keine Messungen. Aber die Gründe decken sich mit dem, was wir sehen: Selten scheitert es am Modell. Es scheitert am Drumherum, das im Pilot niemand braucht und im Betrieb jeden Tag.

Was unterscheidet einen Pilot von einem Betrieb?

Ein Pilot beantwortet die Frage, ob etwas geht. Der Betrieb beantwortet die Frage, ob es jeden Tag geht, auch wenn die Person im Urlaub ist, die es gebaut hat. Das Diagramm zeigt die sieben Bausteine nebeneinander.

Pilot und Betrieb im Vergleich: sieben Bausteine Für sieben Bausteine zeigt das Diagramm, wie sie im Pilot typischerweise aussehen und was im Betrieb nötig ist: Monitoring, Zuständigkeit, Testset, Kostenlimit, Zugriffe, Fehlerpfad und Dokumentation. Baustein Im Pilot Im Betrieb Monitoring Jemand schaut ab und zu rein Alarm bei Fehlern, Abbrüchen und Stillstand Zuständigkeit Das Projektteam Benannte Person, Vertretung, Reaktionszeit Testset Ein paar gute Beispiele 30 bis 50 echte Fälle, bei jeder Änderung Kostenlimit Keins, es ist ja ein Test Limit je Vorgang, Budget je Monat Zugriffe Persönlicher Schlüssel Dienstkonto je System, minimale Rechte Fehlerpfad Neustart von Hand Abbruch, Meldung, Übergabe an einen Menschen Dokumentation Im Kopf der Entwickler Runbook, Rechtekonzept, Protokoll
Sieben Bausteine, die im Pilot oft fehlen und die wir bei jedem Agenten vor dem Go-live einrichten.

Anthropic weist im Leitfaden Building effective agents darauf hin, dass die Eigenständigkeit von Agenten höhere Kosten und sich aufschaukelnde Fehler mit sich bringen kann, und empfiehlt ausgiebige Tests in abgeschotteten Umgebungen mit passenden Schutzmechanismen. Genau darum geht es in den folgenden Abschnitten.

Wer merkt es, wenn der Agent nicht mehr läuft?

1. Monitoring

Im Pilot schaut jemand ab und zu in die Ergebnisse. Im Betrieb braucht es eine Überwachung, die sich meldet, bevor ein Kunde es tut. Wir alarmieren bei drei Ereignissen: bei technischen Fehlern, etwa wenn eine Schnittstelle nicht antwortet, bei auffällig vielen Abbrüchen und bei Stillstand, also wenn keine Vorgänge laufen, obwohl welche eingehen. Den dritten Fall übersehen einfache Fehlermeldungen, weil ein stiller Agent keinen Fehler wirft.

Dazu kommen wenige Kennzahlen, die wir monatlich berichten: Zahl der Vorgänge, Anteil der Abbrüche mit Grund, Anteil der Entwürfe, die ohne Änderung freigegeben werden, und Kosten je Vorgang. Das OWASP-Projekt nennt Protokollierung und Überwachung ausdrücklich als Maßnahme, um Schäden durch zu viel Handlungsspielraum eines Sprachmodells zu begrenzen (Stand 05.05.2025).

2. Zuständigkeit

Im Pilot ist das Projektteam zuständig. Nach dem Go-live löst es sich auf. Im Betrieb braucht jeder Agent zwei benannte Rollen mit Vertretung: eine fachliche Verantwortliche, die über Regeln entscheidet und Stichproben prüft, und eine technische Zuständigkeit für Fehler, Updates und Anpassungen. Die technische Rolle übernehmen wir im Betrieb, mit definierter Reaktionszeit. Die fachliche Rolle bleibt bei Ihnen, denn nur Sie wissen, ob eine Kulanzregel noch gilt.

Woran messen Sie, ob der Agent gut genug ist?

3. Testset

Im Pilot überzeugen ein paar gut ausgewählte Beispiele. Im Betrieb brauchen Sie ein festes Testset: echte Vorgänge aus Ihrem Alltag mit dem erwarteten Ergebnis, darunter auch die unangenehmen Fälle. Anthropic empfiehlt in der Dokumentation zu Evaluationen (Stand September 2026), Tests an der realen Verteilung der Aufgaben auszurichten, Grenzfälle einzubeziehen, die Bewertung wo möglich zu automatisieren und lieber mehr Fälle mit automatischer Bewertung zu nutzen als wenige, von Hand bewertete.

Wir arbeiten mit 30 bis 50 echten Vorgängen je Agent. Das Testset läuft vor der Abnahme und danach bei jeder Änderung erneut: wenn wir die Arbeitsanweisung anpassen, wenn eine Schnittstelle sich ändert und wenn wir auf eine neue Modellversion wechseln. Modelle werden weiterentwickelt und ältere Versionen irgendwann abgeschaltet. Ohne Testset ist jeder Wechsel ein Blindflug. Wie man Abnahmekriterien festlegt, vertieft der Artikel Evaluation vor dem Go-live.

Was darf ein Vorgang kosten?

4. Kostenlimit

Im Pilot läuft alles über ein Testkonto, und niemand rechnet nach. Im Betrieb kann ein Agent, der in eine Schleife gerät, in einer Nacht mehr verbrauchen als sonst in einem Monat. Steigende Kosten stehen nicht zufällig in beiden Gartner-Prognosen.

Wir setzen Grenzen auf zwei Ebenen. Je Vorgang gibt es eine Höchstzahl an Schritten und ein Kostenlimit. Wird eine Grenze erreicht, bricht der Agent ab und übergibt den Vorgang mit Grund an einen Menschen. Je Monat gibt es ein Budget mit Warnung, bevor es ausgeschöpft ist. Zusätzlich lässt sich beim Modellanbieter ein Ausgabenlimit setzen. Bei Anthropic legt eine Organisation laut Dokumentation (Stand September 2026) ein eigenes monatliches Limit unterhalb der Obergrenze ihrer Nutzungsstufe fest. Ist es erreicht, lehnt die Schnittstelle weitere Anfragen ab. Das ist eine Notbremse, kein Kostenmanagement: Greift sie, steht der Agent. Deshalb gehört sie zusammen mit dem Fehlerpfad geplant. Mit welchen Beträgen Sie rechnen sollten, zeigt der Artikel Was ein KI-Agent kostet.

Mit welchen Rechten arbeitet der Agent?

5. Zugriffe

Im Pilot arbeitet der Agent oft mit dem persönlichen Schlüssel eines Entwicklers oder einem Zugang mit Administratorrechten. Im Betrieb ist das nicht haltbar. OWASP führt übermäßige Handlungsfreiheit als eigenes Risiko für Anwendungen mit Sprachmodellen und nennt drei Ursachen: zu viele Funktionen, zu weitreichende Rechte und zu viel Eigenständigkeit bei folgenreichen Aktionen. Als Gegenmaßnahmen empfiehlt OWASP unter anderem, Funktionen und Rechte auf das Nötige zu beschränken und folgenreiche Aktionen von einem Menschen freigeben zu lassen.

So bauen wir es: ein eigenes Dienstkonto je System, auf Ihren Namen, mit den kleinsten nötigen Rechten. Zugangsdaten liegen verschlüsselt in Ihrer Umgebung. Lesen darf der Agent ohne Rückfrage, jeder schreibende Schritt wartet auf einen Freigabeschritt. Welche risikoarmen Schritte später ohne Freigabe laufen dürfen, entscheiden Sie nach der Testphase, schriftlich und einzeln.

Was passiert, wenn etwas schiefgeht?

6. Fehlerpfad

Im Pilot wird ein Fehler bemerkt und von Hand neu gestartet. Im Betrieb muss vorher feststehen, was bei jeder Fehlerart passiert. Antwortet eine Schnittstelle nicht, versucht der Agent es mit Pause erneut, aber nur begrenzt oft. Ist das Modell unsicher oder fehlen Angaben, gibt er den Vorgang mit einer Rückfrage ab, statt zu raten. Ist ein Limit erreicht, bricht er ab und meldet sich. Und bricht ein Vorgang mitten im Ablauf ab, darf kein halber Zustand zurückbleiben, etwa eine angelegte Gutschrift ohne Antwort an den Kunden.

Jeder abgebrochene Vorgang landet mit Grund in einer Liste, die ein Mensch abarbeitet. Diese Liste ist kein Zeichen von Schwäche. Sie ist der Grund, warum man einem Agenten überhaupt Arbeit überlassen kann.

Was muss am Ende aufgeschrieben sein?

7. Dokumentation

Im Pilot steckt das Wissen im Kopf der Person, die ihn gebaut hat. Im Betrieb brauchen Sie vier Dokumente: die Arbeitsanweisung des Agenten mit Versionsstand, das Rechtekonzept für Ihre IT, ein Runbook, das beschreibt, was bei welchem Alarm zu tun ist, und das Protokoll jeder Aktion mit Zeitpunkt, System, Eingabe, Ergebnis und freigebender Person. Dazu kommt das Abnahmeprotokoll mit den Ergebnissen des Testsets.

Diese Unterlagen helfen auch bei der KI-Verordnung. Art. 4 zur KI-Kompetenz gilt seit 02.02.2025, in der Fassung der Verordnung (EU) 2026/1744 verlangt er Maßnahmen zur Förderung der KI-Kompetenz, kein bestimmtes Kompetenzniveau. Wer dokumentiert hat, welches System was tut, kann Schulungen und Zuständigkeiten sauber zuordnen. Das KI-Register und die Einordnung je System übernimmt unser Angebot zur KI-Governance.

Nicht jedes Vorhaben braucht alle sieben Punkte in voller Tiefe. Wenn eine Person ein KI-Werkzeug für die eigene Arbeit nutzt, reicht eine gute Einweisung, etwa über einen KI-Workshop bei unserem Gründer. Sobald aber ein System in Ihren Systemen handelt und andere sich auf das Ergebnis verlassen, gehören alle sieben dazu. Was einen Agenten von einem Workflow unterscheidet, erklärt der Artikel Was ein KI-Agent wirklich ist. Wie wir Agenten bauen und übergeben, zeigt die Leistung KI-Agenten.

Quellen

  1. 1 Gartner Predicts 30% of Generative AI Projects Will Be Abandoned After Proof of Concept By End of 2025 , Gartner, 29.07.2024
  2. 2 Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027 , Gartner, 25.06.2025
  3. 3 LLM06:2025 Excessive Agency , OWASP Gen AI Security Project, 05.05.2025
  4. 4 Define success criteria and build evaluations , Anthropic, 28.09.2026
  5. 5 Rate limits (Spend limits) , Anthropic, 28.09.2026
  6. 6 Building effective agents , Anthropic, 19.12.2024

Prüfhinweis: Zum 31.12.2026 prüfen: neue Gartner-Veröffentlichungen zu abgebrochenen KI-Projekten (nur Primärquelle mit Datum), OWASP Top 10 für LLM-Anwendungen auf neue Fassung, Anthropic-Dokumentation zu Evaluation und Ausgabenlimits, Betriebstarife gegen src/data/pricing.ts.

Passende Lösungen aus dem Katalog

Wissen Klasse XL

KI-Agent mit Systemzugriff

Ein Agent erledigt eine wiederkehrende Aufgabe über mehrere Systeme, mit Freigabe vor jedem schreibenden Schritt und Protokoll.

  • je nach Fall
  • Microsoft 365 oder Google Workspace
Preis
ab 4.900 €
Lieferzeit
3 bis 5 Wochen

Einkauf Klasse XL

Ausschreibungen und LV auswerten

Die Lösung liest Ausschreibungen als PDF oder GAEB-Datei, gleicht jede Position mit Ihrem Produktkatalog ab und liefert Lückenreport und Kalkulationsvorlage.

  • Outlook oder Gmail
  • PDF und GAEB-Dateien
Preis
ab 4.900 €
Lieferzeit
3 bis 5 Wochen

Wissen Klasse XL

Interner Wissensassistent

Ihr Team fragt in Teams, Slack oder im Browser und bekommt Antworten aus Ihren Dokumenten, mit Quelle und nur aus dem, was es sehen darf.

  • SharePoint oder Google Drive
  • Microsoft Teams oder Slack
Preis
ab 4.900 €
Lieferzeit
3 bis 5 Wochen

Nächster Schritt

Angebot innerhalb eines Werktags

Beschreiben Sie in zwei Sätzen, was automatisch laufen soll. Sie bekommen ein Festpreisangebot mit Lieferzeit, oder eine ehrliche Antwort, wenn ein Werkzeug von der Stange reicht.

Zwei, drei Sätze reichen. Welche Systeme Sie nutzen, hilft uns beim Angebot.

Antwort mit Angebot innerhalb eines Werktags. Netto, für Unternehmen.

Angebot anfordern