Was ein KI-Agent kostet: einmalig, Betrieb, Token
Von Jean Hinz Veröffentlicht 28.09.2026 Aktualisiert 28.09.2026 8 Min. Lesezeit
Kurz gesagt
Ein KI-Agent kostet in drei Blöcken: einmalig den Bau, bei uns ab 4.900 € netto, monatlich den Betrieb, empfohlen Betrieb L für 790 €, und nutzungsabhängig die Tokens. Bei 840 Vorgängen im Monat liegen die Tokens im Beispiel je nach Modell zwischen rund 5 und 192 €. Der größte laufende Posten ist meist der Betrieb.
Inhalt
Die Frage nach den Kosten eines KI-Agenten hat drei Antworten, weil drei Rechnungen entstehen: eine für den Bau, eine für den Betrieb und eine für die Nutzung des Sprachmodells. Wir zeigen alle drei mit unseren Katalogpreisen und rechnen die Nutzung mit den Preisen der Modellanbieter nach, Stand 28.09.2026. Einen Überblick über Tagessätze und Projektpreise im Markt finden Sie auf der Marktseite zu KI-Agentur-Kosten bei unserem Gründer.
Aus welchen Blöcken setzen sich die Kosten zusammen?
Der erste Block fällt einmal an: Klärung, Bau, Anbindung, Test und Abnahme. Der zweite fällt jeden Monat an, unabhängig davon, wie viel der Agent arbeitet: Überwachung, Fehlerbehebung, Updates, dazu Hosting und Lizenzen Dritter. Der dritte wächst mit jedem Vorgang: die Tokens, also die Text-Einheiten, nach denen Modellanbieter Eingabe und Ausgabe abrechnen.
Anthropic weist in seinem Leitfaden Building effective agents darauf hin, dass agentische Systeme oft Geschwindigkeit und Kosten gegen bessere Ergebnisse tauschen. Ein Agent ruft das Modell je Vorgang mehrfach auf. Deshalb lohnt es sich, den dritten Block vor dem Bau durchzurechnen und nicht erst mit der ersten Rechnung.
Was kostet der Bau eines Agenten einmalig?
Ein erster Agent für eine klar umrissene Aufgabe mit bis zu zwei angebundenen Systemen ist bei uns die Katalog-Lösung Klasse XL, der KI-Agent mit Systemzugriff, ab 4.900 € netto. Die Lieferung dauert 15 bis 25 Werktage. Jedes weitere System kostet 390 €, soll der Agent zusätzlich auf Englisch arbeiten, kommen 290 € dazu.
Im Festpreis enthalten sind Klärungstermin, Einrichtung in Ihrer Umgebung mit Konten auf Ihren Namen, Testphase mit Ihren echten Daten, Abnahmeprotokoll, Kurzanleitung, Übergabetermin, Runbook für den Betrieb und 30 Tage Fehlerbehebung nach Abnahme. Nicht enthalten sind Lizenzen Dritter und die Nutzungskosten der Modelle. Diese laufen über Ihr Konto, und wir schätzen sie im Angebot anhand Ihrer Vorgangsmenge.
Wenn mehr gebraucht wird, gelten feste Stufen. Der Umsetzungs-Sprint für 9.900 € bringt in vier Wochen einen Agenten mit Discovery produktiv, ein Monat Betrieb ist enthalten. Sind mehr als drei Systeme oder Systeme ohne Schnittstelle beteiligt, klären wir Anforderungen und Architektur in einer Discovery für 2.900 €, danach gilt für die Individualentwicklung ein Festpreis ab 25.000 €.
Rechnen Sie auch Ihre eigene Zeit ein: ein bis zwei Termine zur Klärung, eine Person aus der IT für Dienstkonten und Rechte, jemand aus dem Fachbereich, der Testfälle liefert und die Abnahme macht. Das ist kein großer Block, aber ohne ihn wird kein Agent fertig.
Was kostet der laufende Betrieb?
Für einen Agenten empfehlen wir Betrieb L für 790 € im Monat. Enthalten sind Überwachung mit Alarmierung, Fehlerbehebung, Updates bei Änderungen an Schnittstellen und Modellen, Sicherheitsupdates, eine Support-Adresse mit Ticket, 4 Stunden Reaktionszeit an Werktagen, 4 Stunden Anpassungen im Monat sowie Monatsreport und Quartalsreview. Die Mindestlaufzeit beträgt 3 Monate. Laufen zwei Agenten, passt Betrieb XL für 1.290 € im Monat. Arbeit über die Anpassungsstunden hinaus rechnen wir nach schriftlicher Freigabe mit 150 € je Stunde ab.
Warum L und nicht der kleinste Tarif? Agenten brauchen mehr Pflege als einfache Automatisierungen: Modelle werden aktualisiert, Arbeitsanweisungen nachgeschärft, abgebrochene Vorgänge ausgewertet. Was im Betrieb alles dazugehört, beschreibt der Artikel Von Pilot zu Produktion.
Wenn Ihre IT den Betrieb selbst übernehmen will, entfällt der Tarif. Dafür bekommen Sie Code, Rechtekonzept und Runbook. Planen Sie dann intern Zeit für Überwachung, Updates und Anpassungen ein. Hosting, Datenbank für das Protokoll und Lizenzen Dritter laufen in beiden Fällen über Ihre Konten. Diese Beträge hängen vom Anbieter ab, wir nennen sie im Angebot.
Wie berechnen sich die Token-Kosten?
Die Formel ist einfach: Vorgänge im Monat mal Eingabe-Tokens je Vorgang mal Eingabepreis, plus Vorgänge mal Ausgabe-Tokens je Vorgang mal Ausgabepreis. Die Preise gelten je eine Million Tokens und sind in US-Dollar angegeben. Stand 28.09.2026 laut den Preisseiten von Anthropic und OpenAI:
| Modell | Eingabe je 1 Mio. Tokens | Ausgabe je 1 Mio. Tokens |
|---|---|---|
| Claude Haiku 4.5 | 1 $ | 5 $ |
| Claude Sonnet 5 | 2 $ | 10 $ |
| Claude Opus 5.5 | 4 $ | 20 $ |
| GPT-6 Sol | 2 $ | 10 $ |
| GPT-6 Luna | 0,10 $ | 0,50 $ |
Preise ändern sich. Anthropic führt auf seiner Preisseite zum Beispiel aus, dass der Einführungspreis von Claude Sonnet 5 zum Standardpreis geworden ist und eine für den 01.09.2026 angekündigte Erhöhung auf 3 $ und 15 $ nicht stattfindet. Deshalb prüfen wir die Preise quartalsweise und rechnen im Angebot mit dem aktuellen Stand.
Bei einem Agenten ist die Eingabe fast immer der größere Posten. Jeder Modellaufruf schickt die Arbeitsanweisung, die Beschreibung der Werkzeuge und den bisherigen Verlauf des Vorgangs erneut mit. Bei sechs Aufrufen je Vorgang kommt so schnell ein Vielfaches der eigentlichen Mail oder des Dokuments zusammen. Welches Modell für welche Aufgabe passt, vertieft der Artikel Welches KI-Modell für welche Aufgabe.
Wie sieht eine Beispielrechnung aus?
Als Beispiel nehmen wir einen Agenten, der Reklamationen vorbereitet: Auftrag suchen, Lieferstatus prüfen, Kulanzregel nachschlagen, Gutschrift und Antwort als Entwurf anlegen. Die Zahlen sind Annahmen für die Rechnung, keine Messwerte aus einem Kundenprojekt:
- Annahme Menge: 40 Vorgänge je Arbeitstag an 21 Arbeitstagen, also 840 Vorgänge im Monat.
- Annahme Tokens: sechs Modellaufrufe je Vorgang mit zusammen 50.000 Eingabe-Tokens und 3.000 Ausgabe-Tokens.
- Annahme Vergleichbarkeit: gleiche Token-Zahl für alle Modelle. In Wirklichkeit zählt jedes Modell etwas anders. Anthropic gibt an, dass der Tokenizer ab Claude 4.7 für denselben Text etwa 30 Prozent mehr Tokens erzeugt.
- Annahme Kurs: Umrechnung zum EZB-Referenzkurs vom 28.09.2026, 1 Euro gleich 1,1378 US-Dollar.
| Modell | je Vorgang | je Monat | je Monat in Euro |
|---|---|---|---|
| Claude Haiku 4.5 | 0,065 $ | 54,60 $ | rund 48 € |
| Claude Sonnet 5 | 0,13 $ | 109,20 $ | rund 96 € |
| Claude Opus 5.5 | 0,26 $ | 218,40 $ | rund 192 € |
| GPT-6 Sol | 0,13 $ | 109,20 $ | rund 96 € |
| GPT-6 Luna | 0,0065 $ | 5,46 $ | rund 5 € |
Mit Prompt-Caching, also dem Zwischenspeichern wiederkehrender Teile der Eingabe, sinkt der Betrag weiter. Nehmen wir für Claude Sonnet 5 an, dass 35.000 der 50.000 Eingabe-Tokens aus dem Zwischenspeicher kommen (0,20 $ je Million) und die übrigen 15.000 dort neu abgelegt werden (2,50 $ je Million für fünf Minuten Speicherdauer). Dann kostet ein Vorgang rund 0,075 $, der Monat 62,58 $ oder rund 55 €.
Für das erste Jahr mit Claude Sonnet 5 ohne Caching ergibt sich: 4.900 € für den Bau, 12 mal 790 € für den Betrieb und 12 mal rund 96 € für Tokens, zusammen 15.532 € netto, ohne Kosten Dritter. Braucht der Agent für schwierige Abwägungen ein großes Modell wie Claude Opus 5.5, sind es 16.684 €. Der Betrieb ist damit gut achtmal so teuer wie die Modellnutzung. Wer Agenten nur nach Token-Preisen vergleicht, vergleicht den kleinsten Posten.
Wie halten Sie die laufenden Kosten im Griff?
Fünf Hebel wirken in der Praxis. Erstens die Modellwahl: Anthropic empfiehlt auf seiner Preisseite Haiku für einfache Aufgaben, Sonnet für die meisten produktiven Anwendungen und Opus für die anspruchsvollsten Abwägungen. Oft reicht ein kleines Modell für die Einordnung und ein größeres nur für den schwierigen Schritt. Zweitens Caching, wie oben gerechnet. Drittens Stapelverarbeitung: Beide Anbieter berechnen für Anfragen, die nicht sofort beantwortet werden müssen, die Hälfte des normalen Preises. Das passt zum Beispiel für nächtliche Auswertungen, nicht für Antworten an wartende Kunden.
Viertens Grenzen: Jeder unserer Agenten hat eine Höchstzahl an Schritten und ein Kostenlimit je Vorgang. Zusätzlich lässt sich bei Anthropic laut Dokumentation ein eigenes monatliches Ausgabenlimit setzen, bei dessen Erreichen die Schnittstelle weitere Anfragen ablehnt. Das ist eine Notbremse, kein Budget. Fünftens der Ort der Verarbeitung: Laut Anthropic kosten regionale Endpunkte bei Amazon Bedrock und Google Cloud 10 Prozent mehr als globale. OpenAI berechnet für Endpunkte mit regionaler Verarbeitung bei Modellen, die ab dem 05.03.2026 erschienen sind, ebenfalls 10 Prozent Aufschlag. Wenn Ihre Daten in der EU verarbeitet werden sollen, rechnen wir diesen Aufschlag ein. Die Unterschiede zwischen den Bezugswegen erklärt der Artikel Azure, Bedrock, Vertex oder Direktzugang.
Wann lohnt sich ein Agent nicht?
Wenn der Vorgang selten ist. Bei 20 Vorgängen im Monat spielen die Tokens keine Rolle, aber Bau und Betrieb bleiben: 4.900 € plus 12 mal 790 € verteilen sich im ersten Jahr auf 240 Vorgänge, das sind rund 60 € je Vorgang. Das rechnet sich nur, wenn jeder Vorgang sehr viel Zeit kostet.
Wenn der Ablauf immer gleich ist. Dann reicht eine Automatisierung aus dem Katalog ab 990 € mit Betrieb ab 190 € im Monat, und sie ist leichter zu betreiben. Worin sich beides unterscheidet, zeigt der Artikel Was ein KI-Agent wirklich ist.
Und wenn eine Person nur für sich selbst mit KI arbeiten will. Dann genügt oft ein gut eingerichtetes Werkzeug wie Claude oder ChatGPT, Einordnung und Schulung dazu gibt es bei unserem Gründer. Ob sich ein Agent für Ihren Vorgang rechnet, prüfen wir mit Ihren echten Mengen im Prozess-Scan für 490 €, der auf einen Folgeauftrag angerechnet wird. Wie wir Agenten bauen und betreiben, zeigt die Leistung KI-Agenten.
Quellen
- 1 Pricing (Claude API) , Anthropic, 28.09.2026
- 2 Pricing (OpenAI API) , OpenAI, 28.09.2026
- 3 Euro-Referenzkurs US-Dollar , Europäische Zentralbank, 28.09.2026
- 4 Rate limits (Spend limits) , Anthropic, 28.09.2026
- 5 Building effective agents , Anthropic, 19.12.2024
Prüfhinweis: Zum 31.12.2026 prüfen: API-Preise und Modellstände bei Anthropic und OpenAI (Preisseiten neu abrufen, Tabelle und Rechenbeispiel neu rechnen), EZB-Kurs aktualisieren, Aufschläge für regionale Verarbeitung, Katalog- und Betriebspreise gegen src/data/pricing.ts.