Welches KI-Modell für welche Aufgabe: Claude, GPT, Gemini, Mistral im Betriebsvergleich
Von Jean Hinz Veröffentlicht 28.09.2026 Aktualisiert 28.09.2026 8 Min. Lesezeit
Kurz gesagt
Zuerst entscheidet die Datenklasse, dann die Aufgabe. Öffentliche und interne Texte verarbeiten Claude, GPT, Gemini und Mistral mit Auftragsverarbeitungsvertrag und ohne Training. Personenbezogene Daten gehören auf einen EU-Endpunkt, streng vertrauliche auf ein offenes Modell in Ihrer Umgebung. Die Modellgröße folgt der Aufgabe. Wir bauen und betreiben das ab 4.900 € netto, Stand September 2026.
Inhalt
- Welche Modelle stehen im September 2026 zur Wahl?
- Wo werden die Daten verarbeitet, und gibt es EU-Optionen?
- Wer trainiert mit Ihren Daten, und wie steht es um den AVV?
- Was kostet ein Vorgang wirklich?
- Welches Modell passt zu welcher Aufgabe?
- Wie wichtig sind Kontextlänge und Werkzeugnutzung im Betrieb?
- Wie entscheiden wir nach Datenklasse?
- Was können Sie selbst entscheiden, und wann lohnt sich Hilfe?
Die Frage „Welches Modell ist das beste?“ führt im Unternehmen selten weiter. Im Betrieb zählen andere Dinge: wo die Daten verarbeitet werden, was im Vertrag steht, was ein Vorgang kostet und wie zuverlässig das Modell Werkzeuge bedient. Wir vergleichen die vier Anbieter, mit denen wir bauen, nach genau diesen Kriterien. Alle Angaben haben den Stand September 2026 und stammen aus den Preis- und Dokumentationsseiten der Anbieter.
Welche Modelle stehen im September 2026 zur Wahl?
Jeder Anbieter hat eine Modellfamilie mit großen, mittleren und kleinen Modellen. Die Tabelle zeigt die Listenpreise für die Standardverarbeitung in US-Dollar pro Million Tokens (ein Token entspricht grob einer Silbe) sowie das Kontextfenster, also wie viel Text ein Modell in einer Anfrage verarbeiten kann.
| Anbieter | Modell | Eingabe | Ausgabe | Kontext |
|---|---|---|---|---|
| Anthropic | Claude Fable 5.1 | 10,00 | 50,00 | 1 Mio. |
| Anthropic | Claude Opus 5.5 | 4,00 | 20,00 | 1 Mio. |
| Anthropic | Claude Sonnet 5 | 2,00 | 10,00 | 1 Mio. |
| Anthropic | Claude Haiku 4.5 | 1,00 | 5,00 | 200.000 |
| OpenAI | GPT-6 Astra | 10,00 | 50,00 | 1,05 Mio. |
| OpenAI | GPT-6 Sol | 2,00 | 10,00 | 1,05 Mio. |
| OpenAI | GPT-6 Luna | 0,10 | 0,50 | 1,05 Mio. |
| Gemini 3.1 Pro Preview | 2,00 | 12,00 | rund 1 Mio. | |
| Gemini 3.8 Flash | 0,75 | 3,75 | rund 1 Mio. | |
| Mistral | Mistral Medium 3.5 | 1,50 | 7,50 | 256.000 |
| Mistral | Mistral Large 3 | 0,50 | 1,50 | 256.000 |
| Mistral | Mistral Small 4 | 0,15 | 0,60 | 256.000 |
Quellen: Preisseiten von Anthropic, OpenAI, Google und Mistral, Kontextlängen aus den Modellseiten von Anthropic, OpenAI, Google und Mistral, jeweils Stand September 2026. Drei Details sind für die Kalkulation wichtig. Bei Gemini 3.1 Pro gelten die Preise bis 200.000 Tokens Eingabe, darüber steigen sie auf 4,00 und 18,00 US-Dollar. Gemini 3.8 Flash kostet laut Google ab dem 01.01.2027 das Doppelte, also 1,50 und 7,50 US-Dollar. Bei GPT-6 gelten die genannten Preise für kurzen Kontext, lange Anfragen kosten mehr. Mistral Large 3 ist trotz des Namens günstiger als Medium 3.5, es ist die ältere Version (25.12 gegenüber 26.04).
Wo werden die Daten verarbeitet, und gibt es EU-Optionen?
Hier unterscheiden sich die Anbieter am stärksten, und hier fallen die meisten Entscheidungen.
Anthropic (Claude): Die Claude API arbeitet standardmäßig global. Laut der Dokumentation zur Datenresidenz lässt sich die Verarbeitung per Parameter auf die USA beschränken, eine EU-Option gibt es im Direktzugang nicht (Stand September 2026). Die USA-Bindung kostet den Faktor 1,1. Wer Claude in der EU verarbeiten will, nutzt Amazon Bedrock mit EU-Profil oder Google Cloud mit dem Multi-Region-Endpunkt „eu“. Dort gilt laut Anthropic ein Aufschlag von 10 % auf regionale Endpunkte.
OpenAI (GPT): OpenAI bietet für API-Projekte eine Datenresidenz in Europa (EWR und Schweiz) über einen eigenen Endpunkt. Laut OpenAI setzt das eine Freischaltung durch den Vertrieb, eine genehmigte Anpassung der Missbrauchsüberwachung und eine Vertragsergänzung zur Aufbewahrung voraus. Für Modelle, die ab dem 05.03.2026 erschienen sind, kostet die regionale Verarbeitung 10 % mehr. Über Azure gibt es GPT zusätzlich in einer EU-Datenzone, dazu mehr im Artikel Azure, Bedrock, Vertex oder Direktzugang.
Google (Gemini): Für eine zugesicherte EU-Verarbeitung führt der Weg über Googles Agent Platform, früher Vertex AI. Laut Googles Tabelle zur Datenresidenz ist etwa Gemini 3.8 Flash im EU-Multi-Region-Endpunkt verfügbar, Gemini 3.1 Pro Preview steht dort nicht (Stand September 2026). Globale Endpunkte geben keine Zusage zum Ort.
Mistral: Daten liegen laut Mistral standardmäßig in der EU, nur wer ausdrücklich den US-Endpunkt nutzt, landet in den USA. Je nach genutzter Funktion können Daten vorübergehend zu Unterauftragsverarbeitern außerhalb der EU gehen, die Liste steht in Mistrals Trust Center.
Wer trainiert mit Ihren Daten, und wie steht es um den AVV?
Ein Auftragsverarbeitungsvertrag, kurz AVV, regelt nach DSGVO, wie ein Dienstleister personenbezogene Daten in Ihrem Auftrag verarbeitet. Bei allen vier Anbietern ist er zu bekommen, der Weg unterscheidet sich.
Anthropic schließt das Training in den Commercial Terms aus und bindet den Data Processing Addendum per Verweis ein. OpenAI nutzt API-Daten seit dem 01.03.2023 nicht zum Training, außer Sie stimmen ausdrücklich zu. Bei Google trainiert der kostenpflichtige Zugang laut Preisseite nicht mit Ihren Inhalten, der kostenlose schon. Das ist ein häufiger Fehler in Pilotprojekten, die mit einem kostenlosen Schlüssel starten.
Bei Mistral müssen Sie aktiv werden. Laut Mistral Help Center gibt es für Studio und API einen eigenen Schalter „Anonymous improvement data“ im Admin-Bereich, der ausgeschaltet werden muss. Er ist getrennt von dem Schalter für den Chat. Wir setzen beide bei der Einrichtung und dokumentieren das im Datenflussbild.
Was kostet ein Vorgang wirklich?
Listenpreise sagen wenig, solange die Menge fehlt. Ein Rechenbeispiel aus unserer Kalkulation, nicht aus einer Messung: Ein Wissensassistent bekommt pro Frage rund 6.000 Tokens Eingabe (Frage plus gefundene Abschnitte) und schreibt rund 800 Tokens Antwort. Bei 4.000 Fragen im Monat ergeben sich nach Listenpreis:
| Modell | Kosten je Frage | Kosten im Monat |
|---|---|---|
| Claude Sonnet 5 oder GPT-6 Sol | 0,020 USD | rund 80 USD |
| Mistral Medium 3.5 | 0,015 USD | rund 60 USD |
| Claude Haiku 4.5 | 0,010 USD | rund 40 USD |
| Gemini 3.8 Flash (bis Ende 2026) | 0,0075 USD | rund 30 USD |
Drei Effekte verschieben das Ergebnis. Erstens die EU-Bindung, die bei Claude über Bedrock oder Google und bei OpenAI im Direktzugang je 10 % aufschlägt. Zweitens die Denkschritte moderner Modelle: Google weist ausdrücklich darauf hin, dass der Ausgabepreis die Tokens des Nachdenkens enthält, und bei komplexen Fragen können das mehr sein als die Antwort selbst. Drittens Zwischenspeicher und Stapelverarbeitung: Anthropic berechnet gelesene Zwischenspeicher mit einem Zehntel des Eingabepreises, bei Opus 5.5 mit 5 %, und die Batch-Verarbeitung halbiert den Preis. Für Ihren Fall rechnen wir das im Angebot mit Ihren Mengen durch.
Welches Modell passt zu welcher Aufgabe?
Aus unseren Projekten ergibt sich eine einfache Faustregel, die wir dann mit Ihren Daten prüfen.
Große Mengen, klare Struktur: Belege auslesen, Mails klassifizieren, Felder extrahieren. Hier reichen kleine Modelle wie Claude Haiku 4.5, GPT-6 Luna, Gemini Flash-Lite oder Mistral Small 4. Die Qualität hängt mehr am Prompt und an Prüfregeln als an der Modellgröße.
Texte mit Wissen und Tonalität: Antwortentwürfe, Exposés, Assistenten mit Wissensbasis. Hier setzen wir mittlere Modelle ein, etwa Claude Sonnet 5, GPT-6 Sol, Gemini 3.8 Flash oder Mistral Medium 3.5.
Mehrstufige Agenten: Ein Agent, der selbst nachschlägt, abgleicht und Vorgänge vorbereitet, braucht die großen Modelle, also Claude Opus 5.5 oder GPT-6 Astra. Das ist der Bereich unserer Lösung KI-Agent mit Systemzugriff.
Daten, die das Haus nicht verlassen dürfen: Hier bleiben Modelle mit offenen Gewichten, die Sie selbst betreiben dürfen. Mistral Large 3 steht laut Mistral unter Apache 2.0, Medium 3.5 unter einer angepassten MIT-Lizenz.
Welches Modell im Einzelfall gewinnt, entscheidet ein Testset aus Ihren echten Fällen, nicht eine Rangliste. Wie wir das aufbauen, steht im Artikel Evaluation vor dem Go-live.
Wie wichtig sind Kontextlänge und Werkzeugnutzung im Betrieb?
Die Kontextlängen sind groß geworden: 1 Million Tokens bei Claude Fable, Opus und Sonnet, 1,05 Millionen bei GPT-6 mit maximal 922.000 Tokens Eingabe, rund 1 Million bei Gemini und 256.000 bei Mistral. Im Betrieb nutzen wir das selten aus, weil jeder Token bezahlt wird. Eine gute Wissensbasis liefert dem Modell zehn passende Abschnitte statt eines ganzen Ordners. Lange Kontexte helfen bei Einzelfällen wie einem Vertragskonvolut, das am Stück geprüft werden soll.
Werkzeugnutzung heißt: Das Modell ruft definierte Funktionen auf, etwa „Verfügbarkeit prüfen“ oder „Kunde im CRM suchen“. Alle vier Anbieter unterstützen das. Für Agenten nutzen wir zusätzlich MCP, das Model Context Protocol, einen offenen Standard, über den ein Modell an Werkzeuge und Datenquellen angebunden wird. Werkzeuge kosten ebenfalls Tokens: Laut Anthropic fügt allein die Definition des Werkzeugsatzes zur Computerbedienung rund 4.500 Tokens Eingabe pro Anfrage hinzu. Wer zwanzig Werkzeuge anbietet, wo drei reichen, zahlt bei jeder Anfrage mit.
Wie entscheiden wir nach Datenklasse?
Bevor wir über Modellnamen sprechen, ordnen wir die Daten einer Lösung einer von vier Klassen zu. Die Klasse bestimmt den Zugangsweg, die Aufgabe bestimmt danach die Modellgröße.
Die Einordnung machen wir im Klärungstermin mit Ihnen, bei Bedarf gemeinsam mit Ihrem Datenschutz. Für eine Lösung mit gemischten Daten gilt die strengste Klasse, oder wir trennen die Verarbeitung: Das kleine Modell in der EU liest die personenbezogenen Felder, das große Modell sieht nur den anonymisierten Rest.
Was können Sie selbst entscheiden, und wann lohnt sich Hilfe?
Wenn Ihr Team vor allem schreibt, zusammenfasst und recherchiert, brauchen Sie keine Entwicklung, sondern eine Firmenlizenz und gute Gewohnheiten. Wie man Claude oder ChatGPT im Arbeitsalltag gut einsetzt, zeigt unser Gründer Jean Hinz in seinen Leitfäden zu Claude und zu ChatGPT. Welche Lizenz für welche Organisation passt, vergleichen wir im Artikel Copilot, Claude Enterprise oder ChatGPT Enterprise.
Unsere Arbeit beginnt, wenn ein Modell in einen Prozess eingebaut werden soll: mit Zugriff auf Ihre Systeme, festem Datenweg, Freigabeschritt, Protokoll und jemandem, der nach dem Go-live auf Preise, Modellwechsel und Ausfälle achtet. Anbieter ziehen Modelle nach festen Plänen zurück, Claude Haiku 4.5 etwa laut Anthropic nicht vor dem 15.10.2026. Solche Wechsel übernimmt unser Betrieb. Wie wir Assistenten und Software bauen, lesen Sie unter KI-Software und Assistenten.
Quellen
- 1 Pricing , Anthropic, Claude Platform Docs, 28.09.2026
- 2 Models overview , Anthropic, Claude Platform Docs, 28.09.2026
- 3 Data residency , Anthropic, Claude Platform Docs, 28.09.2026
- 4 Commercial Terms of Service , Anthropic, 17.06.2025
- 5 Pricing , OpenAI API Docs, 28.09.2026
- 6 GPT-6 Sol, Modellseite (Kontext gleichlautend für Astra und Luna) , OpenAI API Docs, 28.09.2026
- 7 Data controls in the OpenAI platform (Your data) , OpenAI API Docs, 28.09.2026
- 8 Gemini Developer API pricing , Google AI for Developers, 24.09.2026
- 9 Gemini 3.8 Flash, Modellseite , Google AI for Developers, 28.09.2026
- 10 Data residency, Gemini Enterprise Agent Platform , Google Cloud Documentation, 28.09.2026
- 11 API Pricing , Mistral AI, 28.09.2026
- 12 Models (Übersicht und Modellseiten) , Mistral AI Docs, 28.09.2026
- 13 Where do you store my data or my Organization's data? , Mistral Help Center, 12.08.2026
- 14 Can I opt out of my input or output data being used for training? , Mistral Help Center, 28.09.2026
Prüfhinweis: Quartalsweise, nächster Termin 31.12.2026: Modellnamen, Listenpreise pro Million Tokens, Kontextlängen, EU-Optionen (Anthropic inference_geo, OpenAI Data Residency, Google Multi-Region-Tabelle) und Trainingsregeln aller vier Anbieter neu prüfen. Gemini 3.8 Flash ändert den Preis zum 01.01.2027.