Small Language Models (SLM): Was sie sind, welche es 2026 gibt und wann sie im Unternehmen reichen
Von Jean Hinz Veröffentlicht 28.09.2026 Aktualisiert 28.09.2026 13 Min. Lesezeit
Kurz gesagt
Ein Small Language Model (SLM) ist ein Sprachmodell, das auf einer einzelnen Grafikkarte oder einem Laptop läuft, meist mit einigen hundert Millionen bis etwa 15 Milliarden Parametern. Es erledigt eng umrissene Aufgaben wie Klassifizieren und Extrahieren schnell und in Ihrer eigenen Umgebung. Offene Fragen und die Planung mehrstufiger Agenten übernehmen meist große Modelle. Tickets klassifizieren wir als Katalog-Lösung ab 1.490 € netto.
Inhalt
- Was ist ein Small Language Model?
- Worin unterscheiden sich SLM und LLM?
- Welche Small Language Models gibt es im September 2026?
- Seed-OSS oder gpt-oss: Was taugen die mittelgroßen offenen Modelle?
- Wofür taugen kleine Modelle im Unternehmen?
- Wann bleibt ein großes Modell nötig?
- Wie betreibt man ein SLM in der eigenen Umgebung?
- Was bedeutet ein SLM für Datenschutz und Kosten?
- Wie finden Sie heraus, ob ein kleines Modell reicht?
Nicht jede Aufgabe braucht das größte Sprachmodell. Eine Mail einer Kategorie zuordnen, eine Rechnungsnummer aus einem PDF lesen oder entscheiden, ob eine Anfrage dringend ist: Das erledigen heute Modelle, die auf einer einzelnen Grafikkarte oder sogar auf einem Laptop laufen. Man nennt sie Small Language Models, kurz SLM.
Ein kleines Modell kann in Ihrer eigenen Umgebung laufen, ohne dass Daten das Haus verlassen, und es antwortet schnell. Es hat aber klare Grenzen, und die Namen der Hersteller helfen bei der Einordnung wenig.
Sie erfahren hier, was ein SLM ist, welche offenen Modelle es im September 2026 gibt und wie Sie prüfen, ob ein kleines Modell für Ihre Aufgabe reicht. Die großen Modelle der Anbieter vergleichen wir im Artikel Welches KI-Modell für welche Aufgabe, hier geht es um Modelle, die Sie selbst betreiben können.
Was ist ein Small Language Model?
Ein Small Language Model ist ein Sprachmodell mit vergleichsweise wenigen Parametern, das mit wenig Rechenleistung auskommt und deshalb auf einem einzelnen Gerät laufen kann. Parameter sind die gelernten Gewichte eines Modells. Ihre Zahl bestimmt grob, wie viel Speicher und Rechenzeit ein Modell braucht.
Eine feste Grenze gibt es nicht, die Definitionen gehen auseinander:
- Microsoft Learn trennt in einem Konzeptartikel bei 10 Milliarden Parametern: darunter kleine, darüber große Modelle (Stand 25.06.2026).
- IBM beschreibt SLMs in seinem Überblick mit einigen Millionen bis einigen Milliarden Parametern (Stand 02.04.2026).
- NVIDIA Research definiert im Paper „Small Language Models are the Future of Agentic AI“ über den Einsatz: Ein SLM passt auf ein übliches Endgerät und antwortet dort schnell genug für die Anfragen eines Nutzers. Als Faustregel nennen die Autoren für 2025 die meisten Modelle unter 10 Milliarden Parametern.
In der Praxis sprechen wir von einigen hundert Millionen bis etwa 15 Milliarden Parametern. Entscheidend ist weniger die Zahl als die Frage, ob das Modell auf Hardware läuft, die Sie selbst betreiben können.
Eine Abgrenzung hilft bei Anbieterlisten: Die kleinen Modelle der großen Anbieter, die Sie nur per API nutzen, sind im Preis klein, ihre Größe veröffentlichen die Anbieter aber meist nicht, und Sie können sie nicht selbst betreiben. Mit SLM meinen wir in diesem Artikel Modelle mit offenen Gewichten.
Und wer nach „SLM im Chat“ sucht: Im Zusammenhang mit KI-Chats und Sprachmodellen ist mit SLM das Small Language Model gemeint.
Worin unterscheiden sich SLM und LLM?
Ein SLM ist spezialisiert, schnell und selbst betreibbar, ein LLM ist breit, stark im Schlussfolgern und wird meist als Dienst genutzt. Die Tabelle fasst die Unterschiede für den Betrieb zusammen.
| Merkmal | Small Language Model | Large Language Model |
|---|---|---|
| Größe | einige hundert Mio. bis rund 15 Mrd. Parameter | zig bis hunderte Mrd. Parameter, oft nicht veröffentlicht |
| Hardware | eine Grafikkarte, teils Laptop oder Smartphone | Rechenzentrum, Zugriff meist per API |
| Kosten | feste Kosten für Hardware und Betrieb | Preis pro Token, keine Fixkosten |
| Latenz | kurz, kein Weg über das Internet nötig | abhängig von Anbieter, Last und Modell |
| Datenhaltung | kann vollständig in Ihrer Umgebung laufen | Daten gehen zum Anbieter, EU-Endpunkt wählbar |
| Stärken | eng umrissene Aufgaben, große Mengen, offline | offene Fragen, langes Schlussfolgern, Agenten |
| Schwächen | weniger Weltwissen, schwächer bei komplexen Aufgaben | Kosten bei großen Mengen, Abhängigkeit vom Anbieter |
Microsoft empfiehlt kleine Modelle für klar umrissene, enge Aufgaben und große für schwierige oder explorative. IBM nennt als Grenzen kleiner Modelle geringere Leistung bei komplexen Aufgaben über mehrere Fachgebiete und begrenztes Allgemeinwissen. Das NVIDIA-Paper beziffert den Unterschied im Betrieb: Ein Modell mit 7 Milliarden Parametern zu betreiben, sei 10 bis 30 Mal günstiger in Latenz, Energie und Rechenoperationen als eines mit 70 bis 175 Milliarden.
Eine Falle steckt in einer Bauweise namens Mixture of Experts. Dabei rechnet pro Wort nur ein Teil des Modells, der Rest muss trotzdem im Speicher liegen. OpenAIs gpt-oss-20b hat 21 Milliarden Parameter, davon 3,6 Milliarden aktiv, und braucht 16 GB Speicher. Mistral Small 4 trägt „Small“ im Namen, hat aber 119 Milliarden Parameter, von denen 6,5 Milliarden aktiv sind. Für die Hardware zählt die Gesamtgröße, der Name sagt darüber nichts.
Welche Small Language Models gibt es im September 2026?
Die wichtigsten offenen kleinen Modelle kommen von Google, Qwen, IBM, Mistral, Microsoft und Meta. Die Tabelle zeigt die kleinen Varianten mit Größe, Kontextfenster (wie viel Text das Modell in einer Anfrage verarbeiten kann), Lizenz und Erscheinungsdatum.
| Modell | Hersteller | Parameter | Kontext in Tokens | Lizenz | erschienen |
|---|---|---|---|---|---|
| Gemma 4 E2B und E4B | 2,3 und 4,5 Mrd. effektiv | 128.000 | Apache 2.0 | 31.03.2026 | |
| Gemma 4 12B Unified | 12 Mrd. | 256.000 | Apache 2.0 | 03.06.2026 | |
| Qwen3.5 0.8B, 2B, 4B, 9B | Qwen | 0,8 bis 9 Mrd. | 262.144 | Apache 2.0 | 02.03.2026 |
| Granite 4.2 3B und 8B | IBM | 3 und 8 Mrd. | 128.000, erweiterbar auf 512.000 | Apache 2.0 | 25.08.2026 |
| Ministral 3 3B, 8B, 14B | Mistral AI | 3, 8 und 14 Mrd., jeweils plus 0,4 Mrd. Bild-Encoder | 256.000 | Apache 2.0 | 02.12.2025 |
| Phi-4-reasoning-vision | Microsoft | 15 Mrd. | 16.384 | MIT | 04.03.2026 |
| Phi-4-mini | Microsoft | 3,8 Mrd. | 128.000 | MIT | Februar 2025 |
| Llama 3.2 1B und 3B | Meta | 1 und 3 Mrd. | 128.000 | Llama 3.2 Community License | 25.09.2024 |
| AFM 3 Core | Apple | 3 Mrd. | nicht veröffentlicht | nur über Apple-Plattformen | 08.06.2026 |
Quellen: Modellkarten und Release-Seiten von Google, Qwen, IBM, Mistral, Microsoft, Meta und Apple, Stand September 2026.
Einige Hinweise zur Tabelle. Bei Gemma 4 E2B und E4B steht das E für effektive Parameter: Mit zusätzlichen Einbettungen je Schicht sind es 5,1 und 8 Milliarden. Google baut sie laut Modellkarte ausdrücklich für Laptops und Mobilgeräte. Granite 4.2, Ministral 3, Phi-4-mini und Llama 3.2 nennen Deutsch ausdrücklich unter den unterstützten Sprachen. Phi-4-reasoning-vision ist laut Microsoft vor allem auf Englisch ausgelegt. Listen zu „Small Language Models 2025“ zeigen oft noch die Vorgänger von Gemma 4, Qwen3.5 und Granite 4.2.
Metas kleinste Llama-Modelle stammen aus dem September 2024. Die Llama-4-Modelle vom April 2025 sind mit 109 Milliarden Parametern und mehr keine SLMs. Für sie gilt zudem eine Einschränkung: Laut Metas Nutzungsrichtlinie für Llama 4 werden die Rechte an den multimodalen Llama-4-Modellen weder Personen mit Wohnsitz in der EU noch Unternehmen mit Hauptsitz in der EU eingeräumt, Endnutzer fertiger Produkte sind davon ausgenommen (Stand September 2026). Dieser Artikel ist keine Rechtsberatung. Prüfen Sie die Lizenz jedes Modells vor dem Einsatz, bei Zweifeln mit Ihrer Rechtsberatung.
Apples AFM 3 Core ist ein Sonderfall. Das Modell läuft auf Apple-Geräten, App-Entwickler erreichen es laut Apple über das Foundation Models Framework, eine Swift-Schnittstelle. Für Unternehmensprozesse auf eigenen Servern ist es damit nicht gedacht.
Seed-OSS oder gpt-oss: Was taugen die mittelgroßen offenen Modelle?
Beide liegen eine Stufe über den klassischen SLMs und sind interessant, wenn ein kleines Modell nicht reicht, die Daten das Haus aber trotzdem nicht verlassen dürfen.
gpt-oss hat OpenAI am 05.08.2025 unter Apache 2.0 veröffentlicht. Die kleine Variante gpt-oss-20b kommt laut OpenAI mit 16 GB Speicher aus, die große gpt-oss-120b mit 117 Milliarden Parametern mit 80 GB. Beide verarbeiten bis zu 128.000 Tokens.
Seed-OSS-36B von ByteDance ist am 20.08.2025 erschienen, ebenfalls unter Apache 2.0. Laut Modellkarte ist es ein dichtes Modell mit 36 Milliarden Parametern und 512.000 Tokens Kontext. Die Besonderheit ist ein einstellbares Denkbudget: Sie legen fest, wie viele Tokens das Modell für Zwischenschritte verwenden darf.
Beide Modelle sind über ein Jahr alt. Inzwischen gibt es neuere Kandidaten in derselben Klasse, etwa Gemma 4 26B A4B mit 25,2 Milliarden Parametern, davon 3,8 Milliarden aktiv, oder das dichte Qwen3.8-27B vom August 2026. Welches Modell für Ihre Aufgabe gewinnt, sagt Ihnen keine Rangliste. Das entscheidet ein Vergleich auf Ihren eigenen Fällen.
Wofür taugen kleine Modelle im Unternehmen?
Kleine Modelle sind stark bei Aufgaben mit klarer Eingabe, klarer Ausgabe und großer Menge. Typische Beispiele:
- Klassifizieren: Mails, Tickets oder Dokumente einer festen Liste von Kategorien zuordnen, dazu eine Dringlichkeit.
- Extrahieren: Rechnungsnummer, Datum, Absender oder Vertragslaufzeit aus einem Dokument lesen und als Felder übergeben.
- Routing: entscheiden, welche Stelle, welches Werkzeug oder welches Modell eine Anfrage bekommt.
- Kurze Texte zusammenfassen: eine Mail, ein Gesprächsprotokoll, ein Ticketverlauf. Bei langen Vertragswerken stoßen kleine Modelle eher an Grenzen.
- Assistent mit Wissensbasis in eigener Umgebung: Das oft gesuchte „interne GPT“ für interne Dokumente. Die Suche findet die passenden Abschnitte, das Modell formuliert nur daraus die Antwort mit Quelle. Es muss wenig wissen, aber sauber formulieren. Wie das aufgebaut ist, beschreibt der Artikel Ein Wissensassistent auf eigenen Dokumenten.
- Teilschritte von Agenten: Das NVIDIA-Paper schlägt Systeme vor, in denen kleine Modelle die wiederkehrenden Schritte übernehmen und große Modelle nur gezielt und sparsam gerufen werden, etwa für allgemeines Schlussfolgern oder offene Dialoge.
Allen Aufgaben ist gemeinsam: Ein Fehler fällt auf. Ist sich das Modell unsicher, geht der Fall in eine Prüfliste, und ein Mensch entscheidet. Das gilt bei uns unabhängig von der Modellgröße.
Wann bleibt ein großes Modell nötig?
Ein großes Modell ist nötig, wenn die Aufgabe offen ist, mehrere Schritte verlangt oder viel Wissen voraussetzt. Dazu gehören Agenten, die selbst nachschlagen, abgleichen und Vorgänge vorbereiten, Fragen, die Informationen aus vielen Dokumenten verknüpfen, und Aufgaben mit langem Schlussfolgern. Laut Microsoft kommen große Modelle zudem besser mit verrauschten oder unvollständigen Eingaben zurecht.
Die beste Lösung ist deshalb oft keine Entweder-oder-Entscheidung, sondern eine Aufteilung. Ein Router, also eine vorgeschaltete Einordnung, schickt einfache Fälle an das kleine Modell und schwere an das große.
So bleibt die Masse der Fälle im Haus und kostet wenig. Nur der Teil, der das große Modell wirklich braucht, geht nach außen, und dort über einen Weg mit EU-Verarbeitung, wenn personenbezogene Daten im Spiel sind.
Wie betreibt man ein SLM in der eigenen Umgebung?
Ein SLM läuft auf einem Server mit Grafikkarte in Ihrem Rechenzentrum, in Ihrer eigenen Cloud oder für Einzelplätze auf einem Laptop. Die Herstellerangaben geben eine grobe Orientierung: Ministral 3 mit 8 Milliarden Parametern passt laut Mistral in 12 GB Grafikspeicher, die Variante mit 14 Milliarden in 24 GB, jeweils im Format FP8. Für gpt-oss-20b nennt OpenAI 16 GB. Für Mistral Small 4 verteilt der empfohlene vLLM-Startbefehl in der Modellkarte das Modell auf zwei Grafikkarten.
Den Speicherbedarf senkt die Quantisierung. Dabei werden die Gewichte mit geringerer Genauigkeit gespeichert, etwa mit 8 oder 4 Bit statt 16. Das spart Speicher und kann Qualität kosten, wie viel, hängt vom Modell ab. Mistral schreibt zu Ministral 3 ausdrücklich, dass weitere Quantisierung den Bedarf unter die genannten Werte drückt. Google bietet für Gemma 4 Varianten an, die schon im Training auf die Quantisierung vorbereitet wurden (Quantization-Aware Training). Laut Modellkarte bleibt die Qualität dabei ähnlich wie im Original, die 4-Bit-Fassung von Gemma 4 12B ist 6,98 GB groß.
Für den Betrieb gibt es zwei verbreitete Werkzeuge:
- Ollama führt offene Modelle auf dem eigenen Rechner aus und eignet sich gut für Tests und Einzelplätze. Achtung: Ollama bietet laut seiner Dokumentation auch Cloud-Modelle an, erkennbar am Zusatz „cloud“ im Modellnamen. Diese laufen auf Ollamas Infrastruktur, nicht bei Ihnen. Wer „lokal“ zusagt, muss das in der Konfiguration ausschließen.
- vLLM ist laut Projektbeschreibung eine Bibliothek für schnelle Inferenz und Bereitstellung. Sie verarbeitet viele Anfragen parallel, stellt eine OpenAI-kompatible Schnittstelle bereit, unterstützt Quantisierungsformate wie FP8, INT4, GPTQ, AWQ und GGUF und kann mehrere feinabgestimmte Varianten eines Modells gleichzeitig bedienen. Das ist der Weg, wenn eine Lösung für ein ganzes Team laufen soll.
Die OpenAI-kompatible Schnittstelle erleichtert den Wechsel zwischen einem Modell in Ihrer Umgebung und einem beim Anbieter, im Test wie später im Betrieb.
Was bedeutet ein SLM für Datenschutz und Kosten?
Ein kleines Modell in Ihrer Umgebung verarbeitet die Daten dort, wo sie ohnehin liegen. Fragen nach Speicherort oder Training beim Modellanbieter entfallen. Die übrigen Pflichten bleiben: Zugriffsrechte, Protokolle, ein Löschkonzept und die Absicherung des Servers.
Geht ein Teil der Fälle an ein großes Modell, gilt bei uns die Regel: Personenbezogene Daten gehören auf einen EU-Endpunkt, etwa Claude über Amazon Bedrock EU oder Google Cloud mit dem Endpunkt „eu“, GPT über die Azure-Datenzone EU oder Mistral. Die direkte Claude API bietet laut Anthropic nur die Optionen global und USA, eine EU-Option gibt es dort nicht (Stand September 2026). Die Wege im Einzelnen vergleicht der Artikel Azure, Bedrock, Vertex oder Direktzugang.
Bei den Kosten tauscht ein SLM variable gegen feste Kosten. Über eine API zahlen Sie pro Token. Im eigenen Betrieb zahlen Sie Hardware oder gemietete Grafikkarten, Strom, Updates und Überwachung, egal wie viele Anfragen kommen. Bei kleinen Mengen ist die API deshalb meist günstiger. Im Artikel Welches KI-Modell für welche Aufgabe rechnen wir einen Wissensassistenten mit 4.000 Fragen im Monat nach Listenpreis auf 30 bis 80 US-Dollar Modellkosten. Dafür lohnt sich kein eigener Server.
Ein SLM rechnet sich eher, wenn die Mengen groß sind, wenn Daten das Haus nicht verlassen dürfen oder wenn die Lösung ohne Internetverbindung laufen muss. Oft ist deshalb die Datenklasse das stärkere Argument, nicht der Preis.
Wie finden Sie heraus, ob ein kleines Modell reicht?
Mit einem Testset aus Ihren eigenen Fällen, nicht mit Benchmarks. Öffentliche Ranglisten messen allgemeine Fähigkeiten. Ob ein Modell Ihre Kategorien trifft, Ihre Formulare liest und mit Ihren Abkürzungen umgeht, zeigen sie nicht. So gehen wir vor:
- Aufgabe eng fassen: Was genau soll das Modell liefern, in welchem Format, mit welchen erlaubten Werten?
- Echte Fälle sammeln: meist 20 bis 50, bei Wissensassistenten 50 bis 100, mit der richtigen Lösung dazu. Schwierige und seltene Fälle gehören ausdrücklich hinein.
- Klein gegen groß vergleichen: dasselbe Testset mit einem SLM in Ihrer Umgebung und einem großen Modell über einen EU-Endpunkt.
- Schwellen festlegen: Ab welcher Sicherheit darf das kleine Modell allein entscheiden, wann geht der Fall weiter an das große Modell oder in die Prüfliste?
- Bei jedem Modellwechsel wiederholen: Neue Versionen erscheinen laufend, allein Gemma 4 kam 2026 in drei Schritten. Das Testset zeigt, ob ein Wechsel etwas bringt.
Wie Testset, Metriken und Abnahmeprotokoll im Detail aufgebaut sind, steht im Artikel Evaluation vor dem Go-live.
Reicht das kleine Modell nicht, nehmen Sie ein größeres über einen EU-Endpunkt oder eines der mittelgroßen offenen Modelle. Reicht es, haben Sie eine Lösung, die schnell antwortet, wenig kostet und Ihre Daten im Haus behält. Beides bauen wir als Katalog-Lösung oder individuell.
Häufige Fragen
Was bedeutet SLM?
SLM steht für Small Language Model, also ein kleines Sprachmodell. Eine feste Grenze gibt es nicht. Microsoft Learn zieht sie bei 10 Milliarden Parametern, IBM spricht von einigen Millionen bis einigen Milliarden. Gemeint ist ein Modell, das auf einer Grafikkarte, einem Laptop oder einem Smartphone läuft und eng umrissene Aufgaben schnell erledigt.
Kann ich ein internes GPT für eigene Dokumente mit einem kleinen Modell betreiben?
Ja, wenn das System vorher die passenden Abschnitte sucht und das Modell nur daraus antwortet. Dann muss es wenig wissen, aber sauber formulieren und die Quelle nennen. Ob ein kleines Modell dafür reicht, zeigt ein Test mit 50 bis 100 echten Fragen. Bei Fragen, die viele Dokumente verknüpfen, ist ein großes Modell oft besser.
Welche Hardware braucht ein Small Language Model?
Laut Mistral passt Ministral 3 mit 8 Milliarden Parametern in 12 GB Grafikspeicher, die Variante mit 14 Milliarden in 24 GB, jeweils im Format FP8. OpenAI nennt für gpt-oss-20b 16 GB Speicher. Googles kleinste Gemma-4-Modelle sind für Laptops und Smartphones gebaut. Für viele Nutzer gleichzeitig braucht es einen Server mit Grafikkarte.
Sind Small Language Models kostenlos?
Die Lizenz ist bei vielen Modellen kostenlos, etwa Apache 2.0 bei Gemma 4, Qwen3.5, Granite 4.2 und Ministral 3 oder MIT bei Phi-4. Der Betrieb kostet trotzdem: Hardware oder gemietete Grafikkarten, Strom, Updates und jemanden, der das System überwacht. Bei kleinen Mengen ist ein Modell über eine API oft günstiger.
Was ist besser, Seed-OSS oder gpt-oss?
Das hängt von der Aufgabe ab. Seed-OSS-36B ist ein dichtes Modell mit 36 Milliarden Parametern und 512.000 Tokens Kontext, gpt-oss-20b braucht nur 16 GB Speicher bei 128.000 Tokens. Beide stehen unter Apache 2.0 und sind im August 2025 erschienen. Entscheiden sollte ein Test mit Ihren eigenen Fällen, nicht eine Rangliste.
Quellen
- 1 Small Language Models are the Future of Agentic AI (arXiv:2506.02153) , NVIDIA Research, arXiv, 15.09.2025
- 2 Concepts: Small and large language models , Microsoft Learn, 25.06.2026
- 3 What are small language models? , IBM Think, 02.04.2026
- 4 Gemma releases , Google AI for Developers, 28.09.2026
- 5 Gemma 4 model card , Google AI for Developers, 30.07.2026
- 6 Qwen3.5-9B, Modellkarte , Qwen, Hugging Face, 28.09.2026
- 7 Granite 4.2 8B, Modellkarte , IBM Granite, Hugging Face, 25.08.2026
- 8 Introducing Mistral 3 , Mistral AI, 02.12.2025
- 9 Ministral 3 14B Instruct 2512, Modellkarte , Mistral AI, Hugging Face, 28.09.2026
- 10 Mistral Small 4 119B 2603, Modellkarte , Mistral AI, Hugging Face, 28.09.2026
- 11 Phi-4-mini-instruct und Phi-4-reasoning-vision-15B, Modellkarten , Microsoft, Hugging Face, 04.03.2026
- 12 Introducing gpt-oss , OpenAI, 05.08.2025
- 13 Seed-OSS-36B-Instruct, Modellkarte , ByteDance Seed, Hugging Face, 20.08.2025
- 14 Llama 4 Acceptable Use Policy , Meta, 28.09.2026
- 15 Introducing the Third Generation of Apple's Foundation Models , Apple Machine Learning Research, 08.06.2026
- 16 Gemma 4 12B IT QAT Q4_0 GGUF, Modellkarte , Google, Hugging Face, 28.09.2026
- 17 WWDC26 Apple Intelligence guide , Apple Developer, 28.09.2026
- 18 vLLM, README , vLLM Project, GitHub, 28.09.2026
- 19 Cloud models , Ollama Docs, 28.09.2026
- 20 Data residency , Anthropic, Claude Platform Docs, 28.09.2026
Prüfhinweis: Zum 31.12.2026 prüfen: neue Versionen von Gemma, Qwen, Granite, Ministral, Phi, gpt-oss, Seed-OSS und Llama samt Lizenz, Größe und Kontextlänge; Hardwareangaben der Modellkarten; Metas Nutzungsrichtlinie für multimodale Modelle in der EU; Bedingungen der Ollama-Cloud-Modelle; EU-Option der Claude API.