Stack & Vergleiche

Small Language Models (SLM): Was sie sind, welche es 2026 gibt und wann sie im Unternehmen reichen

Von Veröffentlicht 28.09.2026 Aktualisiert 28.09.2026 13 Min. Lesezeit

Kurz gesagt

Ein Small Language Model (SLM) ist ein Sprachmodell, das auf einer einzelnen Grafikkarte oder einem Laptop läuft, meist mit einigen hundert Millionen bis etwa 15 Milliarden Parametern. Es erledigt eng umrissene Aufgaben wie Klassifizieren und Extrahieren schnell und in Ihrer eigenen Umgebung. Offene Fragen und die Planung mehrstufiger Agenten übernehmen meist große Modelle. Tickets klassifizieren wir als Katalog-Lösung ab 1.490 € netto.

Inhalt
  1. Was ist ein Small Language Model?
  2. Worin unterscheiden sich SLM und LLM?
  3. Welche Small Language Models gibt es im September 2026?
  4. Seed-OSS oder gpt-oss: Was taugen die mittelgroßen offenen Modelle?
  5. Wofür taugen kleine Modelle im Unternehmen?
  6. Wann bleibt ein großes Modell nötig?
  7. Wie betreibt man ein SLM in der eigenen Umgebung?
  8. Was bedeutet ein SLM für Datenschutz und Kosten?
  9. Wie finden Sie heraus, ob ein kleines Modell reicht?

Nicht jede Aufgabe braucht das größte Sprachmodell. Eine Mail einer Kategorie zuordnen, eine Rechnungsnummer aus einem PDF lesen oder entscheiden, ob eine Anfrage dringend ist: Das erledigen heute Modelle, die auf einer einzelnen Grafikkarte oder sogar auf einem Laptop laufen. Man nennt sie Small Language Models, kurz SLM.

Ein kleines Modell kann in Ihrer eigenen Umgebung laufen, ohne dass Daten das Haus verlassen, und es antwortet schnell. Es hat aber klare Grenzen, und die Namen der Hersteller helfen bei der Einordnung wenig.

Sie erfahren hier, was ein SLM ist, welche offenen Modelle es im September 2026 gibt und wie Sie prüfen, ob ein kleines Modell für Ihre Aufgabe reicht. Die großen Modelle der Anbieter vergleichen wir im Artikel Welches KI-Modell für welche Aufgabe, hier geht es um Modelle, die Sie selbst betreiben können.

Was ist ein Small Language Model?

Ein Small Language Model ist ein Sprachmodell mit vergleichsweise wenigen Parametern, das mit wenig Rechenleistung auskommt und deshalb auf einem einzelnen Gerät laufen kann. Parameter sind die gelernten Gewichte eines Modells. Ihre Zahl bestimmt grob, wie viel Speicher und Rechenzeit ein Modell braucht.

Eine feste Grenze gibt es nicht, die Definitionen gehen auseinander:

  • Microsoft Learn trennt in einem Konzeptartikel bei 10 Milliarden Parametern: darunter kleine, darüber große Modelle (Stand 25.06.2026).
  • IBM beschreibt SLMs in seinem Überblick mit einigen Millionen bis einigen Milliarden Parametern (Stand 02.04.2026).
  • NVIDIA Research definiert im Paper „Small Language Models are the Future of Agentic AI“ über den Einsatz: Ein SLM passt auf ein übliches Endgerät und antwortet dort schnell genug für die Anfragen eines Nutzers. Als Faustregel nennen die Autoren für 2025 die meisten Modelle unter 10 Milliarden Parametern.

In der Praxis sprechen wir von einigen hundert Millionen bis etwa 15 Milliarden Parametern. Entscheidend ist weniger die Zahl als die Frage, ob das Modell auf Hardware läuft, die Sie selbst betreiben können.

Eine Abgrenzung hilft bei Anbieterlisten: Die kleinen Modelle der großen Anbieter, die Sie nur per API nutzen, sind im Preis klein, ihre Größe veröffentlichen die Anbieter aber meist nicht, und Sie können sie nicht selbst betreiben. Mit SLM meinen wir in diesem Artikel Modelle mit offenen Gewichten.

Und wer nach „SLM im Chat“ sucht: Im Zusammenhang mit KI-Chats und Sprachmodellen ist mit SLM das Small Language Model gemeint.

Worin unterscheiden sich SLM und LLM?

Ein SLM ist spezialisiert, schnell und selbst betreibbar, ein LLM ist breit, stark im Schlussfolgern und wird meist als Dienst genutzt. Die Tabelle fasst die Unterschiede für den Betrieb zusammen.

Merkmal Small Language Model Large Language Model
Größe einige hundert Mio. bis rund 15 Mrd. Parameter zig bis hunderte Mrd. Parameter, oft nicht veröffentlicht
Hardware eine Grafikkarte, teils Laptop oder Smartphone Rechenzentrum, Zugriff meist per API
Kosten feste Kosten für Hardware und Betrieb Preis pro Token, keine Fixkosten
Latenz kurz, kein Weg über das Internet nötig abhängig von Anbieter, Last und Modell
Datenhaltung kann vollständig in Ihrer Umgebung laufen Daten gehen zum Anbieter, EU-Endpunkt wählbar
Stärken eng umrissene Aufgaben, große Mengen, offline offene Fragen, langes Schlussfolgern, Agenten
Schwächen weniger Weltwissen, schwächer bei komplexen Aufgaben Kosten bei großen Mengen, Abhängigkeit vom Anbieter

Microsoft empfiehlt kleine Modelle für klar umrissene, enge Aufgaben und große für schwierige oder explorative. IBM nennt als Grenzen kleiner Modelle geringere Leistung bei komplexen Aufgaben über mehrere Fachgebiete und begrenztes Allgemeinwissen. Das NVIDIA-Paper beziffert den Unterschied im Betrieb: Ein Modell mit 7 Milliarden Parametern zu betreiben, sei 10 bis 30 Mal günstiger in Latenz, Energie und Rechenoperationen als eines mit 70 bis 175 Milliarden.

Eine Falle steckt in einer Bauweise namens Mixture of Experts. Dabei rechnet pro Wort nur ein Teil des Modells, der Rest muss trotzdem im Speicher liegen. OpenAIs gpt-oss-20b hat 21 Milliarden Parameter, davon 3,6 Milliarden aktiv, und braucht 16 GB Speicher. Mistral Small 4 trägt „Small“ im Namen, hat aber 119 Milliarden Parameter, von denen 6,5 Milliarden aktiv sind. Für die Hardware zählt die Gesamtgröße, der Name sagt darüber nichts.

Welche Small Language Models gibt es im September 2026?

Die wichtigsten offenen kleinen Modelle kommen von Google, Qwen, IBM, Mistral, Microsoft und Meta. Die Tabelle zeigt die kleinen Varianten mit Größe, Kontextfenster (wie viel Text das Modell in einer Anfrage verarbeiten kann), Lizenz und Erscheinungsdatum.

Modell Hersteller Parameter Kontext in Tokens Lizenz erschienen
Gemma 4 E2B und E4B Google 2,3 und 4,5 Mrd. effektiv 128.000 Apache 2.0 31.03.2026
Gemma 4 12B Unified Google 12 Mrd. 256.000 Apache 2.0 03.06.2026
Qwen3.5 0.8B, 2B, 4B, 9B Qwen 0,8 bis 9 Mrd. 262.144 Apache 2.0 02.03.2026
Granite 4.2 3B und 8B IBM 3 und 8 Mrd. 128.000, erweiterbar auf 512.000 Apache 2.0 25.08.2026
Ministral 3 3B, 8B, 14B Mistral AI 3, 8 und 14 Mrd., jeweils plus 0,4 Mrd. Bild-Encoder 256.000 Apache 2.0 02.12.2025
Phi-4-reasoning-vision Microsoft 15 Mrd. 16.384 MIT 04.03.2026
Phi-4-mini Microsoft 3,8 Mrd. 128.000 MIT Februar 2025
Llama 3.2 1B und 3B Meta 1 und 3 Mrd. 128.000 Llama 3.2 Community License 25.09.2024
AFM 3 Core Apple 3 Mrd. nicht veröffentlicht nur über Apple-Plattformen 08.06.2026

Quellen: Modellkarten und Release-Seiten von Google, Qwen, IBM, Mistral, Microsoft, Meta und Apple, Stand September 2026.

Einige Hinweise zur Tabelle. Bei Gemma 4 E2B und E4B steht das E für effektive Parameter: Mit zusätzlichen Einbettungen je Schicht sind es 5,1 und 8 Milliarden. Google baut sie laut Modellkarte ausdrücklich für Laptops und Mobilgeräte. Granite 4.2, Ministral 3, Phi-4-mini und Llama 3.2 nennen Deutsch ausdrücklich unter den unterstützten Sprachen. Phi-4-reasoning-vision ist laut Microsoft vor allem auf Englisch ausgelegt. Listen zu „Small Language Models 2025“ zeigen oft noch die Vorgänger von Gemma 4, Qwen3.5 und Granite 4.2.

Metas kleinste Llama-Modelle stammen aus dem September 2024. Die Llama-4-Modelle vom April 2025 sind mit 109 Milliarden Parametern und mehr keine SLMs. Für sie gilt zudem eine Einschränkung: Laut Metas Nutzungsrichtlinie für Llama 4 werden die Rechte an den multimodalen Llama-4-Modellen weder Personen mit Wohnsitz in der EU noch Unternehmen mit Hauptsitz in der EU eingeräumt, Endnutzer fertiger Produkte sind davon ausgenommen (Stand September 2026). Dieser Artikel ist keine Rechtsberatung. Prüfen Sie die Lizenz jedes Modells vor dem Einsatz, bei Zweifeln mit Ihrer Rechtsberatung.

Apples AFM 3 Core ist ein Sonderfall. Das Modell läuft auf Apple-Geräten, App-Entwickler erreichen es laut Apple über das Foundation Models Framework, eine Swift-Schnittstelle. Für Unternehmensprozesse auf eigenen Servern ist es damit nicht gedacht.

Seed-OSS oder gpt-oss: Was taugen die mittelgroßen offenen Modelle?

Beide liegen eine Stufe über den klassischen SLMs und sind interessant, wenn ein kleines Modell nicht reicht, die Daten das Haus aber trotzdem nicht verlassen dürfen.

gpt-oss hat OpenAI am 05.08.2025 unter Apache 2.0 veröffentlicht. Die kleine Variante gpt-oss-20b kommt laut OpenAI mit 16 GB Speicher aus, die große gpt-oss-120b mit 117 Milliarden Parametern mit 80 GB. Beide verarbeiten bis zu 128.000 Tokens.

Seed-OSS-36B von ByteDance ist am 20.08.2025 erschienen, ebenfalls unter Apache 2.0. Laut Modellkarte ist es ein dichtes Modell mit 36 Milliarden Parametern und 512.000 Tokens Kontext. Die Besonderheit ist ein einstellbares Denkbudget: Sie legen fest, wie viele Tokens das Modell für Zwischenschritte verwenden darf.

Beide Modelle sind über ein Jahr alt. Inzwischen gibt es neuere Kandidaten in derselben Klasse, etwa Gemma 4 26B A4B mit 25,2 Milliarden Parametern, davon 3,8 Milliarden aktiv, oder das dichte Qwen3.8-27B vom August 2026. Welches Modell für Ihre Aufgabe gewinnt, sagt Ihnen keine Rangliste. Das entscheidet ein Vergleich auf Ihren eigenen Fällen.

Wofür taugen kleine Modelle im Unternehmen?

Kleine Modelle sind stark bei Aufgaben mit klarer Eingabe, klarer Ausgabe und großer Menge. Typische Beispiele:

  • Klassifizieren: Mails, Tickets oder Dokumente einer festen Liste von Kategorien zuordnen, dazu eine Dringlichkeit.
  • Extrahieren: Rechnungsnummer, Datum, Absender oder Vertragslaufzeit aus einem Dokument lesen und als Felder übergeben.
  • Routing: entscheiden, welche Stelle, welches Werkzeug oder welches Modell eine Anfrage bekommt.
  • Kurze Texte zusammenfassen: eine Mail, ein Gesprächsprotokoll, ein Ticketverlauf. Bei langen Vertragswerken stoßen kleine Modelle eher an Grenzen.
  • Assistent mit Wissensbasis in eigener Umgebung: Das oft gesuchte „interne GPT“ für interne Dokumente. Die Suche findet die passenden Abschnitte, das Modell formuliert nur daraus die Antwort mit Quelle. Es muss wenig wissen, aber sauber formulieren. Wie das aufgebaut ist, beschreibt der Artikel Ein Wissensassistent auf eigenen Dokumenten.
  • Teilschritte von Agenten: Das NVIDIA-Paper schlägt Systeme vor, in denen kleine Modelle die wiederkehrenden Schritte übernehmen und große Modelle nur gezielt und sparsam gerufen werden, etwa für allgemeines Schlussfolgern oder offene Dialoge.

Allen Aufgaben ist gemeinsam: Ein Fehler fällt auf. Ist sich das Modell unsicher, geht der Fall in eine Prüfliste, und ein Mensch entscheidet. Das gilt bei uns unabhängig von der Modellgröße.

Wann bleibt ein großes Modell nötig?

Ein großes Modell ist nötig, wenn die Aufgabe offen ist, mehrere Schritte verlangt oder viel Wissen voraussetzt. Dazu gehören Agenten, die selbst nachschlagen, abgleichen und Vorgänge vorbereiten, Fragen, die Informationen aus vielen Dokumenten verknüpfen, und Aufgaben mit langem Schlussfolgern. Laut Microsoft kommen große Modelle zudem besser mit verrauschten oder unvollständigen Eingaben zurecht.

Die beste Lösung ist deshalb oft keine Entweder-oder-Entscheidung, sondern eine Aufteilung. Ein Router, also eine vorgeschaltete Einordnung, schickt einfache Fälle an das kleine Modell und schwere an das große.

Routing zwischen kleinem und großem SprachmodellEine Anfrage, etwa ein Ticket, eine Mail oder eine Frage, geht zuerst an eine Einordnung. Sie besteht aus Regeln oder einem kleinen Modell und prüft die Schwierigkeit. Einfache, klar umrissene Fälle gehen an ein kleines Modell in Ihrer eigenen Umgebung, das klassifiziert, extrahiert, weiterleitet und kurze Texte verarbeitet. Schwere Fälle gehen an ein großes Modell über einen EU-Endpunkt, zum Beispiel Bedrock EU, Google eu, Azure Datenzone EU oder Mistral. Ist sich das kleine Modell unsicher, reicht es den Fall an das große Modell weiter. Beide Wege enden in einem Ergebnis mit Prüfregeln und Freigabeschritt. Die Schwellen und die Aufteilung legt ein Testset aus Ihren eigenen Fällen fest.EINFACHES KLEIN UND LOKAL, SCHWERES GROSS UND IN DER EUAnfrageTicket, Mail,FrageEinordnungRegeln oderkleines Modellprüft SchwierigkeiteinfachschwerKleines Modellin Ihrer UmgebungKlassifizieren, Extrahieren,Routing, kurze Texteunsicher: weiterGroßes Modellüber einen EU-EndpunktBedrock EU, Google eu,Azure Datenzone EU, MistralErgebnisPrüfregeln undFreigabeschrittSchwellen und Aufteilung legt ein Testset aus Ihren eigenen Fällen fest
Routing nach Schwierigkeit: Das kleine Modell übernimmt die Menge in Ihrer Umgebung, das große Modell die schweren Fälle über einen EU-Endpunkt. Stand September 2026.

So bleibt die Masse der Fälle im Haus und kostet wenig. Nur der Teil, der das große Modell wirklich braucht, geht nach außen, und dort über einen Weg mit EU-Verarbeitung, wenn personenbezogene Daten im Spiel sind.

Wie betreibt man ein SLM in der eigenen Umgebung?

Ein SLM läuft auf einem Server mit Grafikkarte in Ihrem Rechenzentrum, in Ihrer eigenen Cloud oder für Einzelplätze auf einem Laptop. Die Herstellerangaben geben eine grobe Orientierung: Ministral 3 mit 8 Milliarden Parametern passt laut Mistral in 12 GB Grafikspeicher, die Variante mit 14 Milliarden in 24 GB, jeweils im Format FP8. Für gpt-oss-20b nennt OpenAI 16 GB. Für Mistral Small 4 verteilt der empfohlene vLLM-Startbefehl in der Modellkarte das Modell auf zwei Grafikkarten.

Den Speicherbedarf senkt die Quantisierung. Dabei werden die Gewichte mit geringerer Genauigkeit gespeichert, etwa mit 8 oder 4 Bit statt 16. Das spart Speicher und kann Qualität kosten, wie viel, hängt vom Modell ab. Mistral schreibt zu Ministral 3 ausdrücklich, dass weitere Quantisierung den Bedarf unter die genannten Werte drückt. Google bietet für Gemma 4 Varianten an, die schon im Training auf die Quantisierung vorbereitet wurden (Quantization-Aware Training). Laut Modellkarte bleibt die Qualität dabei ähnlich wie im Original, die 4-Bit-Fassung von Gemma 4 12B ist 6,98 GB groß.

Für den Betrieb gibt es zwei verbreitete Werkzeuge:

  • Ollama führt offene Modelle auf dem eigenen Rechner aus und eignet sich gut für Tests und Einzelplätze. Achtung: Ollama bietet laut seiner Dokumentation auch Cloud-Modelle an, erkennbar am Zusatz „cloud“ im Modellnamen. Diese laufen auf Ollamas Infrastruktur, nicht bei Ihnen. Wer „lokal“ zusagt, muss das in der Konfiguration ausschließen.
  • vLLM ist laut Projektbeschreibung eine Bibliothek für schnelle Inferenz und Bereitstellung. Sie verarbeitet viele Anfragen parallel, stellt eine OpenAI-kompatible Schnittstelle bereit, unterstützt Quantisierungsformate wie FP8, INT4, GPTQ, AWQ und GGUF und kann mehrere feinabgestimmte Varianten eines Modells gleichzeitig bedienen. Das ist der Weg, wenn eine Lösung für ein ganzes Team laufen soll.

Die OpenAI-kompatible Schnittstelle erleichtert den Wechsel zwischen einem Modell in Ihrer Umgebung und einem beim Anbieter, im Test wie später im Betrieb.

Was bedeutet ein SLM für Datenschutz und Kosten?

Ein kleines Modell in Ihrer Umgebung verarbeitet die Daten dort, wo sie ohnehin liegen. Fragen nach Speicherort oder Training beim Modellanbieter entfallen. Die übrigen Pflichten bleiben: Zugriffsrechte, Protokolle, ein Löschkonzept und die Absicherung des Servers.

Geht ein Teil der Fälle an ein großes Modell, gilt bei uns die Regel: Personenbezogene Daten gehören auf einen EU-Endpunkt, etwa Claude über Amazon Bedrock EU oder Google Cloud mit dem Endpunkt „eu“, GPT über die Azure-Datenzone EU oder Mistral. Die direkte Claude API bietet laut Anthropic nur die Optionen global und USA, eine EU-Option gibt es dort nicht (Stand September 2026). Die Wege im Einzelnen vergleicht der Artikel Azure, Bedrock, Vertex oder Direktzugang.

Bei den Kosten tauscht ein SLM variable gegen feste Kosten. Über eine API zahlen Sie pro Token. Im eigenen Betrieb zahlen Sie Hardware oder gemietete Grafikkarten, Strom, Updates und Überwachung, egal wie viele Anfragen kommen. Bei kleinen Mengen ist die API deshalb meist günstiger. Im Artikel Welches KI-Modell für welche Aufgabe rechnen wir einen Wissensassistenten mit 4.000 Fragen im Monat nach Listenpreis auf 30 bis 80 US-Dollar Modellkosten. Dafür lohnt sich kein eigener Server.

Ein SLM rechnet sich eher, wenn die Mengen groß sind, wenn Daten das Haus nicht verlassen dürfen oder wenn die Lösung ohne Internetverbindung laufen muss. Oft ist deshalb die Datenklasse das stärkere Argument, nicht der Preis.

Wie finden Sie heraus, ob ein kleines Modell reicht?

Mit einem Testset aus Ihren eigenen Fällen, nicht mit Benchmarks. Öffentliche Ranglisten messen allgemeine Fähigkeiten. Ob ein Modell Ihre Kategorien trifft, Ihre Formulare liest und mit Ihren Abkürzungen umgeht, zeigen sie nicht. So gehen wir vor:

  1. Aufgabe eng fassen: Was genau soll das Modell liefern, in welchem Format, mit welchen erlaubten Werten?
  2. Echte Fälle sammeln: meist 20 bis 50, bei Wissensassistenten 50 bis 100, mit der richtigen Lösung dazu. Schwierige und seltene Fälle gehören ausdrücklich hinein.
  3. Klein gegen groß vergleichen: dasselbe Testset mit einem SLM in Ihrer Umgebung und einem großen Modell über einen EU-Endpunkt.
  4. Schwellen festlegen: Ab welcher Sicherheit darf das kleine Modell allein entscheiden, wann geht der Fall weiter an das große Modell oder in die Prüfliste?
  5. Bei jedem Modellwechsel wiederholen: Neue Versionen erscheinen laufend, allein Gemma 4 kam 2026 in drei Schritten. Das Testset zeigt, ob ein Wechsel etwas bringt.

Wie Testset, Metriken und Abnahmeprotokoll im Detail aufgebaut sind, steht im Artikel Evaluation vor dem Go-live.

Reicht das kleine Modell nicht, nehmen Sie ein größeres über einen EU-Endpunkt oder eines der mittelgroßen offenen Modelle. Reicht es, haben Sie eine Lösung, die schnell antwortet, wenig kostet und Ihre Daten im Haus behält. Beides bauen wir als Katalog-Lösung oder individuell.

Häufige Fragen

Was bedeutet SLM?

SLM steht für Small Language Model, also ein kleines Sprachmodell. Eine feste Grenze gibt es nicht. Microsoft Learn zieht sie bei 10 Milliarden Parametern, IBM spricht von einigen Millionen bis einigen Milliarden. Gemeint ist ein Modell, das auf einer Grafikkarte, einem Laptop oder einem Smartphone läuft und eng umrissene Aufgaben schnell erledigt.

Kann ich ein internes GPT für eigene Dokumente mit einem kleinen Modell betreiben?

Ja, wenn das System vorher die passenden Abschnitte sucht und das Modell nur daraus antwortet. Dann muss es wenig wissen, aber sauber formulieren und die Quelle nennen. Ob ein kleines Modell dafür reicht, zeigt ein Test mit 50 bis 100 echten Fragen. Bei Fragen, die viele Dokumente verknüpfen, ist ein großes Modell oft besser.

Welche Hardware braucht ein Small Language Model?

Laut Mistral passt Ministral 3 mit 8 Milliarden Parametern in 12 GB Grafikspeicher, die Variante mit 14 Milliarden in 24 GB, jeweils im Format FP8. OpenAI nennt für gpt-oss-20b 16 GB Speicher. Googles kleinste Gemma-4-Modelle sind für Laptops und Smartphones gebaut. Für viele Nutzer gleichzeitig braucht es einen Server mit Grafikkarte.

Sind Small Language Models kostenlos?

Die Lizenz ist bei vielen Modellen kostenlos, etwa Apache 2.0 bei Gemma 4, Qwen3.5, Granite 4.2 und Ministral 3 oder MIT bei Phi-4. Der Betrieb kostet trotzdem: Hardware oder gemietete Grafikkarten, Strom, Updates und jemanden, der das System überwacht. Bei kleinen Mengen ist ein Modell über eine API oft günstiger.

Was ist besser, Seed-OSS oder gpt-oss?

Das hängt von der Aufgabe ab. Seed-OSS-36B ist ein dichtes Modell mit 36 Milliarden Parametern und 512.000 Tokens Kontext, gpt-oss-20b braucht nur 16 GB Speicher bei 128.000 Tokens. Beide stehen unter Apache 2.0 und sind im August 2025 erschienen. Entscheiden sollte ein Test mit Ihren eigenen Fällen, nicht eine Rangliste.

Quellen

  1. 1 Small Language Models are the Future of Agentic AI (arXiv:2506.02153) , NVIDIA Research, arXiv, 15.09.2025
  2. 2 Concepts: Small and large language models , Microsoft Learn, 25.06.2026
  3. 3 What are small language models? , IBM Think, 02.04.2026
  4. 4 Gemma releases , Google AI for Developers, 28.09.2026
  5. 5 Gemma 4 model card , Google AI for Developers, 30.07.2026
  6. 6 Qwen3.5-9B, Modellkarte , Qwen, Hugging Face, 28.09.2026
  7. 7 Granite 4.2 8B, Modellkarte , IBM Granite, Hugging Face, 25.08.2026
  8. 8 Introducing Mistral 3 , Mistral AI, 02.12.2025
  9. 9 Ministral 3 14B Instruct 2512, Modellkarte , Mistral AI, Hugging Face, 28.09.2026
  10. 10 Mistral Small 4 119B 2603, Modellkarte , Mistral AI, Hugging Face, 28.09.2026
  11. 11 Phi-4-mini-instruct und Phi-4-reasoning-vision-15B, Modellkarten , Microsoft, Hugging Face, 04.03.2026
  12. 12 Introducing gpt-oss , OpenAI, 05.08.2025
  13. 13 Seed-OSS-36B-Instruct, Modellkarte , ByteDance Seed, Hugging Face, 20.08.2025
  14. 14 Llama 4 Acceptable Use Policy , Meta, 28.09.2026
  15. 15 Introducing the Third Generation of Apple's Foundation Models , Apple Machine Learning Research, 08.06.2026
  16. 16 Gemma 4 12B IT QAT Q4_0 GGUF, Modellkarte , Google, Hugging Face, 28.09.2026
  17. 17 WWDC26 Apple Intelligence guide , Apple Developer, 28.09.2026
  18. 18 vLLM, README , vLLM Project, GitHub, 28.09.2026
  19. 19 Cloud models , Ollama Docs, 28.09.2026
  20. 20 Data residency , Anthropic, Claude Platform Docs, 28.09.2026

Prüfhinweis: Zum 31.12.2026 prüfen: neue Versionen von Gemma, Qwen, Granite, Ministral, Phi, gpt-oss, Seed-OSS und Llama samt Lizenz, Größe und Kontextlänge; Hardwareangaben der Modellkarten; Metas Nutzungsrichtlinie für multimodale Modelle in der EU; Bedingungen der Ollama-Cloud-Modelle; EU-Option der Claude API.

Passende Lösungen aus dem Katalog

Service Klasse M

Support-Tickets klassifizieren

Jedes neue Ticket bekommt automatisch Kategorie und Dringlichkeit, dazu eine interne Notiz mit passenden Artikeln aus Ihrer Wissensbasis.

  • Zendesk, Freshdesk oder Jira Service Management
  • Hilfeartikel im Help Center oder in Confluence
Preis
ab 1.490 €
Lieferzeit
5 bis 10 Werktage

Wissen Klasse XL

Interner Wissensassistent

Ihr Team fragt in Teams, Slack oder im Browser und bekommt Antworten aus Ihren Dokumenten, mit Quelle und nur aus dem, was es sehen darf.

  • SharePoint oder Google Drive
  • Microsoft Teams oder Slack
Preis
ab 4.900 €
Lieferzeit
3 bis 5 Wochen

Verwaltung Klasse S

Dokumente automatisch benennen und ablegen

Die Lösung erkennt eingehende Dateien, gibt ihnen einen einheitlichen Namen und legt sie in den richtigen Ordner Ihrer Ablage.

  • Google Drive, SharePoint oder OneDrive
Preis
ab 990 €
Lieferzeit
5 Werktage

Nächster Schritt

Angebot innerhalb eines Werktags

Beschreiben Sie in zwei Sätzen, was automatisch laufen soll. Sie bekommen ein Festpreisangebot mit Lieferzeit, oder eine ehrliche Antwort, wenn ein Werkzeug von der Stange reicht.

Zwei, drei Sätze reichen. Welche Systeme Sie nutzen, hilft uns beim Angebot.

Antwort mit Angebot innerhalb eines Werktags. Netto, für Unternehmen.

Angebot anfordern