Start KI-Lösungen Fertige Lösungen Peers & Simulation RAG & Retrieval Use Cases Frameworks Blog English Kontakt
Zurück zum Blog

Small Language Models: Wenn 3 bis 9 Milliarden Parameter genügen

Phi-3 und Gemma 2 zeigen: Modelle mit 3 bis 9 Milliarden Parametern tragen einen großen Teil des Produktions-Traffics zu einem Bruchteil der Frontier-Kosten. Wir untersuchen, welche Aufgaben kleine Modelle abdecken, was On-Premises- und Edge-Betrieb erfordert, wie Routing einfache Anfragen auf günstige Modelle lenkt und wie sich Qualität pro Euro messen lässt.

Frontier-Modelle als teurer Standard

2023 war die Standardarchitektur für Sprachfeatures einfach: jede Anfrage an das größte verfügbare Modell. Dieser Standard ist in drei Währungen teuer. Geld: Frontier-APIs rechnen pro Token zu Premiumpreisen ab. Latenz: Große Modelle antworten in Sekunden, nicht in Millisekunden. Daten: Jeder Prompt verlässt Ihre Infrastruktur. In den Produktionssystemen, die wir bei Blue IT Systems betreiben, besteht ein großer Teil der Anfragen aus Klassifikation, Extraktion oder kurzer Zusammenfassung — Aufgaben weit unterhalb der Fähigkeitsgrenze eines Frontier-Modells. Frontier-Preise für diesen Traffic sind eine Gewohnheit, keine Entscheidung.

2024 hat die Rechnung verändert. Microsoft veröffentlichte Phi-3 im April, Google Gemma 2 im Juni. Beide sind offene Modellfamilien im Bereich von 2 bis 27 Milliarden Parametern, die auf einer einzelnen GPU laufen — die kleinsten auf einem Telefon. Die Frage ist nicht mehr, ob kleine Modelle gut sind. Sondern welchen Traffic sie tragen können und wie man ihn dorthin leitet.

Anfrage Routerschwierigkeit Kleines Modellschnell · günstig Reasoning-Modelllangsam · stark qualität wo nötigkosten wo nicht
Eine Anfrage kommt an — der Router stuft die Schwierigkeit ein. 1/4

Was kleine Modelle 2024 leisten

Phi-3-mini hat 3,8 Milliarden Parameter und wurde auf 3,3 Billionen Tokens aus stark gefilterten Webdaten und synthetischen Daten trainiert. Microsoft berichtet 69 % auf MMLU und 8,38 auf MT-Bench — vergleichbar mit Mixtral 8x7B und GPT-3.5, Modellen mit einem Vielfachen der Größe. Gemma 2 9B wurde per Knowledge Distillation von einem größeren Lehrermodell auf 8 Billionen Tokens trainiert und erreicht 71,3 % auf MMLU, vor Llama 3 8B. Der Mechanismus ist in beiden Fällen derselbe: Bessere Trainingsdaten und Distillation ersetzen Parameter.

Die Tabelle zeigt Herstellerangaben. Sie stammen aus unterschiedlichen Evaluationspipelines und sind Richtwerte, nicht direkt vergleichbar. GPT-4o mini ist als gehosteter Referenzpunkt aufgeführt: höherer Score, aber geschlossene Gewichte, und jede Anfrage verlässt Ihre Infrastruktur. Benchmark-Werte sagen zudem wenig über Ihre konkrete Aufgabe; ein eigenes Evaluationsset mit einigen hundert Beispielen sagt mehr.

ModellParameterReleaseMMLU (5-shot)Kontext
Phi-3-mini3,8 Mrd.Apr 202469 %4K / 128K
Phi-3-small7 Mrd.Mai 202475 %8K / 128K
Gemma 2 9B9 Mrd.Jun 202471,3 %8K
GPT-4o mini (gehostete Referenz)nicht publiziertJul 202482 %128K

Wo 3 bis 9 Milliarden Parameter genügen

Kleine Modelle genügen dort, wo Sprachkompetenz wichtiger ist als Weltwissen: Intent-Klassifikation, Entitäten- und Feldextraktion, kurze Zusammenfassungen, Umformulierung, strukturierte Ausgaben wie JSON und die Beantwortung von Fragen über per Retrieval bereitgestellten Kontext. In einer RAG-Pipeline liefert der Retriever die Fakten; das Modell muss nur lesen, auswählen und formulieren. Genau das ist das Profil eines Modells mit 3 bis 9 Milliarden Parametern — und es deckt einen überraschend großen Teil typischer Unternehmens-Workloads ab.

Für alles andere genügen sie nicht. Kleine Parameterbudgets speichern weniger Faktenwissen — der Phi-3-Report nennt selbst schwache TriviaQA-Ergebnisse und empfiehlt Suchanbindung. Mehrschrittiges Schließen degradiert schneller als bei großen Modellen. Die Qualität außerhalb des Englischen ist dünner. Und lange agentische Ketten verstärken die Fehlerrate pro Schritt. Benennen Sie das offen im Design-Review: Ein kleines Modell ist eine Komponente mit engem Vertrag, kein genereller Ersatz.

On-Premises- und Edge-Betrieb

Offene Gewichte ermöglichen Deployments, die API-Modelle ausschließen. Unter DSGVO und branchenspezifischen Regeln dürfen viele unserer Kunden keine Dokumente an eine US-gehostete API senden. Ein 4-Bit-quantisiertes Phi-3-mini belegt rund 2,3 GB und läuft laut Microsofts Report mit über 12 Tokens pro Sekunde auf einem iPhone 14. Gemma 2 9B passt auf eine einzelne Consumer-GPU mit 24 GB; die 27B-Variante läuft auf einer H100. Das Tooling ist ausgereift: llama.cpp, Ollama, ONNX Runtime und vLLM decken alles vom Laptop bis zum Server ab.

Der Preis ist operativ. Modell-Updates, Sicherheitspatches, Evaluation und Kapazitätsplanung liegen bei Ihnen. Eine gehostete API verbessert sich stillschweigend; Ihr On-Premises-Modell nicht. Kalkulieren Sie das in Euro und Personal ein — Self-Hosting ist eine Produktentscheidung, keine reine Infrastrukturentscheidung.

Routing einfacher Anfragen auf kleine Modelle

Ein Router platziert jede Anfrage: Einfacher Traffic geht an das kleine Modell, schwerer an das große. RouteLLM von LMSYS (Juli 2024) trainierte Router auf Präferenzdaten der Chatbot Arena und berichtet 95 % der GPT-4-Qualität auf MT-Bench bei Kostenreduktionen von bis zu 85 % gegenüber reiner GPT-4-Nutzung. Framework und Datensätze sind Open Source.

In Produktion sehen wir meist einfachere Varianten: regelbasiertes Routing nach Endpunkt oder Aufgabentyp sowie Kaskaden, die zuerst das kleine Modell versuchen und bei niedriger Konfidenz oder fehlgeschlagener Validierung eskalieren. Zwei Einschränkungen. Der Router ist selbst ein Modell und routet falsch; er braucht ein eigenes Evaluationsset und Monitoring. Und publizierte Einsparungen übertragen sich nicht — sie hängen vollständig von Ihrem Traffic-Mix ab. Messen Sie den Anteil einfacher Anfragen, bevor Sie Zahlen versprechen.

Qualität pro Euro

Gehostete kleine Modelle setzen den Referenzpreis. GPT-4o mini kostet seit Juli 2024 0,15 US-Dollar pro Million Input-Tokens und 0,60 US-Dollar pro Million Output-Tokens — eine Größenordnung unter Frontier-Preisen. Jedes Self-Hosted-Deployment muss diesen Preis inklusive Hardware, Energie und Engineering-Zeit schlagen. Bei niedrigem oder stark schwankendem Volumen gelingt das selten: Eine gemietete GPU im Leerlauf ist teurer als jeder API-Aufruf, den sie nie macht.

Self-Hosting gewinnt unter drei Bedingungen: konstant hohe Auslastung, Datenresidenz-Anforderungen, die externe APIs ausschließen, oder harte Latenzbudgets. Die entscheidende Metrik ist Qualität pro Euro pro Aufgabe — gemessen auf Ihrem eigenen Evaluationsset, nicht auf MMLU. Wir haben Kostenreduktionen um den Faktor 10 gesehen, wo das Traffic-Profil passt — und keine, wo es nicht passt.

Ausblick im Oktober 2024

Drei Entwicklungen erscheinen aus heutiger Sicht robust. Erstens: Distillation-Pipelines werden Frontier-Fähigkeiten weiter mit sechs bis zwölf Monaten Verzögerung in kleine Modelle komprimieren; die Release-Kadenz von Phi und Gemma 2024 zeigt, dass das inzwischen Routine ist. Zweitens: Consumer-Hardware wird für lokale Inferenz gebaut — Copilot+-PCs werden mit NPUs ausgeliefert, und Apple hat für Apple Intelligence ein On-Device-Modell mit rund 3 Milliarden Parametern angekündigt.

Drittens erwarten wir, dass heterogene Modellflotten — ein Frontier-Modell, mehrere kleine Spezialisten, ein Router — 2025 zur Standard-Produktionsarchitektur werden. Wenn das eintrifft, differenzieren sich Engineering-Teams über Routing-Qualität und Evaluationsinfrastruktur, nicht über die Modellwahl. Das Frontier-Modell wird zum Eskalationspfad, nicht zum Standard.

Quellen