22. September 2026

LLM-Quantisierung bringt große KI-Modelle auf Consumer-Hardware

Kurz gesagt: Starke LLM-Quantisierung kann den Speicherbedarf großer Sprachmodelle drastisch reduzieren. Prism ML bringt mit Bonsai ein 27B-Modell auf bis zu 1,7 Bit pro Gewicht und damit auf 7,2 GByte Modellgröße. Auf einer RTX 4070 Super erreicht es rund 50 Token pro Sekunde. Auf Smartphones und CPUs bleibt die Ausführung dagegen langsam, zudem zeigte das Modell im Deutschen deutliche sprachliche Schwächen.

Große Sprachmodelle benötigen enorme Mengen Speicher. Quantisierung soll diesen Bedarf verringern, indem Modellgewichte mit geringerer Genauigkeit gespeichert werden. Doch wie weit lässt sich dieser Ansatz treiben, bevor Antwortqualität und Geschwindigkeit zu stark leiden?

Bei sehr großen LLMs ist Quantisierung längst Standard. Während früher häufig mit 32-Bit-Gleitkommazahlen trainiert und mit FP16-Gewichten ausgeliefert wurde, kommen heute unter anderem FP8 sowie verschiedene 4-Bit-Formate zum Einsatz. Dazu gehören klassische Q4-Verfahren ebenso wie Nvidias NVFP4 oder der offene Standard MXFP4.

Je größer ein Modell ist, desto geringer können die Qualitätseinbußen durch Quantisierung ausfallen. Bei Modellen mit 8 bis 12 Milliarden Parametern sind sie noch deutlich wahrnehmbar. In der Größenordnung von 100 Milliarden Parametern liegen sie laut Ausgangsmaterial meist unter einem Prozent. Bei Modellen mit 300 Milliarden Parametern und mehr kann eine Reduktion bis auf 4 Bit erfolgen, ohne dass sich die Antwortqualität noch messbar verschlechtert.

Damit entsteht ein interessanter Effekt: Auf begrenzter Hardware kann ein größeres quantisiertes Modell sinnvoller sein als ein kleineres Modell mit FP16-Genauigkeit. Eine Grafikkarte mit 12 GByte VRAM kann in FP16 theoretisch weniger als sechs Milliarden Parameter aufnehmen. Da zusätzlich Speicher für den KV-Cache benötigt wird, sind praktisch eher Modelle um 4B realistisch. Mit 4-Bit-Quantisierung lassen sich dagegen Modelle bis ungefähr 20B betreiben.

Bonsai geht deutlich unter vier Bit

Noch stärkere Verfahren versuchen, den Speicherbedarf weiter zu drücken. Microsoft sorgte 2025 mit BitNet b1.58 für Aufmerksamkeit. Das Verfahren benötigt durchschnittlich nur 1,58 Bit pro Parameter, indem unterschiedliche Gewichte mit verschieden hoher Genauigkeit gespeichert werden.

Prism ML verfolgt mit seiner Bonsai-Modellfamilie einen ähnlichen Ansatz. Ein 27B-Modell wie Qwen 3.6 soll damit auf Consumer-Geräten betrieben werden können und laut Anbieter mit mindestens 4 GByte RAM auskommen. Notwendig ist dafür eine angepasste Variante von llama.cpp.

In einem Test unter Ubuntu belegte die sogenannte Ternary-Version mit durchschnittlich 1,7 Bit pro Gewicht nur noch 7,2 GByte statt 54 GByte in FP16. Auf einer Nvidia RTX 4070 Super mit 12 GByte VRAM erzeugte das Modell rund 50 Token pro Sekunde.

Für normalen Chat-Betrieb ist das bereits komfortabel. Ab ungefähr 30 Token pro Sekunde wirkt die Textausgabe praktisch verzögerungsfrei. Im Reasoning-Betrieb sind höhere Geschwindigkeiten wichtiger, weil das Modell zunächst interne Token erzeugt. Bei 50 bis 60 Token pro Sekunde entstehen für 1.000 solcher Thinking-Token ungefähr 17 bis 20 Sekunden Wartezeit.

Der geringe Speicherbedarf hat allerdings seinen Preis. Inhaltlich lieferte Bonsai 27B im Test brauchbare Antworten, bei deutscher Rechtschreibung, Wortwahl und Grammatik traten jedoch deutliche Schwächen auf. Das ursprüngliche Modell zeigte diese Probleme nicht.

Smartphone und CPU bleiben der Engpass

Dass ein Modell in den Arbeitsspeicher passt, bedeutet noch nicht, dass es dort sinnvoll nutzbar ist. Auf einem Asus Zenfone 9 mit 8 GByte RAM lag die Geschwindigkeit gefühlt nur bei etwa zwei Token pro Sekunde. Auch kleinere Varianten mit 8B oder 4B Parametern änderten daran wenig.

Ähnlich sah es auf einem Intel Core i7-14700K aus. Trotz 20 Kernen und 28 Threads erreichte der reine CPU-Betrieb lediglich etwa zwei bis drei Token pro Sekunde.

Wie extrem sich Modelle komprimieren lassen, zeigt Colibri. Die zugehörige Laufzeitumgebung soll ein stark quantisiertes GLM 5.2 mit 744 Milliarden Parametern ohne GPU auf einem System mit 32 GByte RAM ausführen können. Technisch scheint das möglich zu sein, bei rund 0,3 Token pro Sekunde würden 1.000 Reasoning-Token jedoch fast eine Stunde benötigen.

Starke LLM-Quantisierung verschiebt damit die Grenzen lokaler KI deutlich. Entscheidend bleibt aber die gesamte Kombination aus Speicherbedarf, Rechenleistung, Geschwindigkeit und erhaltener Ausgabequalität. Ein Modell, das auf Consumer-Hardware geladen werden kann, ist noch nicht automatisch für den produktiven Einsatz geeignet.

Der Newsletter Beratung-KI greift regelmäßig Entwicklungen rund um lokale KI, Sprachmodelle und neue technische Ansätze auf und ordnet deren praktische Bedeutung für den Einsatz von KI ein.

Effizienz durch Innovation: Teile der textlichen und visuellen Ausgestaltung dieser Seite wurden durch generative KI-Systeme unterstützt.


Wir führen seit Jahren Beratung zu KI (Künstlicher Intelligenz) für KMUs (Klein- und Mittelständische Unternehmen) erfolgreich durch.

Mehr zu aktuellen Themen der #KI (Künstlichen Intelligenz) oder zu

Ihrem individuellen, optimalen "KI-Masterplan" für Ihr Unternehmen finden Sie in unserem Newsletter.

Abonnieren Sie den Newsletter hier:


Tags


Das könnte Sie auch interessieren

Abonnieren Sie jetzt unseren Newsletter!

>