Back openDesk Edu for a sovereign, open-source education — every vote counts.
Vote nowSave products you love by clicking the heart icon.
Vollständiges Paper herunterladen (PDF)
Das Deployment großer Sprachmodelle auf Consumer-Hardware erfordert eine aggressive Speicheroptimierung, die eine Balance zwischen Kompression und Generierungsqualität herstellt. Diese Studie präsentiert eine empirische Evaluierung von layer-aware Quantisierungsstrategien für die Qwen3.5-Modellfamilie auf Consumer-GPUs (NVIDIA RTX 4080 Laptop, 12GB) und Edge-Servern (DGX Spark, 128GB).
Vier praktische Deployment-Szenarien werden abgedeckt:
TQ3_0 ist eine llama.cpp-Implementierung basierend auf Googles TurboQuant (Zandieh et al., 2025). Der Kernansatz von TurboQuant besteht darin, dass die Anwendung einer Zufallsrotation auf hochdimensionale Vektoren eine konzentrierte Beta-Verteilung auf jeder Koordinate induziert (konvergiert in hohen Dimensionen gegen N(0, 1/d)), wodurch die Koordinaten nahezu unabhängig werden und somit einer optimalen skalaren Quantisierung pro Koordinate (Lloyd-Max) zugänglich sind. TQ3_0 approximiert diese Zufallsrotation über eine strukturierte Walsh-Hadamard-Transformation mit zufälligen Vorzeichenumkehrungen — O(d log d) statt O(d²) für eine dichte Rotation — kombiniert mit einem festen 8-Einträge-Codebook, das für die Effizienz von GPU-Kerneln optimiert ist.
Dies führt zu einer 4,9-fachen Reduktion des KV-Cache-Speichers (52 Bytes vs. 256 Bytes pro Block), wobei der Durchsatz über Kontextlängen von 2K bis 200K von 16,00 auf 12,14 tok/s sinkt. Dies ermöglicht den Betrieb von Modellen mit über 200K Kontext auf Consumer-GPUs, die ansonsten einen Out-of-Memory-Fehler verursachen würden.
Eine natürliche Frage ist, warum eine 3-Bit-Kompression die Output-Qualität überhaupt bewahrt. Die entscheidenden Mechanismen sind:
KV-Cache-Fehler Attention-Verzerrung: Quantisierungsfehler in K/V-Vektoren verzerren die Attention-Scores. Da Softmax nichtlinear ist, können kleine Fehler zu unverhältnismäßigen Verschiebungen führen, wenn die Attention-Scores eng beieinander liegen. Die Zufallsrotation stellt jedoch sicher, dass dieser Fehler isotrop ist — also gleichmäßig über alle Koordinaten verteilt statt in Ausreißer-Dimensionen konzentriert —, was eine katastrophale Fehlallokation der Attention abmildert.
Layer-weise Propagation: In einem Transformer mit L Layern könnten sich Fehler aufsummieren. In der Praxis skaliert LayerNorm die Aktivierungen auf eine Einheitsvarianz (unterdrückt Magnitude Drift), während Residual-Connections es dem ursprünglichen Signal ermöglichen, degradierte Layer zu umgehen, was eine implizite Fehlerdämpfung bewirkt.
L2-Fehler vs. Output-Qualität: MSE (L2-Norm) ist ein nützlicher, aber unvollkommener Proxy. TurboQuant berichtet von einer MSE-Verzerrung bei 3 Bit pro Koordinate, was empirisch einer vernachlässigbaren Verschlechterung der Perplexity entspricht. Zwei Konfigurationen mit identischem L2-Fehler können jedoch eine unterschiedliche Qualität liefern, je nachdem, wo im Netzwerk der Fehler auftritt — Attention-Layer sind im Allgemeinen empfindlicher als MLP-Layer.
Durch die Konvertierung von 1.085 Tensoren in FP8-Präzision bei Qwen3.5-122B-A10B erreicht die hybride Quantisierung einen Checkpoint von 74,19 GB mit einer Durchsatzsteigerung von 49 %. Die Strategie passt die Präzision an den Layer-Typ an: Attention-Projektionen behalten eine höhere Präzision, während MLP-Layer FP8 verwenden. Dieser Ansatz vermeidet zudem FlashInfer NVFP4-Abstürze auf der SM121-Architektur.
Die theoretische Schranke des Quantisierungsfehlers hängt von der Hessian-Konditionszahl ab: , wobei und die größten und kleinsten Eigenwerte der Hessian-Matrix sind. Dies ist eine lose Worst-Case-Schranke; in der Praxis erreicht die spaltenweise Optimierung von GPTQ wesentlich geringere Fehler, indem sie sich an die lokale Krümmung anpasst. Empirische Messungen zeigen im Bereich für Expert-Layer bei 4-Bit-Präzision, was zu einem Quantisierungsfehler von 0,4 % bis 4 % führt.
Benchmarks auf Qwen3.5-35B-A3B mit einer 12GB-GPU zeigen, dass 48K Tokens der Sweet Spot für Coding-Aufgaben bei 17,41 tok/s sind. Hierbei wird das Verständnis der Codebasis gegen Durchsatzverluste abgewogen, die jenseits von 65K Tokens überproportional zunehmen.
Auf dem DGX Spark mit 128GB Unified Memory ermöglicht die Nutzung rekursiver Layer für weitreichende Abhängigkeiten Kontextfenster von über 417K, was Möglichkeiten für groß angelegte Dokumentanalysen eröffnet.
Basierend auf den empirischen Ergebnissen:
Die Evaluierung beschränkt sich auf die Qwen3.5-Modellfamilie. Die Ergebnisse können für Llama, Mistral oder andere Architekturen abweichen. Perplexity-Messungen sind nicht enthalten, wodurch Qualitätsaussagen von früheren Arbeiten abhängen. Der Sweet Spot von 48K Kontext wurde von einem einzelnen Modell auf einer einzelnen GPU abgeleitet und sollte nicht als universelle Empfehlung betrachtet werden.
@techreport{weiss2026quantization,
title={Applied Quantization Strategies for Consumer LLM Deployment: Layer-Aware Weight and KV Cache Compression},
author={Weiss, Tobias},
year={2026},
note={Technical Report, llama.cpp implementation of TurboQuant}
}