Hero Image full

LLM Quantization

7 min read
Content

Wat is LLM Quantization?

LLM quantization is het proces van de gewichten van een taalmodel opslaan met lagere numerieke precisie, bijvoorbeeld 4-bit-integers in plaats van 16-bit-floats, zodat het model minder geheugen nodig heeft en sneller draait. Goed gedaan verlaagt het hardwarevereisten met de helft tot driekwart terwijl het maar een klein beetje outputkwaliteit verliest.

De belangrijkste punten

  • Kwantisering is de hoofdreden dat capabele modellen op laptops en enkele GPU's draaien: een 4-bit-versie heeft ongeveer een kwart van het geheugen van het 16-bit-origineel nodig.
  • Kwaliteitsverlies is reëel maar meestal klein tot aan 4-bit; daaronder wordt verslechtering merkbaar, vooral bij redeneren en code.
  • Dezelfde modelnaam op verschillende kwantiseringsniveaus kan zich anders gedragen, wat ertoe doet wanneer een lokaal model een coding-agent aandrijft.
  • API-gebruikers zien kwantisering meestal nooit, maar self-hosters kiezen een niveau bij elke implementatie, en het is de grootste enkele kostenhendel die ze beheersen.

Hoe het werkt

De gewichten van een model zijn gewoon getallen, typisch getraind en opgeslagen als 16-bit floating point. Kwantisering mapt die waarden op een grover raster: 8-bit-integers, 4-bit-integers, of gemengde schema's waar gevoelige lagen meer precisie behouden. Minder bits per gewicht betekent een kleiner bestand, minder GPU-geheugen, en snellere inferentie, want gewichten door geheugen bewegen is het knelpunt bij het genereren van tokens. Een model met 70 miljard parameters heeft ongeveer 140 GB nodig bij 16-bit maar dichter bij 40 GB bij 4-bit, wat het verschil is tussen een multi-GPU-server en één kaart met veel geheugen of een goed uitgeruste Mac.

De dominante aanpak is post-training-kwantisering: neem een afgewerkt model en converteer het, soms met een kleine kalibratiedataset om te beslissen hoe elke laag af te ronden met minimale schade. Populaire formaten in het lokale-modelecosysteem, zoals GGUF-quantniveaus en methoden zoals AWQ en GPTQ, zijn allemaal variaties op dit idee, verschillend in hoe slim ze de gewichten beschermen die er het meest toe doen. De GPTQ-paper van 2023 liet een GPT-model van 175 miljard parameters gekwantiseerd naar 3 of 4 bits per gewicht zien in ongeveer vier GPU-uren met verwaarloosbaar nauwkeurigheidsverlies, wat inferentieversnellingen opleverde van ongeveer 3,25x op een NVIDIA A100 en 4,5x op een A6000 [1]. MIT's AWQ, gekoppeld aan zijn TinyChat-runtime, meldt meer dan 3x versnelling ten opzichte van de Hugging Face FP16-baseline op zowel desktop- als mobiele GPU's [2]. Sommige modellen worden nu getraind met kwantisering in gedachten, wat de kwaliteitskloof verder verkleint. Activaties en de KV-cache kunnen ook gekwantiseerd worden, wat helpt bij long-context-workloads waar de cache de gewichten ontgroeit. De afwegingscurve is niet lineair: 8-bit is meestal niet te onderscheiden van het origineel, 4-bit kost een paar punten op moeilijke benchmarks, en 2-bit-modellen worden vaak grillig op manieren die samengevatte benchmarks onderschatten.

Voorbeeld

Een developer wil een lokale codingassistent voor een codebase die het gebouw niet mag verlaten. Het gekozen open-weight-model heeft ongeveer 60 GB geheugen nodig bij volledige precisie, meer dan de GPU van 48 GB van het werkstation. Bij 4-bit past hij in ongeveer 20 GB met ruimte voor een lang contextvenster. In dagelijks gebruik voelen autocomplete en refactoring identiek aan het gehoste origineel. Dan begint de AI-coding-agent erop gebouwd te haperen bij multi-file-bewerkingen die de gehoste versie aankan, en produceert af en toe misvormde tool-aanroepen. Overstappen naar een 5-bit-variant met het geheugen vrijgemaakt door een kortere context herstelt de tool-call-mislukkingen. De les die het team opschrijft: kies het kwantiseringsniveau tegen je eigen agent-evals, niet tegen een ranglijst.

Veelvoorkomende misvattingen

De standaardfout is "95 procent van benchmarkprestaties" lezen en 95 procent van praktische prestaties aannemen. Benchmarkgemiddelden verbergen waar het verlies zich concentreert. Kwantiseringsschade verschijnt onevenredig aan de randen: lange redeneerketens, zeldzame tokens, strikte outputformaten, en agent-tool-aanroepen, waar één corrupte stap het hele traject doet zinken. Een gekwantiseerd model kan het origineel matchen op meerkeuze-evals en toch je JSON-uitzendende agent merkbaar vaker laten falen. Evalueer het gekwantiseerde model op je daadwerkelijke workload, in de loop waarin hij daadwerkelijk zal draaien.

FAQ

Maakt kwantisering een LLM minder nauwkeurig? Enigszins, en de hoeveelheid hangt af van hoe ver je het doorvoert. 8-bit is in de praktijk effectief lossless, 4-bit ruilt een kleine hoeveelheid kwaliteit in voor een grote geheugenbesparing, en alles onder 4-bit zou als experimenteel behandeld moeten worden voor serieus werk. Het QLoRA-werk van de University of Washington is het referentiepunt voor hoe weinig 4-bit kan kosten: het fine-tunede een model van 65B parameters op één GPU van 48GB, en het resulterende Guanaco-model bereikte 99,3% van de prestaties van ChatGPT na 24 uur tuning op één GPU [3].

Kwantiseren OpenAI en Anthropic hun modellen? Aanbieders documenteren over het algemeen hun servingprecisie niet, en het kan achter de API veranderen. Als klant koop je modelgedrag, geen bitbreedte, wat nog een reden is om je eigen evals te onderhouden in plaats van aannames over de hostingstack.

Wat is het verschil tussen kwantisering en distillatie? Kwantisering comprimeert hetzelfde model door zijn gewichten grover op te slaan. Distillatie traint een ander, kleiner model om een groter na te bootsen. Kwantisering is een implementatiestap die je in een middag kunt toepassen; distillatie is een trainingsproject. Ze stapelen: veel lokale modellen worden eerst gedistilleerd en daarna gekwantiseerd.

Bronnen

  1. IST Austria / ETH Zurich (arXiv, ICLR 2023). "GPTQ kwantiseert een 175B-GPT-model naar 3-4 bits in ongeveer vier GPU-uren met inferentieversnellingen van 3,25x-4,5x." https://arxiv.org/abs/2210.17323. Geraadpleegd augustus 2026.
  2. MIT (arXiv, MLSys 2024 Best Paper). "AWQ-4-bit-kwantisering met TinyChat levert meer dan 3x versnelling versus Hugging Face FP16 op desktop- en mobiele GPU's." https://arxiv.org/abs/2306.00978. Geraadpleegd augustus 2026.
  3. University of Washington (arXiv). "QLoRA fine-tunet een 65B-model op één GPU van 48GB; Guanaco bereikt 99,3% van de prestaties van ChatGPT." https://arxiv.org/abs/2305.14314. Geraadpleegd augustus 2026.
Let’s get in touch

Ready to build your product?

Book a consultation call to get a free No-Code assessment and scope estimation for your project.
Book a consultation call to get a free No-Code assessment and scope estimation for your project.