
Wat is Model Distillation?
Model distillation is de techniek van een kleiner studentmodel trainen om het gedrag van een groter leraarmodel te reproduceren, met de outputs van de leraar als trainingssignaal. De student houdt het meeste van de capaciteit van de leraar op de beoogde taken terwijl hij sneller en goedkoper draait, wat het een standaardtool maakt voor het verlagen van inferentiekosten. Het canonieke vroege resultaat is DistilBERT, dat Hugging Face in 2019 meldde als 40% kleiner en 60% sneller dan BERT terwijl het 97% van zijn taalbegrip behield [1].
De belangrijkste punten
- Distillatie draagt capaciteit naar beneden over: een groot model genereert het trainingssignaal, een klein model leert het te imiteren.
- De student excelleert binnen de verdeling waarop hij getraind is en verslechtert erbuiten, dus passen gedistilleerde modellen bij smalle, hoogvolume-taken.
- De meeste kleine modellen die je vandaag kunt kopen of downloaden werden gedeeltelijk getraind op outputs van grotere modellen; distillatie is hoe goedkope modellen goed werden.
- Voor agentteams is distillatie een kostenspel: vervang een frontier-model door een gedistilleerd op de routineplak van je verkeer, geverifieerd door evals.
Hoe het werkt
Klassieke distillatie traint de student om de volledige waarschijnlijkheidsverdeling van de leraar over volgende tokens te matchen, de zachte doelen, die meer informatie dragen dan het kale juiste antwoord omdat ze coderen wat de leraar aannemelijk achtte. Dat vereist toegang tot de internals van de leraar, dus wordt het vooral gebruikt door labs die hun eigen modellen verkleinen. Google DeepMind trainde de Gemma 2 2B- en 9B-modellen op deze manier, met distillatie in plaats van gewone next-token-voorspelling, en meldt dat ze concurreren met modellen twee tot drie keer groter [2]. De variant die practitioners daadwerkelijk aanraken is sequence-level- of black-box-distillatie: genereer een grote set prompts representatief voor je workload, verzamel de antwoorden van de leraar via zijn API, en fine-tune de student op die prompt-antwoord-paren. Dit is synthetische-datageneratie met een specifiek doel, en daarom beperken servicevoorwaarden van aanbieders vaak het gebruik van outputs om concurrerende modellen te trainen.
De economie drijft alles. Een frontier-model kan een ordegrootte meer per token kosten dan een klein model en meerdere keren trager antwoorden. Als een gedistilleerde student, zeg, het meeste van de kwaliteit van de leraar op jouw specifieke taak behoudt, kun je het gros van het productieverkeer ernaartoe routeren en de leraar reserveren voor lastige gevallen. De kloof kan zelfs omkeren op smalle taken: Googles Distilling Step-by-Step-methode van 2023 liet een fine-getuned T5 van 770M-parameters een few-shot-geprompte PaLM van 540B-parameters, een model ongeveer 700 keer groter, verslaan, met slechts 80% van de beschikbare benchmarkdata [3]. De vangst is bereik. De student leerde niet breed te redeneren; hij leerde het gedrag van de leraar over de trainingsverdeling. Verschuif de taak en kwaliteit valt sneller weg dan bij de leraar, wat waarom distillatie natuurlijk samengaat met evals die de grens van vertrouwen definiëren. Verwant maar apart: kwantisering verkleint de numerieke precisie van hetzelfde model, terwijl distillatie een oprecht ander, kleiner model produceert.
Voorbeeld
Een support-toolingteam gebruikt een frontier-model om inkomende tickets te triageren: het probleem classificeren, productgebied en ernst extraheren, een eerste antwoord opstellen. Volume groeit naar tweehonderdduizend tickets per maand, en de modelrekening wordt de grootste post in het productbudget. Het team sampelt vijftigduizend historische tickets, laat ze door het frontier-model gaan, en fine-tunet een klein open-weight-model op de resulterende paren. Op hun evalset matcht het gedistilleerde model de classificatienauwkeurigheid van de leraar binnen een paar punten en schrijft acceptabele concepten voor gangbare probleemtypen. Ze leveren het uit achter een vertrouwensdrempel: de student behandelt de routineuze meerderheid, alles wat hij als onzeker markeert escaleert naar het frontier-model. Inferentie-uitgave daalt naar een fractie van de vorige rekening zonder meetbare verandering in klantgerichte kwaliteit.
Veelvoorkomende misvattingen
De terugkerende fout is verwachten dat de student de algemene intelligentie van de leraar erft. Distillatie kopieert gedrag, niet begrip. Een student gedistilleerd op triage-transcripten zal goed triageren en slecht redeneren over al het andere, en de kloof is makkelijk te missen omdat de student klinkt als de leraar, vloeiend en zelfverzekerd, zelfs wanneer hij buiten zijn diepte is. Teams die grenstesten overslaan, ontdekken dit in productie, wanneer een nieuwe input een gepolijst, fout antwoord krijgt. Definieer de taakverdeling, evalueer ertegen, en route out-of-distribution-verkeer naar het grotere model.
FAQ
Wat is het verschil tussen model distillation en fine-tuning? Fine-tuning is het trainingsmechanisme; distillatie is één reden om het te gebruiken. Bij distillatie komt de trainingsdata uit de outputs van een groter model, dus is het doel imitatie en compressie. Gewone fine-tuning gebruikt door mensen geschreven of gecureerde data om een model te specialiseren, zonder leraar betrokken.
Is distillatie hetzelfde als kwantisering? Nee. Kwantisering houdt hetzelfde model en verlaagt de numerieke precisie van zijn gewichten, en ruilt een beetje kwaliteit voor snelheid en geheugen. Distillatie traint een apart, kleiner model. Teams stapelen ze vaak: eerst distilleren, dan de student kwantiseren voor implementatie.
Kan ik een commercieel model zoals GPT of Claude distilleren? Technisch werkt het black-box-recept op elke API, maar de meeste commerciële aanbieders verbieden hun outputs te gebruiken om concurrerende modellen te trainen. Controleer de voorwaarden voordat je een distillatiepipeline bouwt op een API van derden; open-weight-leraren vermijden het probleem helemaal.
Bronnen
- Hugging Face (arXiv, NeurIPS 2019 workshop). "DistilBERT is 40% kleiner en 60% sneller dan BERT terwijl het 97% van zijn taalbegrip behoudt." https://arxiv.org/abs/1910.01108. Geraadpleegd augustus 2026.
- Google DeepMind (arXiv). "Gemma 2 2B en 9B werden getraind met kennisdistillatie en concurreren met modellen 2-3 keer groter." https://arxiv.org/abs/2408.00118. Geraadpleegd augustus 2026.
- Google Research (arXiv, ACL 2023 Findings). "Distilling Step-by-Step laat een T5 van 770M een few-shot PaLM van 540B verslaan met 80% van de benchmarkdata." https://arxiv.org/abs/2305.02301. Geraadpleegd augustus 2026.
Related terms
Ready to build your product?

