
Wat is LLM Fine-Tuning?
LLM fine-tuning is de praktijk van de training van een voorgetraind taalmodel voortzetten op een kleinere, taakspecifieke dataset zodat zijn standaardgedrag richting die taak verschuift. In tegenstelling tot prompting of retrieval, die het model op verzoekmoment sturen, verandert fine-tuning de gewichten zelf, en produceert een gespecialiseerde variant van het basismodel.
De belangrijkste punten
- Fine-tuning leert gedrag, stijl, en formaat veel beter aan dan het feiten aanleert. Voor het injecteren van kennis is retrieval-augmented generation meestal de juiste tool.
- Parameter-efficiënte methoden zoals LoRA maakten fine-tuning goedkoop: een nuttige adapter kan in uren op één GPU getraind worden, en gehoste API's maken het een configuratiebestand en een dataset-upload.
- Het zou zelden de eerste zet moeten zijn. De meeste teams komen verder met betere prompts, few-shot-voorbeelden, en structured outputs voordat ze gewichten aanraken.
- Een fine-getuned model is een artefact dat je nu bezit: het heeft versiebeheer, evals, en hertraining nodig wanneer het basismodel of de taak verandert.
Hoe het werkt
Een foundation model arriveert al getraind op brede data. Fine-tuning hervat training op je voorbeelden, meestal begeleide paren van input en gewenste output: supportgesprekken met ideale antwoorden, code met gereviewde fixes, documenten met correcte extracties. De optimizer duwt de gewichten zodat het gedemonstreerde gedrag de standaard wordt, wat betekent dat je stopt met betalen voor dat gedrag in prompttokens bij elke aanroep. Volledige fine-tuning werkt elk gewicht bij en is duur bij moderne modelgroottes, dus gebruikt het meeste werk parameter-efficiënte methoden, waarbij LoRA de standaard is, die het basismodel bevriezen en kleine adaptermatrices ernaast trainen. Microsoft Researchs originele LoRA-paper van 2021 meldde de trainbare parameters voor het fine-tunen van GPT-3 175B met 10.000 keer te verlagen en GPU-geheugen met 3 keer vergeleken met volledige fine-tuning met Adam [1]. Het resultaat is een lichtgewicht artefact dat per klant of per taak verwisseld of gestapeld kan worden.
Waar fine-tuning zich terugbetaalt is smal en herhaald gedrag: een huisstijl matchen, een domeinspecifiek formaat afgeven, een workflow volgen die je prompts imperfect beschrijven, of een klein model competitief maken met een groot op één klus, vaak met trainingsdata gegenereerd via model distillation. Waar het teleurstelt is kennis. Feiten getraind in gewichten verouderen, zijn moeilijk toe te schrijven, en updaten alleen door hertraining, terwijl een retrievalpipeline update door documenten te bewerken. De praktische stack voor een serieuze applicatie is vaak alle drie lagen: een fine-getuned model voor gedrag, retrieval voor kennis, en prompt engineering voor per-verzoek-instructie.
Voorbeeld
Een fintech-bedrijf draait een agent die rommelige verkopersafschriften omzet naar een strikt intern JSON-schema met tientallen randgeval-regels. De prompt die die regels codeert is gegroeid tot vierduizend tokens, en het frontier-model past de zeldzaamste regels nog steeds een paar procent van de tijd verkeerd toe. Het team exporteert twaalfduizend door mensen geverifieerde extracties, fine-tunet een middelgroot gehost model erop, en evalueert beide tegen een achtergehouden set. Het getunede model verslaat het geprompte frontier-model op schemanaleving, draait op een goedkopere tier, en heeft maar één regel instructie nodig in plaats van het regelsblad, wat inputkosten per aanroep scherp verlaagt. Ze houden het frontier-model voor documenten die het getunede model als onbekend markeert, en trainen elk kwartaal opnieuw naarmate nieuwe randgevallen zich opstapelen in de geverifieerde stapel.
Veelvoorkomende misvattingen
De klassieke misstap is grijpen naar fine-tuning om het model de informatie van je bedrijf aan te leren: productdocs, beleid, interne API's. Fine-tunen op documenten plant geen betrouwbare kennis; het leert het model vooral te klinken als de documenten terwijl het erbinnen hallucineert, en elke document-update impliceert hertraining. Kennis hoort thuis in retrieval, waar hij actueel blijft en elk antwoord een bron kan citeren. Fine-tune wanneer het probleem is hoe het model zich gedraagt, niet wat het weet, en alleen nadat goedkopere hendels, prompting en few-shot-voorbeelden, aantoonbaar hun plafond hebben geraakt.
FAQ
Hoeveel data heb ik nodig om een LLM te fine-tunen? Minder dan de meeste mensen verwachten voor gedrag en formaat: een paar honderd hoogwaardige voorbeelden verplaatsen vaak de naald, en lage duizenden zijn typisch voor productiewerk. Kwaliteit domineert kwantiteit, want het model leert getrouw elke inconsistentie in je dataset.
Wat kost fine-tuning in 2026? Gehoste fine-tuning op commerciële modellen wordt geprijsd per trainingstoken en landt meestal tussen tientallen en een paar honderd dollar voor typische datasets, plus een premie op inferentie bij sommige aanbieders. LoRA-tunen van een open-weight-model huurt één GPU voor een paar uur; de QLoRA-paper van 2023 paste een fine-tune van 65B-parameters op één GPU van 48GB, en zijn Guanaco-model bereikte 99,3% van de prestaties van ChatGPT na 24 uur op die ene kaart [2]. De dominante kost is geen van beide: het is de evalset bouwen en onderhouden die je vertelt of de tune daadwerkelijk hielp.
Moet ik fine-tunen of RAG gebruiken? Vraag wat er faalt. Foute of ontbrekende feiten wijzen naar RAG. Foute toon, formaat, of taakuitvoering die goede prompting overleeft, wijst naar fine-tuning. Volwassen systemen combineren ze vaak, en de eerlijke baseline voor beide is een goed geëngineerde prompt, die vaker wint dan beide kampen willen toegeven.
Bronnen
- Microsoft Research (arXiv). "LoRA verlaagt trainbare parameters voor GPT-3 175B-fine-tuning met 10.000x en GPU-geheugen met 3x versus volledige fine-tuning met Adam." https://arxiv.org/abs/2106.09685. Geraadpleegd augustus 2026.
- University of Washington (arXiv). "QLoRA fine-tunet een 65B-model op één GPU van 48GB; Guanaco bereikt 99,3% van de prestaties van ChatGPT na 24 uur op één GPU." https://arxiv.org/abs/2305.14314. Geraadpleegd augustus 2026.
Related terms
Ready to build your product?

