
Wat is Model Drift?
Model drift is de verslechtering van de real-world-prestatie van een AI-systeem over tijd terwijl zijn code ongewijzigd blijft. Het gebeurt wanneer de wereld wegdrijft van wat het model leerde (data- en concept-drift) of, in LLM-gebaseerde systemen, wanneer een aanbieder het onderliggende model update en gedrag verschuift onder je prompts.
De belangrijkste punten
- Drift is een "niets veranderde maar alles veranderde"-mislukking: het systeem dat elke test doorstond bij lancering wordt stilletjes slechter zonder één enkele deploy.
- Klassieke ML-drift komt in twee smaken: data-drift, waar inputverdelingen verschuiven, en concept-drift, waar de relatie tussen inputs en correcte outputs verandert.
- LLM-applicaties voegen een derde bron toe: de aanbieder update of trekt het gehoste model in, en elke prompt afgestemd op het oude gedrag draait nu tegen een ander.
- Drift wordt gedetecteerd, nooit voorkomen. Vaste evalsuites die op schema opnieuw draaien plus productiekwaliteitsmonitoring zijn de rookmelders.
- Reacties verschillen per oorzaak: hertrainen of data verversen voor klassieke drift, evals opnieuw draaien en prompts aanpassen bij modelupdates, en modelversies vastpinnen wanneer stabiliteit meer telt dan verbeteringen.
Hoe het werkt
Een model is een momentopname van de wereld op trainingsmoment, en de wereld blijft bewegen. Data-drift betekent dat productie-inputs ophouden te lijken op de trainingsverdeling: een fraudemodel getraind op card-present-transacties ontmoet een golf van instant-payment-fraude, of een supportclassifier getraind voor lancering ontmoet vragen over features die nog niet bestonden. Concept-drift is subtieler, de inputs zien er hetzelfde uit maar het juiste antwoord veranderde: "redelijke verzendtijd" betekende iets anders voor een pandemie, en een cv-screen afgesteld op de arbeidsmarkt van gisteren scoort de kandidaten van vandaag fout. Beide eroderen nauwkeurigheid geleidelijk, wat waarom drift zelden alarmen triggert ontworpen voor plotselinge breuk.
Teams die op gehoste LLM's bouwen, erven een versie van het probleem die klassieke ML nooit had: het model kan veranderen zonder hun toestemming of medeweten. Aanbieders leveren stille verbeteringen aan modellen achter stabiel klinkende aliassen, deprecaten versies op een schema, en zelfs een strikt beter model is anders, en breekt prompts die afhingen van oude eigenaardigheden van formattering, uitgebreidheid, of weigeringsgedrag. De canonieke demonstratie kwam van onderzoekers van Stanford en UC Berkeley, die vonden dat de nauwkeurigheid van GPT-4 bij het identificeren van priem- versus samengestelde getallen daalde van 84 procent in maart 2023 naar 51 procent in juni 2023 achter hetzelfde API-endpoint [1]. Promptniveau-drift stapelt zich op: naarmate je retrievalcorpus, few-shot-voorbeelden, en gebruikerspopulatie evolueren, verschuift effectief gedrag zelfs met een vastgepind model.
Detectie is een monitoringprobleem. De standaardkit: een bevroren evalsuite die op schema opnieuw draait tegen productieconfiguratie, zodat elke scoreverandering het model of de data als oorzaak isoleert; statistische monitors die live inputverdelingen vergelijken met een trainingsmoment-baseline; en outputkwaliteitstracking via AI-observability-tooling, judge-gescoorde steekproeven, gebruikersfeedbackpercentages, escalatiepercentages. De discipline die dit alles laat werken is baselining: je kunt drift alleen zien relatief aan een geregistreerd startpunt.
Voorbeeld
Een logistiekbedrijf draait een LLM-pipeline die ophaaladressen, datums, en containernummers uit klant-e-mails extraheert naar gestructureerde JSON. Hij lanceerde op 97 procent veldnauwkeurigheid en draaide vijf maanden onaangeraakt. Dan laat hun wekelijkse evalrun, dezelfde 300 bevroren e-mails elke zondagavond, extractienauwkeurigheid dalen naar 89. Er gebeurde geen deploy, dus wijst de suite naar het model, en de changelog van de aanbieder bevestigt dat hun aliaste modelnaam die week werd geüpgraded. Bij het uitspitten van mislukkingen normaliseert het nieuwe model behulpzaam adressen, en breidt "St" uit naar "Street", wat exact-match-validatie stroomafwaarts breekt. Omdat ze het in de wekelijkse run vingen in plaats van via boze magazijnbelletjes, is de fix kalm: pin de vorige modelversie, pas de prompt aan om normalisatie te verbieden, verifieer op de evalsuite, en adopteer dan de nieuwe versie doelbewust. Hun postmortem voegt één regel toe: elke modelupdate van een aanbieder triggert een evalrun voordat het alias in productie doorrolt.
Veelvoorkomende misvattingen
De misvatting is geloven dat een systeem dat werkend werd uitgeleverd, werkend zal blijven, modelkwaliteit behandelen als gecompileerde code. Software rot niet op de plank, dus passen teams softwareintuities toe, vieren de lanceringsmetrieken, en ontbinden de monitoringinspanning. De nauwkeurigheid van een model is een bederfelijke meting van fit tussen bevroren parameters en een bewegende wereld, dichter bij een weersvoorspelling dan een stelling. Het bederf is bijna universeel: een studie uit 2022 in Nature's Scientific Reports vond temporele degradatie, wat de auteurs AI-veroudering noemen, in 91 procent van de 128 geteste model-en-dataset-paren, zelfs zonder duidelijke data-drift [2]. Het praktische gevolg: kwaliteitsmonitoring is geen lanceringsartefact om af te bouwen, het is een permanente operationele kost van modellen in productie draaien, en elke AI-feature zonder geplande evals verslechtert nu op een onbekend tempo.
FAQ
Wat is het verschil tussen model drift en data drift? Data-drift is één oorzaak; model drift is het effect. Data-drift betekent dat de inputs van verdeling veranderden, concept-drift betekent dat de correcte antwoorden veranderden, en beide produceren model drift, de observeerbare prestatiedaling. In LLM-systemen zijn providerzijdige modelupdates een derde oorzaak met hetzelfde symptoom, wat waarom teams eerst uitkomsten monitoren en dan pas oorzaken diagnosticeren.
Hoe vaak moet je op drift controleren? Match het tempo met hoe snel je domein beweegt en hoe duur stille mislukking is. Wekelijkse evalherhalingen zijn een verstandige standaard voor de meeste LLM-producten, dagelijks voor fraude-, beveiligings-, en prijsstellingssystemen, en altijd onmiddellijk na elke modelaankondiging van een aanbieder. Continue productiesampling met judge-scoring vangt wat geplande runs missen tussen checkpoints.
Voorkomt fine-tuning model drift? Nee, en het kan blootstelling verergeren. Een fine-getuned model is bevroren op zijn trainingsmomentopname, dus drift het tegen een veranderende wereld net als elk model, en het verankert je ook aan een basismodel dat de aanbieder uiteindelijk zal deprecaten. Fine-tuning koopt taakprestatie en consistentie, terwijl het driftantwoord hetzelfde blijft: baseline, monitoren, en verversen op bewijs.
Bronnen
- Chen, Zaharia en Zou, Stanford/UC Berkeley. "GPT-4-nauwkeurigheid bij priem- versus samengestelde-getallen-identificatie daalde van 84% (maart 2023) naar 51% (juni 2023)." https://arxiv.org/abs/2307.09009. Geraadpleegd augustus 2026.
- Vela et al., Scientific Reports (Nature). "Temporele modeldegradatie verscheen in 91% van 128 geteste model/dataset-paren." https://www.nature.com/articles/s41598-022-15245-z. Geraadpleegd augustus 2026.
Related terms
Ready to build your product?

