
Wat is een LLM Benchmark?
Een LLM-benchmark is een gestandaardiseerde testsuite gebruikt om taalmodellen te vergelijken op een gedeelde taak, coderen, redeneren, kennis, wiskunde, of agentic werk, onder vaste condities zodat scores vergelijkbaar zijn tussen modellen. Benchmarks zijn nuttig voor het samenstellen van shortlists en het volgen van vooruitgang in de industrie, en in toenemende mate gecompromitteerd doordat modellen trainen op het testmateriaal.
De belangrijkste punten
- Benchmarks beantwoorden "welk model is algemeen sterker," niet "welk model werkt voor jouw product." Die tweede vraag hoort bij evals op je eigen data.
- Het veld bewoog van statische quizzen (MMLU-achtige meerkeuze) naar uitvoeringsgebaseerde en agentic tests: SWE-bench laat agents echte GitHub-issues fixen, terminal- en webnavigatiesuites beoordelen voltooide taken.
- Contaminatie is de structurele zwakte. Publieke testsets lekken in trainingsdata, wat scores opblaast zonder de onderliggende capaciteit te verbeteren, en daarom dragen achtergehouden en periodiek vernieuwde benchmarks meer signaal.
- Verzadiging is constant: zodra frontier-modellen samenklonteren nabij het plafond van een benchmark, stopt hij met onderscheiden en roteert de gemeenschap naar moeilijkere.
- Lees benchmarkscores als een shortlisttool met foutmarges, en weeg kosten en latentie ernaast mee, want een model twee punten hoger tegen vijf keer de prijs verliest meestal in productie.
Hoe het werkt
Een benchmark legt drie dingen vast: een dataset van taken, een scoringmethode, en een protocol. De dataset kan wiskundewedstrijdproblemen zijn, meerkeuze-kennisvragen, of echte bugs gedolven uit open-sourcerepositories. Scoring loopt van exact-match-antwoorden tot code die een verborgen testsuite moet doorstaan, tot voorkeursgebaseerde systemen zoals arena-ranglijsten, waar mensen stemmen tussen anonieme modelantwoorden en een Elo-achtige rating ontstaat. Het protocol legt de rest vast: hoeveel pogingen tellen (pass@1 versus pass@k), welke tools het model mag gebruiken, en hoe prompts gestandaardiseerd zijn, details die scores met wezenlijke hoeveelheden verschuiven, en daarom kan hetzelfde model verschillende cijfers posten op de "zelfde" benchmark.
Het generationele patroon is verzadiging en vervanging. Vroege suites uit het GPT-3-tijdperk weken voor MMLU als de algemene-kennis-standaard; toen frontier-modellen zijn plafond volpakten (en zijn foutbezaaide vragen folklore werden), verschenen moeilijkere vervangers zoals MMLU-Pro en GPQA, gebouwd om zowel verzadiging als opzoeking te weerstaan. Coderen volgde dezelfde boog, van functie-completion-sets zoals HumanEval naar repository-schaal-suites zoals SWE-bench, en tegen 2026 ligt de nadruk op agentic benchmarks die hele trajecten scoren van een AI-coding-agent werkend in een sandboxed repo of terminal. Het tempo van verzadiging verklaart de doorstroming: in één jaar stegen AI-scores 18,8 procentpunt op MMMU, 48,9 op GPQA, en 67,3 op SWE-bench, volgens de Stanford HAI 2025 AI Index [1].
Contaminatie vormt hoe insiders elke ranglijst lezen. Omdat trainingscorpora het publieke web opzuigen, eindigen gepubliceerde testsets, letterlijk of geparafraseerd, in trainingsdata, en kan een model goed scoren door herkenning in plaats van redenering. Scale AI-onderzoekers kwantificeerden het effect in 2024 door de GSM8k-wiskundebenchmark vanaf nul opnieuw te bouwen als GSM1k: sommige modelfamilies scoorden tot 8 procent lager op de kloon, met systematische overfitting over bijna alle modelgroottes [2]. Verdedigingen omvatten private achtergehouden splits, canary-strings, vers geschreven problemen op rollende basis, en prestaties op pre-cutoff versus post-cutoff versies van vergelijkbare taken vergelijken. Geen enkele is waterdicht, wat nog een reden is waarom lanceringsdaggrafieken van leveranciers beleefde scepsis verdienen.
Voorbeeld
Een platformteam kiest een model om een interne code-migratie-agent aan te drijven. Ze beginnen met publieke benchmarks als filter: SWE-bench-achtige agentic-coding-scores plus een terminal-use-suite versmallen twaalf kandidaatmodellen naar vier die een capaciteitslat halen, en prijsstelling verwijdert er nog één. Dan stoppen de benchmarks nuttig te zijn, want hun workload, een propriëtaire ORM migreren naar een nieuwe versie over honderden services heen, verschijnt in geen enkele publieke suite. Ze bouwen een private benchmark van 40 echte migratietaken uit hun monorepo, elk verifieerbaar door compilatie en bestaande tests, en draaien de drie finalisten vijf keer per taak. De leider van de publieke ranglijst eindigt derde op hun suite, herhaaldelijk struikelend over de ongewone patronen van de ORM, terwijl de nummer twee het beste slagingspercentage post tegen de helft van de kosten. Ze leveren uit met de nummer twee. De publieke benchmarks verdienden hun plek als filter; de private maakte de beslissing.
Veelvoorkomende misvattingen
De fout is ranglijstpositie behandelen als aankoopbeslissing. Benchmarkscores zijn metingen van prestatie op de verdeling van de benchmark, onder het protocol van de benchmark, op één moment in tijd, en leveranciers optimaliseren hard tegen precies die condities juist omdat kopers de grafieken zo lezen. De kloof tussen ranglijstpositie en prestatie op jouw taak kan groot zijn in beide richtingen: een middenmoot-model kan domineren in jouw smalle domein, en een chart-topper kan struikelen over jouw outputformaat. Rang doet er ook minder toe dan vroeger: de AI Index van 2025 vond dat de prestatiekloof tussen het hoogst-gerangschikte en het 10e-gerangschikte model in een jaar versmalde van 11,9 procent naar 5,4 procent [3]. De klus van de benchmark eindigt bij de shortlist. Vanaf daar kan alleen een eval gebouwd uit je eigen taken, data, en beperkingen het model kiezen, en hij dient dubbel als je regressiesuite nadat je gekozen hebt.
Wat zijn de belangrijkste LLM-benchmarks?
Een werkkaart van de namen die terugkeren in modelkaarten van 2026. Kennis en redenering: MMLU en zijn moeilijkere opvolger MMLU-Pro, GPQA voor wetenschapsvragen op graduate-niveau ontworpen om weblookup te weerstaan, en ARC-AGI voor abstracte redenering die vijandig blijft tegen memorisatie. Wiskunde: GSM8K (lang verzadigd, nu een vloercheck) en wedstrijdniveau-sets zoals AIME-problemen. Coderen: HumanEval en MBPP voor korte functiecompletion, beide effectief opgelost, en SWE-bench met zijn varianten als de repository-schaal-standaard waar een agent echte GitHub-issues moet oplossen tegen verborgen tests. Agentic en toolgebruik: terminal-taaksuites, webnavigatiebenchmarks zoals WebArena-afstammelingen, en tool-calling-nauwkeurigheidssuites. Voorkeur en algemeen gevoel: arena-achtige menselijke-stem-ranglijsten, waardevol voor het vangen van kwaliteiten die statische suites missen en scheefgetrokken richting zelfverzekerde, goed-geformatteerde antwoorden. Long-context-suites maken het beeld compleet door herinnering en redenering over grote contextvensters te testen in plaats van alleen needle-in-haystack-retrieval.
FAQ
Wat is het verschil tussen een LLM-benchmark en een eval? Bereik en eigenaarschap. Een benchmark is publiek, gestandaardiseerd, en modelgecentreerd: hij vergelijkt modellen op een gedeelde taak zodat ieders scores overeenkomen. Een eval is privé, taakspecifiek, en productgecentreerd: hij meet jouw systeem, prompts, retrieval, en model samen, op jouw data. Benchmarks maken shortlists; evals beslissen en bewaken vervolgens de keuze in CI.
Waarom verschillen benchmarkscores tussen de lanceringspost van een leverancier en onafhankelijk testen? Protocol. Toegestane pogingen, promptformulering, toolgang, samplingtemperatuur, en welke subset van de suite draaide, verschuiven allemaal resultaten, en leveranciers publiceren van nature hun gunstigste configuratie. Onafhankelijke heruitvoeringen onder een gemeenschappelijke harness landen routinematig een paar punten lager. Vergelijk modellen alleen binnen één harness, nooit over marketingpagina's heen.
Kun je benchmarks überhaupt vertrouwen, gegeven contaminatie? Als ruwe capaciteitsordening, ja, vooral benchmarks met private testsplits, rollend verse problemen, of uitvoeringsgebaseerde scoring die lastiger te memoriseren is. Behandel elke individuele score als ruis, geef de voorkeur aan recent geschreven suites boven lang-publieke, en laat overeenstemming over verschillende onafhankelijke benchmarks, plus je eigen eval, het daadwerkelijke oordeel vormen.
Bronnen
- Stanford HAI. "2025 AI Index Report: scorewinst van één jaar van 18,8 punten (MMMU), 48,9 (GPQA), en 67,3 (SWE-bench)." https://hai.stanford.edu/ai-index/2025-ai-index-report. Geraadpleegd augustus 2026.
- Zhang et al., Scale AI. "GSM1k: modellen scoorden tot 8% lager op een vanaf-nul-kloon van GSM8k, wat systematische overfitting toont." https://arxiv.org/abs/2405.00332. Geraadpleegd augustus 2026.
- Stanford HAI. "2025 AI Index Report: kloof tussen het hoogst-gerangschikte en het 10e-gerangschikte model versmalde in een jaar van 11,9% naar 5,4%." https://hai.stanford.edu/ai-index/2025-ai-index-report. Geraadpleegd augustus 2026.
Related terms
Ready to build your product?

