
Wat is LLM-as-a-Judge?
LLM-as-a-judge is een evaluatietechniek waarbij het ene taalmodel de output van een ander model beoordeelt tegen een geschreven rubriek, en kwaliteiten scoort zoals correctheid, behulpzaamheid, of getrouwheid aan een bron. Het maakt kwalitatieve evaluatie goedkoop en snel genoeg om bij elke wijziging te draaien, tegen de prijs van de eigen biases en blinde vlekken van het judge-model erven. De techniek verdiende zijn geloofwaardigheid in 2023, toen Zheng et al. lieten zien dat GPT-4 als judge menselijke voorkeuren matchte met meer dan 80 procent overeenstemming op MT-Bench en Chatbot Arena, hetzelfde niveau van overeenstemming dat mensen onderling bereiken [1].
De belangrijkste punten
- De judge vervangt menselijke review voor de middenlaag van evaluatie: kwaliteiten te vaag voor stringmatching maar te hoogvolume voor mensen om met de hand te beoordelen.
- De rubriek is het product. Een judge met een vage prompt ("beoordeel kwaliteit 1-10") produceert ruis; een judge met expliciete criteria, schaalankers, en voorbeelden produceert bruikbaar signaal.
- Judges hebben bekende biases: ze verkiezen langere antwoorden, geven de voorkeur aan output die hun eigen stijl matcht, drijven af op positie bij het vergelijken van paren, en beoordelen hun eigen modelfamilie gul.
- Kalibreer tegen mensen voordat je de cijfers vertrouwt. Een judge is alleen geldig in de mate dat hij overeenstemt met expert-menselijke labels op een steekproef.
- Gebruik het binnen LLM-evals-pipelines en productiemonitoring, niet als vervanging voor deterministische checks die code gratis kan doen.
Hoe het werkt
Een judge-opzet heeft drie delen: de te beoordelen output, een rubriek, en een beoordelingsprompt die ze bindt. De rubriek definieert elk criterium concreet, hoe een 5 eruitziet versus een 3, welke mislukkingen automatische nullen zijn, en bevat uitgewerkte voorbeelden van gescoorde outputs. Het judge-model ontvangt de originele input, de te testen output, eventueel referentiemateriaal (een goudantwoord, een brondocument), en geeft een gestructureerd oordeel terug, meestal een score plus een geschreven rechtvaardiging. Vragen om de redenering voor de score verbetert betrouwbaarheid en geeft mensen iets om te auditen wanneer een cijfer vreemd oogt.
Twee beoordelingsmodi domineren. Pointwise-beoordeling scoort één output tegen de rubriek, wat past bij regressietesten: draai de suite, volg de gemiddelde score per commit. Pairwise-beoordeling toont de judge twee outputs en vraagt welke beter is, wat past bij vergelijkingen zoals prompt A versus prompt B of model-shootouts, en is over het algemeen betrouwbaarder omdat relatief oordeel makkelijker is dan absolute scoring. Pairwise-opzetten moeten de volgorde van kandidaten wisselen over runs heen, want judges verkiezen meetbaar welk antwoord ook eerst verschijnt. Het effect is niet subtiel: in een studie van 2023 buitten onderzoekers positiebias uit door simpelweg kandidaat-antwoorden te herordenen en lieten Vicuna-13B ChatGPT verslaan op 66 van 80 testqueries met ChatGPT als evaluator [2].
Het biasprobleem wordt beheerd, niet opgelost. Standaardmitigaties: gebruik een judge uit een andere modelfamilie dan het geteste systeem, plafonneer de invloed van antwoordlengte in de rubriek, draai elke beoordeling meerdere keren en neem de meerderheid wanneer de inzet hoog is, en herbeoordeel periodiek judge-mens-overeenstemming. Teams herkalibreren doorgaans wanneer ze het judge-model of de rubriek wijzigen, met een set door mensen gelabelde voorbeelden achter de hand als referentie.
Voorbeeld
Een team levert een RAG-assistent uit die vragen beantwoordt uit hun productdocumentatie. Hun evalsuite heeft 200 echte gebruikersvragen, en de kwaliteit die het meest telt is getrouwheid: houdt het antwoord zich aan wat de docs zeggen, of improviseert het. Stringmatching kan dat niet meten, en menselijke review van 200 antwoorden per promptwijziging is onbegonnen werk. Ze schrijven een judge-prompt die een judge-model de vraag, de opgehaalde documentpassages, en het antwoord geeft, met een driepuntsrubriek: volledig ondersteund, gedeeltelijk ondersteund, bevat niet-ondersteunde beweringen. Voordat ze erop vertrouwen, laten twee engineers 100 antwoorden met de hand labelen en vinden dat de judge 91 procent van de tijd overeenstemt met mensen, met meningsverschillen geclusterd op gedeeltelijk-ondersteunde gevallen, wat ze aanscherpen in de rubriek. De judge draait nu in CI bij elke retrieval- of promptwijziging en 's nachts op een steekproef van productieverkeer, en een getrouwheidsdaling van meer dan drie punten piept het team op.
Veelvoorkomende misvattingen
De kernmisvatting is judge-scores behandelen als grondwaarheid. Een judge is een meetinstrument met foutmarges, en een ongekalibreerde kan zelfverzekerd, systematisch fout zijn, en bereidwillig hoge cijfers geven aan vloeiende antwoorden die een AI-hallucinatie bevatten die de rubriek hem nooit leerde te vangen. Teams zien een dashboard trenden naar 4,6 van de 5 en nemen aan dat kwaliteit hoog is, terwijl de eerlijke bewering alleen is dat de judge de outputs leuk vindt. Tot je overeenstemming tussen de judge en expert-mensen op je eigen data hebt gemeten, zijn de scores decoratie.
FAQ
Welk model moet de judge zijn? Een model minstens zo capabel als het geëvalueerde, en idealiter van een andere aanbieder of familie om self-preference-bias te ontwijken. Frontier models zijn de standaardkeuze omdat beoordelen minder-volume is dan generatie, dus de kostenpremie is te tolereren. Sommige teams fine-tunen een kleinere dedicated judge zodra ze genoeg door mensen gelabelde data hebben, algemeenheid inruilend voor consistentie en prijs.
Kan de judge agents beoordelen, niet alleen antwoorden? Ja, en het is standaardpraktijk in agentevaluatie: de judge leest een volledig traject, het plan, tool-aanroepen, en resultaten, en scoort proceskwaliteiten zoals efficiëntie en veiligheid die uitkomstchecks missen. Traces zijn lang, dus profiteren judges van een samengevatte of gestructureerde weergave in plaats van ruwe logs.
Is LLM-as-a-judge betrouwbaar genoeg om menselijke review te vervangen? Voor het rangschikken van opties en het vangen van regressies, meestal ja eenmaal gekalibreerd. Voor definitieve goedkeuring van hoog-risico-output, nee. Het stabiele patroon houdt een mens in de loop bovenaan de piramide: deterministische checks draaien overal, judges behandelen schaal, en mensen auditen steekproeven en beslechten de gevallen die judges als onzeker markeren.
Bronnen
- Zheng et al. "Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena: GPT-4-judge bereikte meer dan 80% overeenstemming met menselijke voorkeuren." https://arxiv.org/abs/2306.05685. Geraadpleegd augustus 2026.
- Wang et al. "Large Language Models are not Fair Evaluators: herordening van antwoorden liet Vicuna-13B ChatGPT verslaan op 66 van 80 queries." https://arxiv.org/abs/2305.17926. Geraadpleegd augustus 2026.
Related terms
Ready to build your product?

