Hero Image full

LLM Temperature

7 min read
Content

Wat is LLM Temperature?

LLM temperature is een samplingparameter die bepaalt hoe willekeurig de output van een taalmodel is. Bij lage temperatuur kiest het model bijna altijd zijn token met de hoogste waarschijnlijkheid, wat consistente, voorspelbare antwoorden geeft. Bij hoge temperatuur sampelt het vrijer uit minder waarschijnlijke tokens, wat gevarieerde en soms verrassende output geeft.

De belangrijkste punten

  • Temperatuur hervormt de waarschijnlijkheidsverdeling waaruit het model sampelt; het verandert niet wat het model weet of hoe het redeneert.
  • Lage temperatuur (0 tot ongeveer 0,3) past bij agents, extractie, en code, waar consistentie en debugbaarheid variëteit verslaan.
  • Temperatuur 0 garandeert nog steeds geen identieke outputs: servingzijdig non-determinisme betekent dat byte-voor-byte-reproduceerbaarheid door de meeste API's niet beloofd wordt.
  • Reasoning-modellen negeren of beperken de temperatuurparameter vaak, dus controleer de modeldocumentatie voordat je hem afstelt.

Hoe het werkt

Bij elke generatiestap produceert het model een score voor elk token in zijn vocabulaire, en die scores worden een waarschijnlijkheidsverdeling. Temperatuur deelt de scores voor die omzetting. Waarden onder 1 verscherpen de verdeling en concentreren waarschijnlijkheid op de topkandidaten; waarden boven 1 vervlakken hem, en geven zwakkere kandidaten een echte kans gekozen te worden. Bij temperatuur 0 (of heel dichtbij) stort sampling in tot greedy decoding: neem elke keer gewoon het meest waarschijnlijke token. Er verandert niets aan de interne berekening van het model. Dezelfde kennis en dezelfde redenering produceren de scores; temperatuur beslist alleen hoe avontuurlijk je eruit trekt.

Voor engineers die agents draaien, interageert de instelling met alles stroomafwaarts. Een tool-calling-lus bij hoge temperatuur kiest af en toe een vreemd token binnen een JSON-argument, en één slecht token kan een heel traject ontsporen, wat waarom agentframeworks standaard laag staan. Lage temperatuur maakt mislukkingen ook reproduceerbaarder, dus is het debuggen van een promptregressie veel makkelijker bij 0,1 dan bij 0,9. De kost is mode collapse bij generatieve taken: vraag om tien headline-opties bij temperatuur 0 en je krijgt bijna-duplicaten. Temperatuur wordt meestal gekoppeld aan top-p-(nucleus)-sampling, dat de kandidatenpool afknot tot de kleinste set die een waarschijnlijkheidsmassa dekt; de meeste aanbieders raden aan één van de twee af te stellen, niet beide, omdat hun effecten overlappen.

Voorbeeld

Een team levert een agent uit die bugrapporten leest en gestructureerde tickets indient via een tool-aanroep. In staging, weken gedraaid op de standaardtemperatuur van 0,7, werkt hij goed. In productie arriveert ongeveer één ticket op tweehonderd met een verminkt prioriteitsveld, en de mislukkingen reproduceren nooit wanneer ze opnieuw afgespeeld worden. Een engineer verlaagt de temperatuur naar 0,1 voor de tool-calling-stap en de corruptie verdwijnt: het model had af en toe een laag-waarschijnlijkheidstoken binnen een enum-waarde gesampled. Ze houden een tweede, hoger-temperatuur-aanroep voor de ene oprecht creatieve stap in de pipeline, een gebruikersgerichte samenvatting opstellen, waar variëteit natuurlijk aanvoelt in plaats van kapot. Twee aanroepen, twee temperaturen, elk gematcht met een andere klus.

Veelvoorkomende misvattingen

De hardnekkige mythe is dat temperatuur 0 een LLM deterministisch en dus correct maakt. Het doet geen van beide betrouwbaar. Wat determinisme betreft, introduceren productie-servingstacks non-determinisme via batching, hardware, en mixture-of-experts-routering, dus kunnen identieke verzoeken nog steeds verschillende outputs opleveren bij temperatuur 0. Wat correctheid betreft, verandert temperatuur alleen welk token gekozen wordt uit de verdeling die het model berekende. Als het meest waarschijnlijke vervolg van het model een hallucinatie is, selecteert temperatuur 0 die hallucinatie met volledig vertrouwen. Een studie van Renze en Guven uit 2024 over negen populaire LLM's vond dat temperatuur verschuiven van 0,0 naar 1,0 geen statistisch significant effect had op probleemoplossingsprestaties, en het resultaat hield stand over modellen, promptingtechnieken, en probleemdomeinen heen [1]. Nauwkeurigheidsproblemen leven in het model, de prompt, en de opgehaalde context, niet in de samplingknop.

FAQ

Welke temperatuur moet ik gebruiken voor coderen en agents? Begin bij 0 tot 0,2 voor codegeneratie, extractie, classificatie, en elke tool-calling-lus. Verhoog het alleen wanneer outputs vastgeroest aanvoelen en de taak oprecht profiteert van variatie, zoals brainstormen of copywriting, waar 0,7 tot 1,0 een gangbaar bereik is. Aanbiedersrichtlijnen wijzen dezelfde kant op: Anthropics Messages API accepteert temperaturen van 0,0 tot 1,0 met een standaard van 1,0, en de documentatie beveelt waarden nabij 0,0 aan voor analytische of meerkeuze-taken en nabij 1,0 voor creatief werk [2].

Wat is het verschil tussen temperatuur en top-p? Temperatuur herweegt de hele tokenverdeling; top-p knipt de onwaarschijnlijke staart af en sampelt uit wat overblijft. Beide ruilen consistentie tegen diversiteit. Standaardadvies is er één aan te passen en de andere op zijn standaard te laten, want beide afstellen componeert onvoorspelbaar.

Waarom krijg ik verschillende antwoorden bij temperatuur 0? Greedy decoding verwijdert samplingwillekeurigheid, maar de servinginfrastructuur is niet perfect deterministisch: floating-point-operaties herordenen onder batching, en expert-routering kan verschuiven. Behandel temperatuur 0 als "zeer consistent," en bouw evals die kleine variaties tolereren in plaats van exacte strings te toetsen.

Bronnen

  1. Renze & Guven (arXiv, EMNLP 2024 Findings). "Samplingtemperatuur veranderen van 0,0 naar 1,0 heeft geen statistisch significante impact op LLM-probleemoplossingsprestaties over negen modellen." https://arxiv.org/abs/2402.05201. Geraadpleegd augustus 2026.
  2. Anthropic API-documentatie. "Messages API-temperatuurbereik 0,0-1,0, standaard 1,0, met lage waarden aanbevolen voor analytische taken en hoge voor creatieve taken." https://platform.claude.com/docs/en/api/messages. Geraadpleegd augustus 2026.
Let’s get in touch

Ready to build your product?

Book a consultation call to get a free No-Code assessment and scope estimation for your project.
Book a consultation call to get a free No-Code assessment and scope estimation for your project.