
Wat is Automation Bias?
Automation bias is de menselijke neiging om output van een geautomatiseerd systeem meer te vertrouwen dan het bewijs rechtvaardigt, en een machine-antwoord met minder controle te accepteren dan dezelfde bewering van een persoon zou krijgen. In AI-ondersteunde engineering verschijnt het als agent-geschreven code, configs, en analyses goedkeuren grotendeels omdat ze compleet, zelfverzekerd, en professioneel geformatteerd aankomen. Het vertrouwen van developers is slecht gekalibreerd in beide richtingen: in het Stack Overflow-onderzoek van 2025 vertrouwde slechts 33% van de developers de nauwkeurigheid van AI-output, met slechts 3% die het sterk vertrouwde en 46% die het actief wantrouwde, en toch gebruikte 51% van de professionele developers AI-tools dagelijks [1].
De belangrijkste punten
- De bias is een gedocumenteerd human-factors-fenomeen uit luchtvaart en geneeskunde dat taalmodellen met decennia voorafgaat; LLM's creëerden het niet, ze gaven het een turbo.
- Het heeft twee gezichten: commissie, handelen op een foute machineaanbeveling, en omissie, een probleem niet opmerken omdat de machine erover zweeg.
- Vloeiendheid is het brandversnellende middel. LLM-output is gepolijst ongeacht of hij correct is, en polish is precies het signaal dat mensen als kortere weg naar geloofwaardigheid gebruiken.
- Het betrouwbare tegenmiddel is proces, geen wilskracht. Reviewpoorten die onafhankelijke verificatie afdwingen, verslaan besluiten om "sceptisch te blijven," wat binnen weken vervaagt.
Hoe het werkt
Human-factors-onderzoekers begonnen het patroon te documenteren in cockpit- en klinische omgevingen lang voor moderne AI: geef mensen een grotendeels betrouwbaar geautomatiseerd hulpmiddel en hun waakzaamheid verslechtert, omdat aanhoudende scepsis tegenover een tool die meestal gelijk heeft, zinloos aanvoelt. Het faalpatroon splitst zich in twee. Fouten van commissie gebeuren wanneer de operator een foute aanbeveling volgt, de piloot die een defect instrument vertrouwt. Fouten van omissie gebeuren wanneer de operator een probleem mist dat de automatisering niet signaleerde, terwijl hij stilletjes zijn eigen monitoring had teruggetrokken. Beide vertalen zich netjes naar engineering met agents: een subtiel foute migratie mergen is commissie, aannemen dat de agent het beveiligingsgat wel zou hebben genoemd is omissie.
Taalmodellen vormen een ongewoon krachtige trigger omdat hun oppervlakte-eigenschappen elk geloofwaardigheidssignaal nabootsen waarop engineers vertrouwen. De code is idiomatisch, de comments zijn netjes, de uitleg is gestructureerd en zelfverzekerd, en niets daarvan correleert met correctheid. Een menselijke reviewer kalibreert op collega's, waar slordige presentatie losjes slordig denken voorspelt, en die kalibratie faalt tegen een systeem wier foute antwoorden even mooi gezet zijn als de juiste. AI sycophancy scherpt de val aan: daag het model uit en het kan buigen en het met je eens zijn, of je geruststellen dat de code prima is, dus de "tweede mening" is eigenlijk de eerste in een nieuwe hoed.
Er is ook een versterkende lus met vaardigheidsverval. Output diep verifiëren vereist scherpe vaardigheden; skill atrophy maakt diepe verificatie moeilijker; moeilijkere verificatie wordt overgeslagen; overgeslagen verificatie betekent minder oefening. Een CHI 2025-studie van 319 kenniswerkers door Microsoft Research vond dat hoger vertrouwen in GenAI samenhing met minder kritisch denken, terwijl hoger vertrouwen in eigen vaardigheden samenhing met meer [2]. Teams drijven af naar rubber-stamp-review zonder enige individuele beslissing daartoe, en daarom zijn werkende tegenmaatregelen structureel: human-in-the-loop-poorten op ingrijpende acties, reviewchecklists die vereisen dat de reviewer zegt wat hij verifieerde in plaats van alleen goed te keuren, en tests onafhankelijk geschreven van de code die ze toetsen.
Voorbeeld
Een agent produceert een databasemigratie voor een hernoeming: schone SQL, verstandige comments, een rollback-script. De reviewer bladert erdoorheen, merkt dat het grondig lijkt, en keurt goed. In productie laat de migratie een kolom vallen en opnieuw aanmaken in plaats van hernoemen, en de kopieerstap slaat stilletjes rijen over die een null-check falen, wat data verliest voor ongeveer 3 procent van de accounts. In de postmortem is de reviewer eerlijk: een handgeschreven migratie zou regel voor regel tegen het schema zijn gecontroleerd, maar deze "zag eruit alsof hij wist wat hij deed." Die zin is automation bias in zijn natuurlijke habitat. De fix die het team adopteert is mechanisch in plaats van motivationeel: destructieve migraties vereisen nu dat de reviewer de verwachte rijaantallen voor en na opschrijft en ze op staging verifieert.
Veelvoorkomende misvattingen
De geruststellende aanname is dat ervaring je immuun maakt, dat senioren hier niet intrappen. METR's gerandomiseerde studie van 2025 liet zien hoe slecht zelfs veteranen de machine beoordelen: 16 ervaren open-source-developers deden er 19% langer over bij echte taken met AI-tools, maar geloofden zelfs na afloop dat de AI hen met 20% had versneld, terwijl ze vooraf een versnelling van 24% hadden verwacht [3]. Senior engineers bezwijken op schaal, om twee structurele redenen. Ten eerste versterkt de bias naarmate de tool verbetert: na maanden waarin een agent negen van de tien keer gelijk had, voelt de tiende diep controleren irrationeel aan tot het dat niet is, dus fokken betere modellen zwakkere review. Ten tweede reviewen senioren meer agentoutput dan wie dan ook, dus krijgen ze meer blootstelling aan de val. Automation bias behandelen als een competentieprobleem richt de fix op de verkeerde laag. Het is een bedradingsprobleem, en het antwoord is workflows ontwerpen waar vertrouwen per wijziging verdiend moet worden, niet per tool aangenomen.
FAQ
Wat is het verschil tussen automation bias en zelfgenoegzaamheid? Ze zijn nauwe verwanten en worden vaak op een hoop gegooid. Zelfgenoegzaamheid is de verminderde waakzaamheid, minder toezicht houden op de automatisering omdat het meestal werkt. Automation bias is het beslissingsniveau-effect, de output van de machine zwaarder wegen dan ander bewijs, inclusief je eigen oordeel. Zelfgenoegzaamheid is hoe je stopt met kijken; bias is hoe je instemt wanneer je wel kijkt.
Hoe bestrijd je automation bias bij het reviewen van AI-code? Verander wat goedkeuring betekent. Vereis dat reviewers zeggen wat ze hebben geverifieerd, draai de code in plaats van hem te lezen, houd tests en reviews onafhankelijk van de generatiesessie, en poort onomkeerbare acties achter expliciete menselijke goedkeuring. Alles wat "ziet er goed uit" omzet in "dit specifieke ding gecontroleerd" werkt; sfeer-scepsis niet.
Verdwijnt automation bias naarmate AI betrouwbaarder wordt? Het intensiveert. Stijgende betrouwbaarheid is precies wat waakzaamheid wegtraint, en de resterende fouten van een zeer betrouwbaar systeem zijn precies degene waar niemand op let. Hoe beter de tool, hoe doelbewuster het controleren geëngineerd moet worden.
Bronnen
- Stack Overflow Developer Survey. "Slechts 33% van de developers vertrouwt de nauwkeurigheid van AI-output (3% sterk), 46% wantrouwt het actief, en toch gebruikt 51% van de professionele developers AI-tools dagelijks." https://survey.stackoverflow.co/2025/ai. Geraadpleegd augustus 2026.
- Microsoft Research (CHI 2025). "In een studie van 319 kenniswerkers hing hoger vertrouwen in GenAI samen met minder kritisch denken, terwijl hoger zelfvertrouwen samenhing met meer kritisch denken." https://www.microsoft.com/en-us/research/publication/the-impact-of-generative-ai-on-critical-thinking-self-reported-reductions-in-cognitive-effort-and-confidence-effects-from-a-survey-of-knowledge-workers/. Geraadpleegd augustus 2026.
- METR. "In een gerandomiseerde studie uit 2025 deden 16 ervaren open-source-developers er 19% langer over bij echte taken met AI-tools maar geloofden ze dat AI hen 20% had versneld, na een verwachting van 24%." https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/. Geraadpleegd augustus 2026.
Related terms
Ready to build your product?

