
Wat is Computer Use?
Computer use is een AI-agentcapaciteit waarbij het model een computer bedient via zijn grafische interface: het kijkt naar screenshots, beweegt de cursor, klikt, typt, en scrollt, precies zoals een mens dat zou doen. Dit laat een agent werken met elke applicatie op het scherm, inclusief software die geen API biedt voor gestructureerde toegang.
De belangrijkste punten
- De interface is pixels en input-events. Het model neemt het scherm visueel waar en handelt via synthetische muis- en toetsenbordevents, dus hoeft er niets aan de doelapplicatie te veranderen.
- Zijn waarde is universaliteit. Legacy desktopsoftware, virtuele desktops, adminconsoles, en long-tail-webapps worden allemaal automatiseerbaar zonder integratiewerk.
- Het is de traagste en minst betrouwbare tool die een agent heeft. Elke stap kost een screenshot-rondreis, dus grijpen goed ontworpen agents eerst naar API's en pas als laatste naar de GUI.
- Sandboxing is niet-onderhandelbaar. Een agent die overal op kan klikken kan ook op "Verwijderen" klikken, dus draait computer use in een VM of geïsoleerde desktop met afgebakende credentials.
Hoe het werkt
De lus is perceptie en actie. De harness legt een screenshot vast en stuurt hem naar het model samen met het doel en de geschiedenis tot nu toe. Het model redeneert over wat op het scherm staat, en geeft dan een low-level actie af: beweeg de cursor naar coördinaten, klik, dubbelklik, sleep, typ tekst, druk een toetsencombinatie, scroll. De harness voert de actie uit tegen een echt of virtueel scherm, wacht tot de UI tot rust komt, legt een vers screenshot vast, en de cyclus herhaalt. Frontier-modellen zijn specifiek getraind voor deze grounding-taak, en mappen visuele elementen naar precieze coördinaten en herkennen statuswijzigingen zoals dialogen, spinners, en validatiefouten. Die training toont in benchmarks: Claude 3.5 Sonnet, het eerste frontier-model dat computer use bood, scoorde 14,9% op OSWorlds screenshot-only-categorie in 2024, bijna het dubbele van de 7,8% van het op één na beste systeem [1].
Omdat elke cyclus visie-inferentie omvat, is computer use een ordegrootte trager dan directe tool calling. Productieagents behandelen het daarom als één tool onder verschillende. Als de taak via een API, een databasequery, of een CLI kan, winnen die routes op snelheid en determinisme; het GUI-pad is gereserveerd voor de systemen die niets beters bieden. Betrouwbaarheidsengineering richt zich op verificatie, de agent laten bevestigen vanuit het volgende screenshot dat de bedoelde wijziging daadwerkelijk gebeurde, en op herstel, want misklikken, focusproblemen, en onverwachte pop-ups zijn routine. De afstand tot menselijke betrouwbaarheid is nog groot: op de OSWorld-benchmark van echte computertaken, gepubliceerd in 2024, slagen mensen bij meer dan 72% van de taken terwijl het beste AI-model bij lancering slechts 12,24% behaalde [2].
Het beveiligingsmodel verdient nadruk. Een computer-use-agent erft wat de desktopsessie ook kan doen, en alles wat hij op het scherm leest, komt zijn context binnen, wat prompt injection via vijandige pagina-inhoud een levende dreiging maakt. Standaardpraktijk is een wegwerp-VM, een dedicated account met lage rechten, geen toegang tot persoonlijke sessies, en menselijke bevestiging voor onomkeerbare acties.
Voorbeeld
Een financeteam moet maandelijkse leveranciersfacturen ophalen van elf leveranciersportalen, waarvan de meeste geen API hebben en twee verouderde desktop-era-webapps zijn. Een agent met computer use logt op elk portaal in binnen een sandboxed browser-VM met vault-afgebakende credentials, navigeert naar de facturatiesectie, stelt het datumfilter in, downloadt de PDF's, en archiveert ze in de accounting-share met een genormaliseerd naamgevingsschema. Wanneer één portaal sinds vorige maand zijn navigatie heeft herontworpen, breekt de agent niet zoals een gescriptte bot zou doen; hij leest de nieuwe layout van het screenshot, vindt het verplaatste "Statements"-menu, en voltooit de run, met de wijziging genoteerd in zijn log.
Veelvoorkomende misvattingen
De terugkerende fout is computer use behandelen als de standaardmanier waarop agents met software moeten interageren, omdat het het meest algemeen oogt. Algemeenheid is precies wat het een laatste redmiddel maakt. Een GUI-sessie is traag, stateful, en fragiel vergeleken met een API-aanroep, en vermenigvuldigt tokenkosten door screenshots. Teams die alles via een virtuele desktop routeren, bouwen agents die indrukwekkend zijn in demo's en pijnlijk in productie. De discipline is een toolhiërarchie: gestructureerde interfaces eerst, browserautomatisering daarna, ruwe computer use alleen voor de software die geen alternatief biedt.
FAQ
Hoe verschilt computer use van een browseragent? Bereik. Een browseragent is beperkt tot webpagina's en kan vaak de DOM-structuur van de pagina direct lezen, wat sneller en preciezer is. Computer use bedient het hele besturingssysteem vanuit pixels, en dekt desktopapplicaties, bestandsbeheerders, en alles anders op het scherm. Veel stacks combineren beide, met DOM-gebaseerd browsen waar mogelijk en terugvallend op schermbesturing elders.
Is computer-use-AI betrouwbaar genoeg voor productie? Voor begrensde, verifieerbare workflows, ja, met engineering eromheen: deterministische checkpoints, screenshot-gebaseerde verificatie na elke kritieke stap, retry-logica, en menselijke review van uitkomsten. Lange vrije-vorm-sessies over onbekende interfaces falen nog te vaak om onbewaakt te draaien. Extra iteratie helpt maar dicht de kloof niet; Anthropic meldde in 2024 dat het toestaan van meer stappen per taak Claude 3.5 Sonnets OSWorld-score naar 22,0% tilde, nog steeds ver onder menselijke prestaties [3].
Waarom niet gewoon de UI scripten met traditionele automatiseringstools? Gescriptte UI-automatisering codeert exacte selectors en coördinaten, dus breekt hij bij elke interfacewijziging en moet per applicatie onderhouden worden. Een computer-use-agent neemt de interface elke keer waar, wat snelheid ruilt voor veerkracht en het meeste van de onderhoudslast wegneemt.
Bronnen
- Anthropic. "Claude 3.5 Sonnet scoorde 14,9% op OSWorlds screenshot-only-categorie, bijna het dubbele van de 7,8% van het op één na beste systeem." https://www.anthropic.com/news/3-5-models-and-computer-use. Geraadpleegd augustus 2026.
- OSWorld (arXiv). "Mensen slagen bij meer dan 72,36% van OSWorld-taken; het beste AI-model bij lancering behaalde 12,24%." https://arxiv.org/abs/2404.07972. Geraadpleegd augustus 2026.
- Anthropic. "Met meer toegestane stappen steeg Claude 3.5 Sonnets OSWorld-score naar 22,0%." https://www.anthropic.com/news/3-5-models-and-computer-use. Geraadpleegd augustus 2026.
Related terms
Ready to build your product?

