Hero Image full

AI-sandbox

7 min read
Content

Wat is een AI-sandbox?

Een AI-sandbox is een geïsoleerde uitvoeringsomgeving waar een AI-agent code kan draaien, packages kan installeren, en bestanden kan wijzigen zonder productiesystemen, echte credentials, of de hostmachine aan te raken. Alles wat de agent breekt, blijft binnen de grens, wat autonoom werk veilig genoeg maakt om op schaal te delegeren.

De belangrijkste punten

  • Een sandbox beperkt de schaderadius. De agent krijgt een echte shell en een echt bestandssysteem, maar de schade die hij kan aanrichten eindigt bij de container- of VM-grens.
  • Isolatie dekt meer dan bestanden. Een goede sandbox beperkt ook netwerktoegang naar buiten, geheimen, en toegang tot de host, want exfiltratie is net zo gevaarlijk als verwijdering.
  • Sandboxes zijn wat hogere autonomie praktisch maakt. Teams die agents geïsoleerd draaien, kunnen minder individuele acties goedkeuren omdat het ergste geval een wegwerpomgeving is.
  • Een sandbox vult review aan in plaats van het te vervangen. Code verlaat de sandbox via een menselijke of geautomatiseerde poort, en die poort is waar kwaliteit wordt afgedwongen.

Hoe het werkt

De meeste AI-sandboxes zijn gebouwd uit dezelfde primitieven die de rest van de infrastructuur gebruikt: containers, lichtgewicht VM's zoals Firecracker of gVisor-achtige isolatie, of vluchtige cloudmachines. De agent krijgt een werkkopie van de code, vaak een verse git clone of worktree, plus een shell, een package manager, en welke runtimes het project ook nodig heeft. Vanuit het gezichtspunt van de agent ontbreekt niets. Vanuit het gezichtspunt van de operator bevat de omgeving geen productiecredentials, kan hij interne diensten niet bereiken, en kan hij in seconden vernietigd en opnieuw gemaakt worden.

De tweede laag is beleid. Sandboxes handhaven doorgaans een allowlist voor netwerkbestemmingen, zodat een agent uit de packageregistry kan trekken maar geen data naar een willekeurige server kan posten. Dat doet ertoe omdat prompt injection een behulpzame agent kan omzetten in een exfiltratiekanaal, en netwerkcontroles verzachten de aanval zelfs wanneer het model wordt misleid. De dreiging is goed gedocumenteerd: evaluaties van US CAISI in 2025, voorheen het US AI Safety Institute, lieten agents zien die gekaapt werden om data te exfiltreren of kwaadaardige code uit te voeren, waarbij de sterkste nieuwe aanval 81% van de tijd slaagde op AgentDojo Workspace-taken tegenover 11% voor de sterkste baseline [1]. Bestandssysteemafbakening werkt op dezelfde manier: de agent schrijft vrij binnen zijn workspace en nergens anders.

Het laatste stuk is het uitgangspad. Werk verlaat de sandbox als een diff, een pull request, of een artefact, en passeert AI code review of een CI-poort voor het merget. Dit is het patroon achter agentic-coding-platforms en computer-use-systemen in 2026: geef de agent volledige vrijheid binnen de box, en maak de enige deur van de box een gereviewde.

Voorbeeld

Een team vraagt een coding-agent een service te upgraden van Node 20 naar Node 22, een wijziging die lockfiles, CI-configuratie, en een dozijn verouderde API's raakt. De agent draait in een vluchtige container met een kloon van de repo, geen cloudcredentials, en netwerktoegang beperkt tot npm. Hij upgradet, breekt de build twee keer, leest de fouten, herstelt ze, en krijgt de testsuite groen. De engineer kijkt nooit naar de tussenliggende rommel. Ze reviewen de uiteindelijke pull request, het enige dat ooit de sandbox verliet, en mergen.

Veelvoorkomende misvattingen

De veelgemaakte fout is een sandbox behandelen als vervanging voor oordeel over wat wordt uitgeleverd. Isolatie beschermt je infrastructuur tijdens het werk; het zegt niets over de kwaliteit of veiligheid van de output. Een sandboxed agent kan nog steeds onveilige code, gehallucineerde afhankelijkheden, of subtiel foute logica produceren, en dat alles loopt bereidwillig de deur uit als de reviewpoort zwak is. Sandbox de uitvoering, verifieer dan het resultaat.

FAQ

Is een AI-sandbox hetzelfde als een dev container? Ze overlappen maar de bedoeling verschilt. Een dev container standaardiseert een omgeving voor mensen. Een AI-sandbox is ontworpen rond een niet-vertrouwde operator, dus voegt hij egress-controles, credentialafwezigheid, en wegwerpbaarheid toe die een normale dev container niet prioriteert.

Heb ik een sandbox nodig als de agent voor elk commando toestemming vraagt? Goedkeuring per commando werkt voor licht gebruik, maar het begrenst autonomie en traint mensen om ja te klikken. Een sandbox laat je de meeste van die prompts laten vallen omdat de omgeving, in plaats van je aandacht, het risico absorbeert. Anthropic meldde in 2025 dat het sandboxen van de bash-tool van Claude Code met bestandssysteem- en netwerkisolatie de permissieprompts veilig met 84% verlaagde in intern gebruik [2].

Wat hoort binnen de sandbox? Alles wat de taak nodig heeft en niets waar hij misbruik van kan maken: broncode, buildtools, testdata, en afgebakende tokens als een integratie essentieel is. Productiedatabases, echte klantdata, en langlevende credentials blijven buiten.

Bronnen

  1. NIST / Center for AI Standards and Innovation. "Evaluaties van agent-hijacking: sterkste nieuwe aanval slaagde 81% van de tijd op AgentDojo Workspace-taken tegenover 11% voor de sterkste baseline." https://www.nist.gov/news-events/news/2025/01/technical-blog-strengthening-ai-agent-hijacking-evaluations. Geraadpleegd augustus 2026.
  2. Anthropic Engineering. "Sandboxen van de bash-tool van Claude Code verlaagde permissieprompts met 84% in intern gebruik." https://www.anthropic.com/engineering/claude-code-sandboxing. Geraadpleegd augustus 2026.
Let’s get in touch

Ready to build your product?

Book a consultation call to get a free No-Code assessment and scope estimation for your project.
Book a consultation call to get a free No-Code assessment and scope estimation for your project.