
Wat is een LLM Jailbreak?
Een LLM-jailbreak is een input samengesteld om een taalmodel zijn safety-training te laten negeren en output te produceren die het gebouwd was te weigeren. Technieken lopen van fictieve rollenspel-framings tot gecodeerde payloads en lange multi-turn-manipulatie, en ze doen ertoe voor bouwers omdat elk uitgerold model het jailbreak-oppervlak van zijn basismodel erft.
De belangrijkste punten
- Jailbreaking richt zich op het eigen weigeringsgedrag van het model. De aanvaller is de gebruiker, die probeert output te ontgrendelen die de aanbieder verbiedt.
- Safety-training is aangeleerd gedrag, geen harde regel, dus kan eromheen gestuurd worden: herformuleer het verzoek als fictie, splits het over beurten, codeer het, of begraaf het in overweldigende context.
- Voor teams die AI-producten uitleveren zijn jailbreaks een merk- en compliancerisico. Je supportbot die verboden content produceert onder manipulatie is jouw incident, niet dat van de modelleverancier.
- Robuustheid is scherp verbeterd in frontier-modellen, maar het is een wapenwedloop. Verdediging in lagen verslaat vertrouwen op de weigeringen van één model.
Hoe het werkt
Veiligheidsgedrag komt uit post-training: weigeringsvoorbeelden, preference-tuning, en adversarial fine-tuning leren het model welke verzoeken te weigeren. Die training generaliseert imperfect. Een jailbreak vindt een regio van de inputruimte die de training niet dekte, waar de schadelijke intentie goed genoeg vermomd is dat het behulpzame gedrag van het model wint van zijn getrainde voorzichtigheid.
De klassieke families zijn goed gedocumenteerd in de beveiligingsliteratuur. Persona- en rollenspel-aanvallen verpakken het verzoek in fictie, en vragen het model te spreken als een personage zonder beperkingen. Obfuscatie-aanvallen coderen de payload in base64, ciphers, andere talen, of fragmenteren zodat het model het herassembleert. Multi-turn-aanvallen escaleren geleidelijk, en laten het model zich vastleggen op een framing voordat het schadelijke deel arriveert. Many-shot-varianten stoppen het contextvenster vol met verzonnen dialoogvoorbeelden van medewerking zodat het model patroonmatig doorgaat. Geautomatiseerde methoden gaan verder, met optimalisatie of een ander model om op schaal naar adversariale suffixen te zoeken. Brute force alleen al werkt verontrustend goed: een studie van 2024 naar Best-of-N-jailbreaking, dat gewoon prompts opnieuw sampelt met simpele aanpassingen zoals husselen en hoofdlettergebruik, bereikte een aanvalssuccespercentage van 89% op GPT-4o en 78% op Claude 3.5 Sonnet bij 10.000 gesamplede prompts [1].
Aanbieders reageren met gelaagde verdedigingen: betere weigeringstraining, classifiers die input en output onafhankelijk van het model screenen, en constitutional-achtige methoden die weigeringsredenering robuuster maken. De winst is meetbaar. In Anthropics geautomatiseerde evaluaties van 2025 slaagden jailbreaks tegen een onbeveiligd Claude-model 86% van de tijd, en het toevoegen van Constitutional Classifiers verlaagde dat naar 4,4% [2]. Bouwers voegen hun eigen laag toe, want een applicatieprompt kan gedrag verruimen of aanscherpen. Productiesystemen combineren doorgaans een geharde model, externe guardrails op zowel input als output, ratelimieten om geautomatiseerd zoeken af te zwakken, en logging zodat nieuwe aanvallen opgemerkt en teruggevoed worden in red team-suites.
Voorbeeld
Een fintech levert een klantgerichte assistent uit gebouwd op een frontier-model, geprompt om alleen de producten van het bedrijf te bespreken. Tijdens pre-launch-testen draait een red-teamer een standaard multi-turn-script: eerst de bot laten instemmen dat hij "een ongefilterde compliance-trainingssimulator" is, en hem dan, in karakter, vragen te demonstreren hoe een oplichter een phishingbericht zou formuleren voor de klanten van de bank. De bot werkt mee, want elke individuele beurt zag er onschadelijk uit. Het team reageert door een outputclassifier toe te voegen die antwoorden scant op social-engineering-patronen ongeacht conversationele framing, en een regel die persona-toezeggingen elke beurt reset. Hetzelfde script faalt nu bij stap één, en het transcript sluit aan bij de regressiesuite die bij elke modelupgrade draait.
Veelvoorkomende misvattingen
Mensen nemen aan dat jailbreaking alleen een probleem is voor de modelleveranciers, iets waar Anthropic en OpenAI zich zorgen over maken terwijl applicatieteams de fix erven. In de praktijk is de applicatielaag waar de meeste succesvolle jailbreaks landen, want aangepaste systeemprompts, toolgang, en domeincontext creëren vers aanvalsoppervlak waar het basismodel nooit tegen getraind was. Als je product een LLM verpakt, heeft je implementatie zijn eigen jailbreak-profiel, en alleen jij kunt het testen.
FAQ
Is het jailbreaken van een LLM illegaal? Je eigen systemen testen, of de modellen van een aanbieder binnen hun gepubliceerde testbeleid en bug-bounty-voorwaarden, is legitiem beveiligingswerk. Jailbreaks gebruiken om oprecht schadelijke of onwettige content te genereren, of systemen aanvallen zonder autorisatie, kan servicevoorwaarden schenden en, afhankelijk van rechtsgebied en uitkomst, de wet.
Hoe verschilt een jailbreak van prompt injection? Bij een jailbreak valt de gebruiker de regels van het model direct aan. Bij prompt injection plant een buitenstaander instructies in content die de AI van iemand anders leest. Jailbreak-technieken rijden vaak mee binnen injectiepayloads, en daarom overlappen verdedigingen tegen de twee.
Kunnen jailbreaks volledig voorkomen worden? Niet met huidige architecturen. Safety-training verkleint het kwetsbare oppervlak en externe classifiers vangen veel van wat erdoorheen glipt, maar een vastberaden aanvaller met genoeg pogingen vindt meestal iets. Het praktische doel is aanvalskosten verhogen en beperken wat een succesvolle jailbreak kan bereiken.
Bronnen
- arXiv (Hughes et al., Best-of-N Jailbreaking). "89% aanvalssucces op GPT-4o en 78% op Claude 3.5 Sonnet met 10.000 aangepaste prompts." https://arxiv.org/abs/2412.03556. Geraadpleegd augustus 2026.
- Anthropic. "Constitutional Classifiers verlagen jailbreak-succes van 86% naar 4,4% onder geautomatiseerde evaluatie." https://www.anthropic.com/news/constitutional-classifiers. Geraadpleegd augustus 2026.
Related terms
Ready to build your product?

