Hero Image full

Agentzwerm

7 min read
Content

Wat is een agentzwerm?

Een agentzwerm is een groep AI-agents die parallel wordt ingezet op hetzelfde probleem, of op veel deelstukken ervan, waarbij de outputs achteraf worden samengevoegd, gerangschikt of erover gestemd. De aanpak ruilt extra rekenkracht en tokens in voor bredere dekking en meer zekerheid dan één enkele agent-run kan bieden.

De belangrijkste punten

  • Zwermen benutten het feit dat agent-runs goedkoop te parallelliseren en niet-deterministisch zijn. Tien pogingen op een lastige bug leggen fixes bloot die één poging mist.
  • Het moeilijke deel is aggregatie. Fan-out is één API-aanroep in een lus; bepalen welk van tien kandidaat-resultaten juist is, vergt tests, stemming of een judge-model.
  • Zwermen passen bij taken die netjes op te delen zijn (400 bestanden migreren, elk endpoint auditen) of profiteren van onafhankelijke pogingen (debuggen, onderzoek, concurrerende concepten).
  • Kosten schalen lineair met de zwermgrootte terwijl het marginale voordeel afneemt, dus de meeste praktische zwermen draaien vijf tot twintig agents in plaats van honderden.
  • Isolatie is belangrijk. Parallelle agents die dezelfde working tree bewerken, verstoren elkaar, en daarom leunt zwermtooling op git worktrees en sandbox-omgevingen.

Hoe het werkt

Een zwerm-run kent drie fasen. Eerst fan-out: een coördinator, hetzij een script hetzij een orchestrator-agent, spawnt veel werker-agents. Voor deelbaar werk krijgt elke werker een deelstuk, zoals één module van een codebase om te refactoren. Voor redundant werk krijgt elke werker exact dezelfde taak, en komt de diversiteit uit samplingtoeval of bewust gevarieerde prompts en modellen. Redundantie alleen al verlegt de cijfers: Li et al. lieten in 2024 zien dat GPT-3.5-Turbo met een sampling-en-stem-ensemble van 20 agents de nauwkeurigheid van GPT-4 evenaarde, en dat Llama2-13B met 15 agents Llama2-70B evenaarde op GSM8K, een winst van 24 procentpunt van 35% naar 59% [1].

Ten tweede onafhankelijke uitvoering. Elke werker draait zijn eigen lus met zijn eigen contextvenster, wat een stil voordeel is: honderd kleine contexten blijven gefocust waar één gigantische context verslechtert. Werkers schrijven naar geïsoleerde omgevingen zodat hun wijzigingen nooit botsen, en een mislukte of vastgelopen werker wordt gewoon weggegooid in plaats van gedebugd.

Ten derde aggregatie, waar zwermen slagen of falen. Verifieerbare outputs zijn het makkelijke geval: draai de testsuite tegen elke kandidaat-patch en hou de patches aan die slagen. Zachtere outputs hebben meerderheidsstemming, een LLM-judge of een mens die uit een shortlist kiest nodig. Stemming heeft een solide onderzoekspedigree: Wang et al. ontdekten dat het samplen van meerdere redeneerpaden en het nemen van het meerderheidsantwoord, bekend als self-consistency, de chain-of-thought-nauwkeurigheid met 17,9 punten verbeterde op GSM8K, 11,0 op SVAMP en 12,2 op AQuA [2]. Deze structuur verschilt van een typisch multi-agentsysteem, waar gespecialiseerde agents samenwerken via overdrachten. Zwermwerkers praten nooit met elkaar, en juist die onafhankelijkheid maakt ze triviaal parallelliseerbaar en statistisch nuttig.

Voorbeeld

Een platformteam moet 340 diensten upgraden van een verouderde logging-library. Een coördinatorscript verdeelt de repolijst en start één werker-agent per dienst in zijn eigen worktree, dertig tegelijk. Elke werker past de migratie toe, draait de tests van die dienst en opent alleen een concept-PR als de tests slagen. 's Nachts migreren 291 diensten schoon, falen 34 op tests en worden opnieuw geprobeerd met de foutmelding toegevoegd aan de prompt, en belanden 15 in een wachtrij voor menselijke aandacht. Het team reviewt een dag lang PR's in plaats van een maand lang diensten met de hand te migreren.

Veelvoorkomende misvattingen

De misvatting is dat meer agents meer intelligentie betekent. Een zwerm redeneert niet beter dan zijn individuele leden; hij bemonstert alleen meer pogingen uit dezelfde verdeling. Als een enkele agent een taak 2% van de tijd goed doet, laten vijftig parallelle runs je nog steeds door grotendeels foute antwoorden ploeteren, zonder betrouwbare manier om het goede eruit te pikken. Zwermen versterken een redelijke uitgangswaarde tot een sterk resultaat. Ze kunnen geen taak redden die het onderliggende model fundamenteel niet kan, en zonder een betrouwbare verifier genereren ze vooral dure ruis.

FAQ

Hoe verschilt een agentzwerm van agentorchestratie? Orchestratie is de algemene praktijk van het coördineren van meerdere agents, inclusief pipelines en hiërarchieën met rijke onderlinge communicatie. Een zwerm is het specifieke patroon van veel onafhankelijke, parallelle werkers met aggregatie aan het eind. Elke zwerm is georkestreerd; de meeste orchestratie is geen zwerm.

Wanneer is een zwerm de tokenkosten waard? Wanneer het werk in onafhankelijke eenheden op te delen is, wanneer er een goedkope automatische verifier bestaat (tests, compilers, linters), of wanneer de kosten van een fout antwoord de kosten van redundante pogingen ver overstijgen. Voor sequentiële taken zonder verifier is een enkele zorgvuldige agent met human-in-the-loop-review meestal goedkoper en veiliger. Begroot de ruil eerlijk: Anthropic mat dat multi-agentsystemen ongeveer 15 keer meer tokens gebruiken dan een chatinteractie, en op zijn BrowseComp-evaluatie verklaarde tokengebruik alleen al 80% van de prestatievariatie [3].

Hoeveel agents moet een zwerm draaien? Begin klein, rond de vijf, en meet. Voor redundante pogingen neemt de opbrengst snel af zodra de slaagpool van de verifier regelmatig niet leeg is. Voor verdeeld werk volgt de grootte het aantal deelstukken, afgeremd door rate limits en hoe snel mensen de output kunnen reviewen.

Bronnen

  1. Li et al., "More Agents Is All You Need" (arXiv). "GPT-3.5-Turbo met 20 agents evenaart GPT-4; Llama2-13B met 15 agents evenaart Llama2-70B op GSM8K." https://arxiv.org/html/2402.05120v2. Geraadpleegd augustus 2026.
  2. Wang et al. (arXiv). "Self-consistency verbetert chain-of-thought-nauwkeurigheid met +17,9% op GSM8K, +11,0% op SVAMP, +12,2% op AQuA." https://arxiv.org/abs/2203.11171. Geraadpleegd augustus 2026.
  3. Anthropic. "Multi-agentsystemen gebruiken ongeveer 15 keer meer tokens dan chat; tokengebruik verklaart 80% van de prestatievariatie op BrowseComp." https://www.anthropic.com/engineering/built-multi-agent-research-system. Geraadpleegd augustus 2026.
Let’s get in touch

Ready to build your product?

Book a consultation call to get a free No-Code assessment and scope estimation for your project.
Book a consultation call to get a free No-Code assessment and scope estimation for your project.