Hero Image full

Mixture of Experts

7 min read
Content

Wat is Mixture of Experts?

Mixture of experts (MoE) is een neurale netwerkarchitectuur waarin elk token slechts een kleine subset van de parameters van het model activeert, gekozen door een geleerde router. Het model kan een zeer groot totaal parameteraantal houden terwijl het de rekenkracht van een veel kleiner model besteedt aan elk verzoek, wat inferentiekosten verlaagt.

De belangrijkste punten

  • MoE scheidt modelgrootte van rekenkosten: een model kan honderden miljarden totale parameters hebben terwijl het maar een fractie per token activeert.
  • De "experts" zijn verwisselbare subnetwerken geselecteerd door een router op elke laag, geen specialisten in menselijke onderwerpen zoals recht of geneeskunde.
  • De meeste frontier- en open-weight-vlaggenschipmodellen gebruiken nu MoE omdat het betere kwaliteit per dollar inferentie levert dan dense modellen tegen dezelfde kosten.
  • Voor self-hosting verschuift MoE het knelpunt naar geheugen: alle experts moeten geladen worden ook al draaien er maar een paar per token.

Hoe het werkt

Een standaard dense transformer-model draait elke input door elke parameter. MoE vervangt het feed-forward-blok in elke transformer-laag door een pool van parallelle subnetwerken genaamd experts, plus een klein routernetwerk. Voor elk token bij elke laag scoort de router alle experts en stuurt het token door de topfractie, gangbaar twee van ergens tussen acht en ruim honderd. De outputs van de gekozen experts worden gecombineerd en doorgegeven. Omdat alleen de geselecteerde experts rekenen, blijft het aantal actieve parameters per token klein zelfs als totale parameters groeien. Mistrals Mixtral 8x7B toont de verhouding in de praktijk: elk token heeft toegang tot 47B parameters maar slechts 13B zijn actief tijdens inferentie, en de paper van 2024 meldt dat het Llama 2 70B en GPT-3.5 evenaart of verslaat op elke geëvalueerde benchmark [1].

Training houdt de router eerlijk met load-balancing-doelen, want een luie router die alles naar een paar favoriete experts kanaliseert, verspilt de rest van het netwerk. Het idee betaalt zich ook uit tijdens training zelf: Googles Switch Transformer van 2021 gebruikte sparse routing om modellen tot een biljoen parameters voor te trainen, en bereikte tot 7x sneller pretraining dan T5-baselines bij hetzelfde rekenbudget [2]. Op inferentiemoment is de economie onderscheidend. Rekenkracht per token volgt actieve parameters, dus lijken latentie en kosten per token op die van een kleiner model. Geheugen krijgt niet dezelfde korting: elke expert moet in acceleratorgeheugen zitten klaar om gekozen te worden, dus vergt het bedienen van een MoE de VRAM van het volledige parameteraantal. Daarom houden API-aanbieders van de architectuur, want ze amortiseren geheugen over veel gebruikers, terwijl een individuele developer die één model lokaal draait de geheugenkost direct voelt. Gecombineerd met een inferentieaanpak zoals kwantisering is MoE een groot deel van waarom toegang tot capabele modellen goedkoop werd.

Voorbeeld

Een platformteam draait een interne code-review-agent die elke pull request in het bedrijf verwerkt, enkele duizenden per dag. Op een dense frontier-model maakte de tokenkost per review volledige uitrol lastig te rechtvaardigen, dus schakelden ze de routinelaag over naar een open-weight-MoE-model met een groot totaal parameteraantal maar slechts een kleine fractie actief per token, gehost via een inferentieaanbieder. Reviewkwaliteit op stijl, bugsignalering, en testdekking-commentaar bleef binnen hun evaltolerantie, terwijl kosten per review ver genoeg daalden om op elke PR te draaien in plaats van een gesamplede subset. Hoog-risico-diffs escaleren nog steeds naar een sterker reasoning-model. Er veranderde niets aan de agent; de economie van het onderliggende model wel.

Veelvoorkomende misvattingen

Mensen horen "experts" en stellen zich een comité van domeinspecialisten voor, één voor Python, één voor poëzie, met de router als dispatcher die je zou kunnen sturen. Echte experts mappen niet naar menselijke categorieën. Routering gebeurt per token, per laag, en de specialisaties die ontstaan zijn statistische patronen, vaak syntactisch of positioneel, die zelden aansluiten bij onderwerpen. Je kunt je niet naar een specifieke expert toe promten, en geen enkele expert kan als standalone klein model eruit getrokken worden. De routering is een intern efficiëntiemechanisme, onzichtbaar op API-niveau.

FAQ

Waarom gebruiken zoveel LLM's nu mixture of experts? Omdat het de kwaliteit-tot-kosten-verhouding verbetert. Totale parameters schalen verhoogt capaciteit, maar dense scaling verhoogt inferentiekosten in gelijke tred. MoE laat labs capaciteit laten groeien terwijl ze rekenkracht per token ongeveer vlak houden, wat voor kopers verschijnt als sterkere modellen tegen lagere API-prijzen. DeepSeek-V3 is het patroon op frontier-schaal: 671B totale parameters met slechts 37B geactiveerd per token, getraind in 2,788 miljoen H800-GPU-uren volgens zijn technische rapport van 2024 [3].

Verandert mixture of experts hoe ik prompt of agents bouw? Nee. Routering is onzichtbaar op API-niveau. Waar het toe doet is inkoop en hosting: MoE-modellen onderbieden vaak dense concurrenten op prijs per token, en als je self-host, plan geheugen rond totale parameters, niet actieve.

Is een mixture-of-experts-model minder consistent dan een dense model? Routeringsbeslissingen kunnen outputs een beetje gevoeliger maken voor kleine inputwijzigingen, en batching-effecten betekenen dat exacte reproduceerbaarheid niet gegarandeerd is zelfs bij temperatuur nul. In de praktijk is dit minor; dense modellen gehost op schaal tonen vergelijkbaar non-determinisme.

Bronnen

  1. Mistral AI (arXiv). "Mixtral 8x7B gebruikt 13B actief van 47B totale parameters per token en evenaart of verslaat Llama 2 70B en GPT-3.5 over benchmarks." https://arxiv.org/abs/2401.04088. Geraadpleegd augustus 2026.
  2. Google Research (arXiv). "Switch Transformer traint biljoen-parameter sparse modellen voor met tot 7x sneller pretraining dan T5 bij dezelfde rekenkracht." https://arxiv.org/abs/2101.03961. Geraadpleegd augustus 2026.
  3. DeepSeek-AI (arXiv). "DeepSeek-V3 activeert 37B van 671B parameters per token en werd getraind in 2,788M H800-GPU-uren." https://arxiv.org/abs/2412.19437. Geraadpleegd augustus 2026.
Let’s get in touch

Ready to build your product?

Book a consultation call to get a free No-Code assessment and scope estimation for your project.
Book a consultation call to get a free No-Code assessment and scope estimation for your project.