Hero Image full

Mixture of Experts

7 min read
Content

Was ist Mixture of Experts?

Mixture of Experts (MoE) ist eine neuronale Netzwerkarchitektur, bei der jedes Token nur eine kleine Teilmenge der Modellparameter aktiviert, ausgewählt durch einen gelernten Router. Das Modell kann eine sehr große Gesamtparameterzahl halten, während es pro Anfrage die Rechenleistung eines weit kleineren Modells aufwendet, was die Inferenzkosten senkt.

Die wichtigsten Punkte

  • MoE trennt Modellgröße von Rechenkosten: Ein Modell kann Hunderte Milliarden Gesamtparameter haben, während pro Token nur ein Bruchteil davon aktiviert wird.
  • Die "Experten" sind austauschbare Subnetzwerke, die von einem Router in jedem Layer ausgewählt werden, keine Spezialisten für menschliche Themen wie Recht oder Medizin.
  • Die meisten Frontier- und Open-Weight-Flaggschiffmodelle nutzen inzwischen MoE, weil es bessere Qualität pro Inferenz-Dollar liefert als dichte Modelle zu denselben Kosten.
  • Für Self-Hosting verschiebt MoE den Engpass auf Speicher: Alle Experten müssen geladen werden, obwohl pro Token nur wenige laufen.

So funktioniert es

Ein standardmäßiges dichtes Transformer-Modell führt jeden Input durch jeden Parameter. MoE ersetzt den Feed-Forward-Block in jedem Transformer-Layer durch einen Pool paralleler Subnetzwerke, genannt Experten, plus ein kleines Router-Netzwerk. Für jedes Token auf jedem Layer bewertet der Router alle Experten und schickt das Token durch die obersten paar, üblicherweise zwei von irgendwo zwischen acht und weit über hundert. Die Outputs der gewählten Experten werden kombiniert und weitergegeben. Da nur die ausgewählten Experten rechnen, bleibt die Zahl aktiver Parameter pro Token klein, selbst wenn die Gesamtparameter wachsen. Mistrals Mixtral 8x7B zeigt das Verhältnis in der Praxis: Jedes Token hat Zugriff auf 47B Parameter, aber nur 13B sind während der Inferenz aktiv, und das Paper von 2024 berichtet, dass es Llama 2 70B und GPT-3.5 in jedem evaluierten Benchmark erreicht oder übertrifft [1].

Training hält den Router ehrlich mit Load-Balancing-Zielen, denn ein fauler Router, der alles zu ein paar Lieblingsexperten leitet, verschwendet den Rest des Netzwerks. Die Idee zahlt sich auch während des Trainings selbst aus: Googles Switch Transformer von 2021 nutzte Sparse Routing, um Modelle mit bis zu einer Billion Parametern vorzutrainieren und erreichte bis zu 7x schnelleres Pretraining als T5-Baselines beim gleichen Rechenbudget [2]. Zur Inferenzzeit ist die Ökonomie eigenartig. Rechenaufwand pro Token folgt den aktiven Parametern, sodass Latenz und Kosten pro Token einem kleineren Modell ähneln. Speicher bekommt nicht denselben Rabatt: Jeder Experte muss im Beschleunigerspeicher bereitliegen, um ausgewählt werden zu können, sodass das Servieren eines MoE den VRAM der vollen Parameterzahl braucht. Deshalb lieben API-Anbieter die Architektur, da sie Speicher über viele Nutzende amortisieren, während ein einzelner Entwickler, der ein Modell lokal betreibt, die Speicherkosten direkt spürt. Kombiniert mit einem Inferenzansatz wie Quantisierung ist MoE ein großer Teil davon, warum Zugang zu fähigen Modellen billig wurde.

Beispiel

Ein Plattformteam betreibt einen internen Code-Review-Agenten, der jeden Pull Request im Unternehmen verarbeitet, mehrere Tausend am Tag. Bei einem dichten Frontier-Modell machten die Token-Kosten pro Review einen vollständigen Rollout schwer zu rechtfertigen, also wechselten sie die Routine-Stufe zu einem Open-Weight-MoE-Modell mit großer Gesamtparameterzahl, aber nur einem kleinen aktiven Anteil pro Token, gehostet über einen Inferenzanbieter. Die Review-Qualität bei Stil, Bug-Erkennung und Testabdeckungskommentaren blieb innerhalb ihrer Eval-Toleranz, während die Kosten pro Review weit genug fielen, um auf jedem PR statt nur einer Stichprobe zu laufen. Risikoreiche Diffs eskalieren weiterhin zu einem stärkeren Reasoning-Modell. Am Agenten hat sich nichts geändert; an der Ökonomie des darunterliegenden Modells schon.

Häufige Missverständnisse

Menschen hören "Experten" und stellen sich ein Komitee von Fachspezialisten vor, einer für Python, einer für Poesie, mit dem Router als steuerbarem Dispatcher. Echte Experten bilden keine menschlichen Kategorien ab. Routing passiert pro Token, pro Layer, und die entstehenden Spezialisierungen sind statistische Muster, oft syntaktisch oder positional, die selten mit Themen übereinstimmen. Man kann sich nicht per Prompt zu einem bestimmten Experten durchsteuern, und kein Experte kann als eigenständiges kleines Modell herausgelöst werden. Das Routing ist ein interner Effizienzmechanismus, unsichtbar auf API-Ebene.

FAQ

Warum nutzen so viele LLMs jetzt Mixture of Experts? Weil es das Verhältnis von Qualität zu Kosten verbessert. Das Skalieren der Gesamtparameter erhöht die Fähigkeit, aber dichtes Skalieren erhöht die Inferenzkosten im Gleichschritt. MoE lässt Labs die Kapazität wachsen, während die Rechenleistung pro Token in etwa gleich bleibt, was sich für Käufer als stärkere Modelle zu niedrigeren API-Preisen zeigt. DeepSeek-V3 ist das Muster im Frontier-Maßstab: 671B Gesamtparameter mit nur 37B aktiviert pro Token, trainiert in 2,788 Millionen H800-GPU-Stunden laut seinem technischen Bericht von 2024 [3].

Ändert Mixture of Experts, wie ich promptet oder Agenten baue? Nein. Routing ist auf API-Ebene unsichtbar. Wo es zählt, ist Beschaffung und Hosting: MoE-Modelle unterbieten dichte Konkurrenten oft beim Preis pro Token, und wenn Sie selbst hosten, planen Sie den Speicher anhand der Gesamtparameter, nicht der aktiven.

Ist ein Mixture-of-Experts-Modell weniger konsistent als ein dichtes Modell? Routing-Entscheidungen können Outputs etwas empfindlicher gegenüber kleinen Input-Änderungen machen, und Batching-Effekte bedeuten, dass exakte Reproduzierbarkeit selbst bei Temperatur null nicht garantiert ist. In der Praxis ist das gering; dicht servierte Modelle im großen Maßstab zeigen ähnlichen Nichtdeterminismus.

Quellen

  1. Mistral AI (arXiv). "Mixtral 8x7B nutzt 13B aktive von 47B Gesamtparametern pro Token und erreicht oder übertrifft Llama 2 70B und GPT-3.5 über alle Benchmarks hinweg." https://arxiv.org/abs/2401.04088. Abgerufen im August 2026.
  2. Google Research (arXiv). "Switch Transformer trainiert Billionen-Parameter-Sparse-Modelle mit bis zu 7x schnellerem Pretraining als T5 beim gleichen Rechenaufwand vor." https://arxiv.org/abs/2101.03961. Abgerufen im August 2026.
  3. DeepSeek-AI (arXiv). "DeepSeek-V3 aktiviert 37B von 671B Parametern pro Token und wurde in 2,788 Millionen H800-GPU-Stunden trainiert." https://arxiv.org/abs/2412.19437. Abgerufen im August 2026.
Let’s get in touch

Ready to build your product?

Book a consultation call to get a free No-Code assessment and scope estimation for your project.
Book a consultation call to get a free No-Code assessment and scope estimation for your project.