Was ist MoE?
Mixture of Experts ist eine Modellarchitektur, bei der das neuronale Netz aus vielen spezialisierten Teil-Netzwerken (“Experten”) besteht. Ein Router-Netzwerk entscheidet für jedes einzelne Token, welche Experten aktiviert werden. Die übrigen bleiben inaktiv.
Kernidee: Großes Wissen (viele Parameter), schnelle Inferenz (wenige aktive Parameter).
Funktionsweise
Input-Token
↓
Router-Netzwerk (gating function)
↓
Wählt k von N Experten aus
↓
Nur die k Experten berechnen das Token
↓
Ergebnisse werden gewichtet zusammengeführt
↓
Output-Token
Beispiel gemma4:26b: 128 Experten + 1 gemeinsam genutzter Experte. Pro Token werden nur 8 von 128 aktiviert.
MoE vs. Dense: Vergleich
| Eigenschaft | MoE (gemma4:26b) | Dense (gemma4:31b) |
|---|---|---|
| Gesamtparameter | 25.2B | 30.7B |
| Aktive Parameter pro Token | 3.8B | 30.7B (alle) |
| Experten | 128 + 1 shared | keine (ein großes Netz) |
| Inferenz-Geschwindigkeit | Schneller | Langsamer |
| VRAM-Bedarf | ~16 GB | ~20 GB |
| Qualität (Benchmarks) | Leicht unter Dense | Etwas besser |
Wichtig: Obwohl nur 3.8B Parameter pro Token aktiv sind, müssen alle 25.2B Parameter im VRAM liegen. Der Router muss jederzeit auf jeden Experten zugreifen können.
Wann welche Architektur?
MoE sinnvoll
- Multimodale Aufgaben (Bilder + Text)
- Tiefenanalyse mit Thinking-Modus
- Sehr langer Kontext (256K+)
Dense besser
- Reine Text-Workflows (Ansprüche, Beschreibungen)
- Parallele Multi-Agent-Pipelines
- Deterministische Ausgaben
gemma4-Varianten im Überblick
| Variante | Typ | Aktive Params | Kontext | Zielgerät |
|---|---|---|---|---|
| E2B | Small | 2.3B | 128K | Mobilgeräte |
| E4B | Small | 4.5B | 128K | Laptops |
| 26B | MoE | 3.8B aktiv | 256K | Workstations |
| 31B | Dense | 30.7B (alle) | 256K | Workstations |
Thinking-Modus bei gemma4
gemma4 ist ein Thinking-Modell: es kann vor der Antwort intern “nachdenken”. In der Praxis:
- Normale Requests: Thinking deaktiviert (
think: false), verhindert leere Outputs bei strukturierten Prompts - Tiefenanalyse: Thinking aktiviert, erlaubt gründlichere Analyse, dauert aber 2-5 Minuten
Achtung: gemma4 verwendet einen anderen Disable-Mechanismus als qwen3.5. Der
think: false API-Parameter ist erforderlich. Der /no_think-Prefix aus qwen3 funktioniert bei gemma4 nicht.