NAiOS IconNAiOS Logo
NAiOS Wiki

Mixture of Experts (MoE)

También: MoE · Mixture of Experts · Expertenmodell · MoE-Architektur

Architektur, die je nach Aufgabe nur Teile des Modells aktiviert

1 min de lectura

Die Mixture of Experts (MoE) ist eine Architektur für neuronale Netze, die das Modell in mehrere spezialisierte Subnetze unterteilt, die als Experten bezeichnet werden. Eine Komponente namens Router (oder Gating Network) entscheidet für jede Eingabe, welche Experten aktiviert werden. Anstatt jedes Token durch alle Parameter des Modells zu leiten, wird nur eine Teilmenge verwendet, was als spärliche Aktivierung (sparse activation) bezeichnet wird.

Ihre Bedeutung liegt in der Effizienz: Sie ermöglicht es, die Gesamtzahl der Parameter zu skalieren, ohne die Rechenkosten bei der Inferenz proportional in die Höhe zu treiben. Ein MoE-Modell kann Hunderte von Milliarden Parametern haben, aber nur einen Bruchteil pro Token aktivieren, was eine hohe Kapazität zu angemessenen Kosten bietet.

Einige praktische Aspekte, die zu beachten sind:

  • Die Lastverteilung zwischen den Experten ist entscheidend; wenn der Router immer dieselben bevorzugt, bleiben andere ungenutzt.
  • Dies erfordert mehr Speicher, da alle Experten geladen sein müssen, auch wenn sie nicht verwendet werden.

Modelle wie Mixtral 8x7B oder verschiedene Versionen von GPT nutzen diesen Ansatz, um Leistung und Effizienz zu kombinieren.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog