NAiOS IconNAiOS Logo
NAiOS Wiki

Mélange d'experts (MoE)

También: MoE · Mélange d'experts · modèle d'experts · architecture MoE

Architecture qui n'active que certaines parties du modèle selon la tâche

1 min de lectura

La Mixture of Experts (MoE) est une architecture de réseaux de neurones qui divise le modèle en plusieurs sous-réseaux spécialisés, appelés experts. Un composant dénommé routeur (ou gating network) décide, pour chaque entrée, quels experts activer. Au lieu de faire passer chaque token par tous les paramètres du modèle, seul un sous-ensemble est utilisé, ce que l'on appelle l'activation parcimonieuse (sparse activation).

Son importance réside dans l'efficacité : elle permet de faire évoluer le nombre total de paramètres sans augmenter proportionnellement le coût de calcul lors de l'inférence. Un modèle MoE peut posséder des centaines de milliards de paramètres tout en n'activant qu'une fraction par token, offrant ainsi une grande capacité à un coût raisonnable.

Quelques nuances pratiques à prendre en compte :

  • L'équilibrage de charge entre les experts est critique ; si le routeur favorise toujours les mêmes, les autres restent sous-utilisés.
  • Cela nécessite plus de mémoire, car tous les experts doivent être chargés même s'ils ne sont pas utilisés.

Des modèles tels que Mixtral 8x7B ou plusieurs versions de GPT utilisent cette approche pour combiner puissance et efficacité.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog