La Mixture of Experts (MoE) és una arquitectura de xarxes neuronals que divideix el model en múltiples subxarxes especialitzades, anomenades experts. Un component denominat router (o gating network) decideix, per a cada entrada, quins experts activar. En lloc de fer passar cada token per tots els paràmetres del model, només s'utilitza un subconjunt, el que es coneix com a activació dispersa (sparse activation).
La seva importància rau en l'eficiència: permet escalar el nombre total de paràmetres sense disparar proporcionalment el cost de còmput en inferència. Un model MoE pot tenir centenars de milers de milions de paràmetres però activar només una fracció per token, oferint una gran capacitat a un cost raonable.
Alguns matisos pràctics a tenir en compte:
- L'equilibri de càrrega entre experts és crític; si el router afavoreix sempre els mateixos, els altres queden infrautilitzats.
- Requereix més memòria, ja que tots els experts han d'estar carregats encara que no s'utilitzin.
Models com Mixtral 8x7B o diverses versions de GPT empren aquest enfocament per combinar potència i eficiència.