A Mixture of Experts (MoE) é unha arquitectura de redes neuronais que divide o modelo en múltiples subredes especializadas, chamadas expertos. Un compoñente denominado router (ou gating network) decide, para cada entrada, que expertos activar. En lugar de facer pasar cada token por todos os parámetros do modelo, só se emprega un subconxunto, o que se coñece como activación dispersa (sparse activation).
A súa importancia reside na eficiencia: permite escalar o número total de parámetros sen disparar proporcionalmente o custo de cómputo en inferencia. Un modelo MoE pode ter centos de miles de millóns de parámetros pero activar só unha fracción por token, ofrecendo gran capacidade a un custo razoable.
Algúns matices prácticos a ter en conta:
- O equilibrio de carga entre expertos é crítico; se o router favorece sempre aos mesmos, outros quedan infrautilizados.
- Require máis memoria, xa que todos os expertos deben estar cargados aínda que non se usen.
Modelos como Mixtral 8x7B ou varias versións de GPT empregan este enfoque para combinar potencia e eficiencia.