A Mixture of Experts (MoE) é uma arquitetura de redes neuronais que divide o modelo em múltiplas sub-redes especializadas, chamadas especialistas. Um componente denominado router (ou gating network) decide, para cada entrada, que especialistas ativar. Em vez de fazer passar cada token por todos os parâmetros do modelo, apenas se utiliza um subconjunto, o que é conhecido como ativação esparsa (sparse activation).
A sua importância reside na eficiência: permite escalar o número total de parâmetros sem disparar proporcionalmente o custo de computação na inferência. Um modelo MoE pode ter centenas de milhares de milhões de parâmetros, mas ativar apenas uma fração por token, oferecendo grande capacidade a um custo razoável.
Algumas nuances práticas a ter em conta:
- O equilíbrio de carga entre especialistas é crítico; se o router favorecer sempre os mesmos, outros ficam subutilizados.
- Requer mais memória, uma vez que todos os especialistas devem estar carregados, mesmo que não sejam utilizados.
Modelos como o Mixtral 8x7B ou várias versões de GPT utilizam esta abordagem para combinar potência e eficiência.