El Transformer é unha arquitectura de rede neuronal presentada en 2017 no artigo "Attention Is All You Need". A súa característica distintiva é o mecanismo de atención (self-attention), que permite ao modelo ponderar a importancia de cada palabra en relación con todas as demais dunha secuencia, capturando dependencias a longa distancia sen procesar o texto de forma estritamente secuencial.
A súa relevancia reside en que substituíu arquitecturas anteriores como as redes recorrentes (RNN, LSTM), que eran lentas e tiñan dificultades con textos longos. Ao permitir o procesamento en paralelo, o Transformer fixo viable adestrar modelos a escala masiva, dando lugar á xeración actual de modelos de linguaxe:
- GPT e as súas variantes (só decodificador).
- BERT (só codificador).
- Modelos de tradución e multimodais (codificador-decodificador).
Un matiz práctico importante é que o custo da atención crece de forma cuadrática respecto á lonxitude da secuencia, o que encarece o procesamento de textos moi longos. Por iso existen numerosas variantes optimizadas que buscan reducir este consumo de memoria e cómputo.