El Transformer és una arquitectura de xarxa neuronal presentada el 2017 a l'article "Attention Is All You Need". La seva característica distintiva és el mecanisme d'atenció (self-attention), que permet al model sospesar la importància de cada paraula en relació amb totes les altres d'una seqüència, capturant dependències a llarga distància sense processar el text de forma estrictament seqüencial.
La seva rellevància rau en el fet que va substituir arquitectures anteriors com les xarxes recurrents (RNN, LSTM), que eren lentes i tenien dificultats amb textos llargs. En permetre el processament en paral·lel, el Transformer va fer viable entrenar models a escala massiva, donant lloc a la generació actual de models de llenguatge:
- GPT i les seves variants (només descodificador).
- BERT (només codificador).
- Models de traducció i multimodals (codificador-descodificador).
Un matís pràctic important és que el cost de l'atenció creix de forma quadràtica respecte a la longitud de la seqüència, fet que encareix el processament de textos molt llargs. Per això existeixen nombroses variants optimitzades que busquen reduir aquest consum de memòria i càlcul.