Le Transformer est une architecture de réseau neuronal présentée en 2017 dans l'article "Attention Is All You Need". Sa caractéristique distinctive est le mécanisme d'attention (self-attention), qui permet au modèle de pondérer l'importance de chaque mot par rapport à tous les autres au sein d'une séquence, capturant ainsi des dépendances à longue distance sans traiter le texte de manière strictement séquentielle.
Sa pertinence réside dans le fait qu'il a remplacé des architectures antérieures telles que les réseaux récurrents (RNN, LSTM), qui étaient lents et présentaient des difficultés avec les textes longs. En permettant le traitement en parallèle, le Transformer a rendu viable l'entraînement de modèles à une échelle massive, donnant naissance à la génération actuelle de modèles de langage :
- GPT et ses variantes (décodeur uniquement).
- BERT (encodeur uniquement).
- Modèles de traduction et multimodaux (encodeur-décodeur).
Une nuance pratique importante est que le coût de l'attention croît de manière quadratique par rapport à la longueur de la séquence, ce qui renchérit le traitement de textes très longs. C'est pourquoi il existe de nombreuses variantes optimisées qui cherchent à réduire cette consommation de mémoire et de calcul.