NAiOS IconNAiOS Logo
NAiOS Wiki

Transformer

También: architecture Transformer · modèle Transformer · attention is all you need

L'architecture de base de presque tous les modèles de langage actuels

1 min de lectura

Le Transformer est une architecture de réseau neuronal présentée en 2017 dans l'article "Attention Is All You Need". Sa caractéristique distinctive est le mécanisme d'attention (self-attention), qui permet au modèle de pondérer l'importance de chaque mot par rapport à tous les autres au sein d'une séquence, capturant ainsi des dépendances à longue distance sans traiter le texte de manière strictement séquentielle.

Sa pertinence réside dans le fait qu'il a remplacé des architectures antérieures telles que les réseaux récurrents (RNN, LSTM), qui étaient lents et présentaient des difficultés avec les textes longs. En permettant le traitement en parallèle, le Transformer a rendu viable l'entraînement de modèles à une échelle massive, donnant naissance à la génération actuelle de modèles de langage :

  • GPT et ses variantes (décodeur uniquement).
  • BERT (encodeur uniquement).
  • Modèles de traduction et multimodaux (encodeur-décodeur).

Une nuance pratique importante est que le coût de l'attention croît de manière quadratique par rapport à la longueur de la séquence, ce qui renchérit le traitement de textes très longs. C'est pourquoi il existe de nombreuses variantes optimisées qui cherchent à réduire cette consommation de mémoire et de calcul.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog