O Transformer é uma arquitetura de rede neuronal apresentada em 2017 no artigo "Attention Is All You Need". A sua característica distintiva é o mecanismo de atenção (self-attention), que permite ao modelo ponderar a importância de cada palavra em relação a todas as outras de uma sequência, capturando dependências a longa distância sem processar o texto de forma estritamente sequencial.
A sua relevância reside no facto de ter substituído arquiteturas anteriores como as redes recorrentes (RNN, LSTM), que eram lentas e tinham dificuldades com textos longos. Ao permitir o processamento em paralelo, o Transformer tornou viável o treino de modelos à escala massiva, dando lugar à geração atual de modelos de linguagem:
- GPT e as suas variantes (apenas descodificador).
- BERT (apenas codificador).
- Modelos de tradução e multimodais (codificador-descodificador).
Uma nuance prática importante é que o custo da atenção cresce de forma quadrática em relação ao comprimento da sequência, o que encarece o processamento de textos muito longos. Por isso, existem inúmeras variantes otimizadas que procuram reduzir este consumo de memória e computação.