NAiOS IconNAiOS Logo
NAiOS Wiki

Transformer

También: arquitetura Transformer · modelo Transformer · attention is all you need

A arquitetura base de quase todos os modelos de linguagem atuais

1 min de lectura

O Transformer é uma arquitetura de rede neuronal apresentada em 2017 no artigo "Attention Is All You Need". A sua característica distintiva é o mecanismo de atenção (self-attention), que permite ao modelo ponderar a importância de cada palavra em relação a todas as outras de uma sequência, capturando dependências a longa distância sem processar o texto de forma estritamente sequencial.

A sua relevância reside no facto de ter substituído arquiteturas anteriores como as redes recorrentes (RNN, LSTM), que eram lentas e tinham dificuldades com textos longos. Ao permitir o processamento em paralelo, o Transformer tornou viável o treino de modelos à escala massiva, dando lugar à geração atual de modelos de linguagem:

  • GPT e as suas variantes (apenas descodificador).
  • BERT (apenas codificador).
  • Modelos de tradução e multimodais (codificador-descodificador).

Uma nuance prática importante é que o custo da atenção cresce de forma quadrática em relação ao comprimento da sequência, o que encarece o processamento de textos muito longos. Por isso, existem inúmeras variantes otimizadas que procuram reduzir este consumo de memória e computação.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog