NAiOS Wiki

Transformador

También: Arquitectura Transformer · modelo Transformer · attention is all you need

A arquitectura base de case todos os modelos de linguaxe actuais

1 min de lectura

El Transformer é unha arquitectura de rede neuronal presentada en 2017 no artigo "Attention Is All You Need". A súa característica distintiva é o mecanismo de atención (self-attention), que permite ao modelo ponderar a importancia de cada palabra en relación con todas as demais dunha secuencia, capturando dependencias a longa distancia sen procesar o texto de forma estritamente secuencial.

A súa relevancia reside en que substituíu arquitecturas anteriores como as redes recorrentes (RNN, LSTM), que eran lentas e tiñan dificultades con textos longos. Ao permitir o procesamento en paralelo, o Transformer fixo viable adestrar modelos a escala masiva, dando lugar á xeración actual de modelos de linguaxe:

  • GPT e as súas variantes (só decodificador).
  • BERT (só codificador).
  • Modelos de tradución e multimodais (codificador-decodificador).

Un matiz práctico importante é que o custo da atención crece de forma cuadrática respecto á lonxitude da secuencia, o que encarece o procesamento de textos moi longos. Por iso existen numerosas variantes optimizadas que buscan reducir este consumo de memoria e cómputo.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog