Der Transformer ist eine neuronale Netzarchitektur, die 2017 in dem Artikel „Attention Is All You Need“ vorgestellt wurde. Sein markantes Merkmal ist der Attention-Mechanismus (Self-Attention), der es dem Modell ermöglicht, die Bedeutung jedes Wortes im Verhältnis zu allen anderen Wörtern einer Sequenz abzuwägen und so Abhängigkeiten über große Distanzen zu erfassen, ohne den Text streng sequenziell zu verarbeiten.
Seine Relevanz liegt darin, dass er frühere Architekturen wie rekurrente Netze (RNN, LSTM) ersetzte, die langsam waren und Schwierigkeiten mit langen Texten hatten. Durch die Ermöglichung der parallelen Verarbeitung machte der Transformer das Training von Modellen in massivem Maßstab realisierbar, was zur aktuellen Generation von Sprachmodellen führte:
- GPT und seine Varianten (nur Decoder).
- BERT (nur Encoder).
- Übersetzungs- und multimodale Modelle (Encoder-Decoder).
Eine wichtige praktische Nuance besteht darin, dass die Kosten der Attention quadratisch zur Sequenzlänge steigen, was die Verarbeitung sehr langer Texte verteuert. Daher gibt es zahlreiche optimierte Varianten, die darauf abzielen, diesen Speicher- und Rechenaufwand zu reduzieren.