LoRA (Low-Rank Adaptation) ist eine effiziente Fine-Tuning-Technik, die die Modifikation aller Parameter eines Modells vermeidet. Anstatt die Milliarden ursprünglicher Gewichte neu zu trainieren, friert sie das Basismodell ein und fügt kleine Matrizen mit niedrigem Rang hinzu, die separat trainiert werden. Das Ergebnis ist eine leichtgewichtige Adaptionsdatei (oft nur wenige Megabyte groß), die auf das Modell angewendet wird, ohne es zu verändern.
QLoRA führt diese Idee weiter, indem sie diese mit der Quantisierung kombiniert: Das Basismodell wird mit einer reduzierten Präzision geladen (üblicherweise 4 Bit), was den Speicherverbrauch drastisch senkt. Dies ermöglicht es, große Modelle auf einer einzigen handelsüblichen GPU anzupassen.
Ihre Bedeutung ist praktischer und wirtschaftlicher Natur:
- Sie reduzieren die Hardwarekosten und die Trainingszeit.
- Sie ermöglichen es, mehrere spezialisierte Adapter für dasselbe Basismodell vorzuhalten.
- Sie erleichtern das Teilen und Verteilen von Adaptionen, ohne das vollständige Modell bewegen zu müssen.
Eine Nuance: Diese Techniken sind ideal, um ein Modell auf konkrete Aufgaben oder Stile zu spezialisieren, ersetzen jedoch in der Regel kein vollständiges Training, wenn es darum geht, tiefgreifend neues Wissen zu integrieren.