LoRA (Low-Rank Adaptation) est une technique de réglage fin efficace qui évite de modifier tous les paramètres d'un modèle. Au lieu de réentraîner les milliards de poids originaux, elle fige le modèle de base et ajoute de petites matrices de bas rang qui sont entraînées séparément. Le résultat est un fichier d'adaptation léger (souvent de quelques mégaoctets) qui s'applique sur le modèle sans l'altérer.
QLoRA pousse cette idée plus loin en la combinant avec la quantification : le modèle de base est chargé avec une précision réduite (habituellement 4 bits), ce qui diminue drastiquement la consommation de mémoire. Cela permet d'ajuster de grands modèles sur un seul GPU grand public.
Son importance est pratique et économique :
- Elles réduisent le coût du matériel et le temps d'entraînement.
- Elles permettent de maintenir plusieurs adaptateurs spécialisés pour un même modèle de base.
- Elles facilitent le partage et la distribution des adaptations sans déplacer le modèle complet.
Une nuance : ces techniques sont idéales pour spécialiser un modèle sur des tâches ou des styles concrets, mais elles ne remplacent généralement pas un entraînement complet lorsque vous cherchez à incorporer des connaissances profondément nouvelles.