LoRA (Low-Rank Adaptation) é uma técnica de ajuste fino eficiente que evita modificar todos os parâmetros de um modelo. Em vez de retreinar os milhares de milhões de pesos originais, congela o modelo base e adiciona pequenas matrizes de baixo rank que são treinadas separadamente. O resultado é um ficheiro de adaptação leve (frequentemente de apenas alguns megabytes) que se aplica sobre o modelo sem o alterar.
QLoRA leva esta ideia mais longe combinando-a com a quantização: o modelo base é carregado numa precisão reduzida (habitualmente 4 bits), lo que diminui drasticamente o consumo de memória. Isto permite ajustar modelos grandes numa única GPU de consumo.
A sua importância é prática e económica:
- Reduzem o custo de hardware e o tempo de treino.
- Permitem manter vários adaptadores especializados para um mesmo modelo base.
- Facilitam a partilha e distribuição de adaptações sem mover o modelo completo.
Uma nota: estas técnicas são ideais para especializar um modelo em tarefas ou estilos concretos, mas não costumam substituir um treino completo quando se procura incorporar conhecimento profundamente novo.