LoRA (Low-Rank Adaptation) é unha técnica de axuste fino eficiente que evita modificar todos os parámetros dun modelo. En lugar de readestrar os miles de millóns de pesos orixinais, conxela o modelo base e engade pequenas matrices de baixo rango que se adestran por separado. O resultado é un ficheiro de adaptación lixeiro (a miúdo de uns poucos megabytes) que se aplica sobre o modelo sen alterarlo.
QLoRA leva esta idea máis lonxe combinándoa coa cuantización: o modelo base cárgase nunha precisión reducida (habitualmente 4 bits), o que diminúe drasticamente o consumo de memoria. Isto permite axustar modelos grandes nunha soa GPU de consumo.
A súa importancia é práctica e económica:
- Reducen o custo de hardware e o tempo de adestramento.
- Permiten manter varios adaptadores especializados para un mesmo modelo base.
- Facilitan compartir e distribuír adaptacións sen mover o modelo completo.
Un matiz: estas técnicas son ideais para especializar un modelo en tarefas ou estilos concretos, pero non adoitan substituír un adestramento completo cando se busca incorporar coñecemento profundamente novo.