A destilación de modelos é unha técnica de adestramento que transfire o coñecemento dun modelo grande e custoso (o profesor) a un máis pequeno e eficiente (o estudante). En lugar de adestrar o modelo pequeno unicamente coas etiquetas orixinais, este aprende a imitar as saídas do profesor, incluíndo as súas distribucións de probabilidade (as chamadas soft labels), que conteñen información máis rica sobre a relación entre clases.
Esta técnica importa porque permite despregar modelos en contornos con recursos limitados —móbiles, navegadores ou dispositivos edge— sen sacrificar demasiada calidade. As súas principais vantaxes son:
- Menor custo de inferencia e consumo enerxético.
- Maior velocidade de resposta.
- Modelos máis lixeiros e fáciles de distribuír.
Un exemplo práctico é DistilBERT, unha versión reducida de BERT que mantén arredor do 97 % do seu rendemento con aproximadamente un 40 % menos de parámetros. Convén matizar que a destilación raramente conserva o 100 % da calidade: hai un compromiso entre tamaño e precisión que debe axustarse segundo o caso de uso.