A destilação de modelos é uma técnica de treino que transfere o conhecimento de um modelo grande e dispendioso (o professor) para um mais pequeno e eficiente (o estudante). Em vez de treinar o modelo pequeno apenas com as etiquetas originais, este aprende a imitar os resultados do professor, incluindo as suas distribuições de probabilidade (as chamadas soft labels), que contêm informações mais ricas sobre a relação entre classes.
Esta técnica é importante porque permite implementar modelos em ambientes com recursos limitados — telemóveis, navegadores ou dispositivos edge — sem sacrificar demasiada qualidade. As suas principais vantagens são:
- Menor custo de inferência e consumo energético.
- Maior velocidade de resposta.
- Modelos mais leves e fáceis de distribuir.
Um exemplo prático é o DistilBERT, uma versão reduzida do BERT que mantém cerca de 97 % do seu desempenho com aproximadamente menos 40 % de parâmetros. Convém salientar que a destilação raramente conserva 100 % da qualidade: existe um compromisso entre tamanho e precisão que deve ser ajustado consoante o caso de utilização.