NAiOS Wiki

Destilación de modelos

También: Destilación de modelos · Knowledge Distillation · Destilación de coñecemento · Teacher-Student Model

Comprimir un modelo grande nun pequeno conservando a calidade

1 min de lectura

A destilación de modelos é unha técnica de adestramento que transfire o coñecemento dun modelo grande e custoso (o profesor) a un máis pequeno e eficiente (o estudante). En lugar de adestrar o modelo pequeno unicamente coas etiquetas orixinais, este aprende a imitar as saídas do profesor, incluíndo as súas distribucións de probabilidade (as chamadas soft labels), que conteñen información máis rica sobre a relación entre clases.

Esta técnica importa porque permite despregar modelos en contornos con recursos limitados —móbiles, navegadores ou dispositivos edge— sen sacrificar demasiada calidade. As súas principais vantaxes son:

  • Menor custo de inferencia e consumo enerxético.
  • Maior velocidade de resposta.
  • Modelos máis lixeiros e fáciles de distribuír.

Un exemplo práctico é DistilBERT, unha versión reducida de BERT que mantén arredor do 97 % do seu rendemento con aproximadamente un 40 % menos de parámetros. Convén matizar que a destilación raramente conserva o 100 % da calidade: hai un compromiso entre tamaño e precisión que debe axustarse segundo o caso de uso.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog