La distillation de modèles est une technique d'entraînement qui transfère les connaissances d'un modèle volumineux et coûteux (le professeur) vers un modèle plus petit et plus efficace (l'étudiant). Au lieu d'entraîner le petit modèle uniquement avec les étiquettes d'origine, celui-ci apprend à imiter les sorties du professeur, y compris ses distributions de probabilité (appelées soft labels), qui contiennent des informations plus riches sur la relation entre les classes.
Cette technique est importante car elle permet de déployer des modèles dans des environnements aux ressources limitées — mobiles, navigateurs ou appareils edge — sans trop sacrifier la qualité. Ses principaux avantages sont :
- Coût réduit d'inférence et de consommation énergétique.
- Vitesse de réponse accrue.
- Modèles plus légers et faciles à distribuer.
Un exemple pratique est DistilBERT, une version réduite de BERT qui conserve environ 97 % de ses performances avec approximativement 40 % de paramètres en moins. Il convient de préciser que la distillation conserve rarement 100 % de la qualité : il existe un compromis entre taille et précision qui doit être ajusté selon le cas d'utilisation.