NAiOS IconNAiOS Logo
NAiOS Wiki

Distillation de modèles

También: Distillation de modèles · Knowledge Distillation · Distillation de connaissances · Modèle Enseignant-Élève

Compresser un grand modèle en un modèle réduit tout en préservant la qualité

1 min de lectura

La distillation de modèles est une technique d'entraînement qui transfère les connaissances d'un modèle volumineux et coûteux (le professeur) vers un modèle plus petit et plus efficace (l'étudiant). Au lieu d'entraîner le petit modèle uniquement avec les étiquettes d'origine, celui-ci apprend à imiter les sorties du professeur, y compris ses distributions de probabilité (appelées soft labels), qui contiennent des informations plus riches sur la relation entre les classes.

Cette technique est importante car elle permet de déployer des modèles dans des environnements aux ressources limitées — mobiles, navigateurs ou appareils edge — sans trop sacrifier la qualité. Ses principaux avantages sont :

  • Coût réduit d'inférence et de consommation énergétique.
  • Vitesse de réponse accrue.
  • Modèles plus légers et faciles à distribuer.

Un exemple pratique est DistilBERT, une version réduite de BERT qui conserve environ 97 % de ses performances avec approximativement 40 % de paramètres en moins. Il convient de préciser que la distillation conserve rarement 100 % de la qualité : il existe un compromis entre taille et précision qui doit être ajusté selon le cas d'utilisation.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog