NAiOS IconNAiOS Logo
NAiOS Wiki

Modelldestillation

También: Modelldestillation · Knowledge Distillation · Wissensdestillation · Teacher-Student-Modell

Ein großes Modell unter Beibehaltung der Qualität in ein kleines komprimieren

1 min de lectura

Die Modelldestillation ist eine Trainingstechnik, die das Wissen eines großen und kostenintensiven Modells (des Teacher-Modells) auf ein kleineres und effizienteres Modell (das Student-Modell) überträgt. Anstatt das kleine Modell ausschließlich mit den ursprünglichen Labels zu trainieren, lernt dieses, die Ausgaben des Teacher-Modells zu imitieren, einschließlich seiner Wahrscheinlichkeitsverteilungen (den sogenannten Soft Labels), die reichhaltigere Informationen über die Beziehung zwischen den Klassen enthalten.

Diese Technik ist von Bedeutung, da sie es ermöglicht, Modelle in ressourcenbeschränkten Umgebungen – wie Mobilgeräten, Browsern oder Edge-Geräten – bereitzustellen, ohne dabei zu viel Qualität einzubüßen. Die Hauptvorteile sind:

  • Geringere Kosten bei der Inferenz und beim Energieverbrauch.
  • Höhere Antwortgeschwindigkeit.
  • Leichtere Modelle, die einfacher zu verteilen sind.

Ein praktisches Beispiel ist DistilBERT, eine reduzierte Version von BERT, die etwa 97 % der Leistung bei ca. 40 % weniger Parametern beibehält. Es ist anzumerken, dass die Destillation selten 100 % der Qualität beibehält: Es besteht eine Abwägung zwischen Größe und Präzision, die je nach Anwendungsfall angepasst werden muss.

¿Quieres profundizar?

Lee nuestros artículos sobre IA aplicada en el blog de NAiOS.

Ir al Blog