Técnica donde un modelo pequeño ("student") se entrena para replicar el comportamiento de un modelo grande ("teacher"), obteniendo un modelo más rápido y barato de operar con una pérdida de calidad controlada.
En AIF-C01 (Dominio 3) se ubica en el extremo de mayor esfuerzo de la escala de personalización, junto a pre-training: útil cuando se necesita reducir latencia/costo de inferencia manteniendo la mayor parte de la capacidad del modelo grande.
Model distillation (destilación de modelos) es uno de los conceptos que puede aparecer en el examen. Revisa la guía completa para verlo en contexto.