Técnica de entrenamiento donde un modelo se ajusta usando retroalimentación humana sobre la calidad de sus respuestas, entrenando un modelo de recompensa que guía al modelo principal hacia salidas más alineadas con las preferencias humanas.
En AIF-C01 (Dominio 3) aparece dentro de la preparación de datos para fine-tuning y alineación de modelos. Es la técnica que usan los grandes LLMs comerciales para volverse más útiles y seguros tras el pre-entrenamiento inicial.