Técnica de entrenamiento donde un modelo se ajusta usando retroalimentación humana sobre la calidad de sus respuestas, entrenando un modelo de recompensa que guía al modelo principal hacia salidas más alineadas con las preferencias humanas.
En AIF-C01 (Dominio 3) aparece dentro de la preparación de datos para fine-tuning y alineación de modelos. Es la técnica que usan los grandes LLMs comerciales para volverse más útiles y seguros tras el pre-entrenamiento inicial.
RLHF (Reinforcement Learning from Human Feedback) es uno de los conceptos que puede aparecer en el examen. Revisa la guía completa para verlo en contexto.