Inteligencia Artificial

RLHF (Reinforcement Learning from Human Feedback)

Definición

Técnica de entrenamiento donde un modelo se ajusta usando retroalimentación humana sobre la calidad de sus respuestas, entrenando un modelo de recompensa que guía al modelo principal hacia salidas más alineadas con las preferencias humanas.

Contexto de examen

En AIF-C01 (Dominio 3) aparece dentro de la preparación de datos para fine-tuning y alineación de modelos. Es la técnica que usan los grandes LLMs comerciales para volverse más útiles y seguros tras el pre-entrenamiento inicial.