Inteligencia Artificial

BERTScore y LLM-as-judge

Definición

Métricas de evaluación de texto generado: BERTScore mide similitud semántica usando embeddings (más robusto que BLEU/ROUGE, que solo comparan n-gramas literales); LLM-as-judge usa un LLM para evaluar/calificar la calidad de la respuesta de otro modelo, útil cuando no hay una respuesta de referencia única.

Contexto de examen

En AIF-C01 (Dominio 3) se pregunta como alternativa a métricas léxicas tradicionales cuando se evalúa calidad semántica o cuando evaluar a escala sin revisión humana manual. Se diferencia de accuracy/F1, que aplican a clasificación, no a generación abierta de texto.