Ataque donde un usuario malicioso incluye instrucciones ocultas en su entrada para manipular al modelo y hacer que ignore sus instrucciones originales, revele información confidencial o ejecute acciones no autorizadas.
En AIF-C01 (Dominios 3 y 5) se distingue de jailbreaking (intentar evadir las restricciones de seguridad del modelo) y prompt poisoning (contaminar los datos de entrenamiento). Mitigación: Guardrails, validación de entradas y separación clara entre instrucciones del sistema y contenido del usuario. En GENAI-L (Dominio 4) es uno de los riesgos de seguridad que SAIF busca mitigar en aplicaciones de IA generativa.
Prompt injection es uno de los conceptos que puede aparecer en el examen. Revisa la guía completa para verlo en contexto.