Inteligencia Artificial

Prompt injection

Definición

Ataque donde un usuario malicioso incluye instrucciones ocultas en su entrada para manipular al modelo y hacer que ignore sus instrucciones originales, revele información confidencial o ejecute acciones no autorizadas.

Contexto de examen

En AIF-C01 (Dominios 3 y 5) se distingue de jailbreaking (intentar evadir las restricciones de seguridad del modelo) y prompt poisoning (contaminar los datos de entrenamiento). Mitigación: Guardrails, validación de entradas y separación clara entre instrucciones del sistema y contenido del usuario. En GENAI-L (Dominio 4) es uno de los riesgos de seguridad que SAIF busca mitigar en aplicaciones de IA generativa.

¿Preparándote para alguna de estas certificaciones?

Prompt injection es uno de los conceptos que puede aparecer en el examen. Revisa la guía completa para verlo en contexto.