Inyección de prompts
Ataque que inserta instrucciones para desviar un modelo de las reglas previstas.
Ver definición completa
Puede llegar desde el usuario o contenido recuperado; se mitiga separando confianza, limitando herramientas, validando acciones y tratando entradas como datos.
Ejemplo prácticoUna página intenta ordenar al agente que revele secretos.
Fuente: NIST AI Risk Management Framework Glossary