PuzzleMask, una nueva técnica de inyección de prompts

  • Seguridad
inteligencia artificial prompt

El nuevo método es capaz de evadir los controles de seguridad perimetrales que incorporan las arquitecturas corporativas de inteligencia artificial, ocultando las instrucciones maliciosas dentro de textos comunes que están escritos en lenguaje natural.

PuzzleMask, una nueva técnica de inyección de prompts descubierta por Check Point Research, es tan sencilla y efectiva que casi sorprende que no surgiera antes. Se trata de utilizar la propia capacidad de comprensión del lenguaje natural que posee la inteligencia artificial para evadir los filtros de IA que hay en los entornos corporativos. El método introduce instrucciones que se saltan las políticas de seguridad en una estructura gramatical natural y fluida, logrando esquivar los filtros rápidos de entrada.

Durante las pruebas, los expertos de Check Point realizaron 23 ensayos con los modelos de filtrado previo Claude-3-Haiku, GPT-4o-Mini, GPT-oss-safeguard y Llama-Guard3. En todos los casos, los cuatro modelos fracasaron en la detección de las cargas maliciosas ocultas. Además, una vez superados los filtros, el modelo de destino recuperó con éxito las instrucciones maliciosas el 94% de las pruebas.

Los investigadores consideran que estos hallazgos requieren una evolución en los cortafuegos y los sistemas de supervisión. Así, una seguridad basada únicamente en el examen de los que entra en el sistema de IA es insuficiente; hay que monitorizar cómo razona, actúa y responde el modelo una vez aprobado el comando; y los contenidos no verificados procedentes de fuentes externas deben tratarse con la misma cautela que los enlaces sospechosos.

Para Eli Smadja, director de investigación en Check Point Research, "PuzzleMask demuestra que las instrucciones dañinas pueden camuflarse dentro de textos cotidianos sin activar las alertas de los controles diseñados para detectar manipulaciones evidentes. A medida que las empresas integran sistemas de IA con acceso a datos y aplicaciones de negocio, la estrategia de seguridad debe evolucionar. Es imprescindible adoptar un enfoque preventivo que combine la inteligencia de amenazas, la gobernanza de la IA y la protección en tiempo de ejecución".