Casi la mitad del código generado por IA sigue sin superar las pruebas de seguridad

  • Seguridad
Codigo_desarrollo_hacker

Los modelos de lenguaje grandes avanzan en capacidad y velocidad, pero no en protección. La brecha entre sintaxis perfecta y vulnerabilidades críticas se mantiene pese al auge de la programación asistida por inteligencia artificial.

Los modelos de lenguaje grandes (LLM) han mejorado su razonamiento y capacidad de programación, pero la seguridad no acompaña ese progreso. El Veracode 2026 GenAI Code Security Report muestra que la tasa de aprobación del código generado por IA permanece estancada en el 56%, prácticamente igual que el año anterior. Esto contrasta con la tasa de compilación, que roza el 100%, evidenciando que los modelos producen código sintácticamente correcto, pero vulnerable.

El informe analizó más de 100 modelos en cuatro series de pruebas, evaluando su capacidad para generar código seguro en múltiples lenguajes y categorías de vulnerabilidades, sin indicaciones específicas de seguridad. El resultado es que cuando no se les guía, los modelos fallan en seguridad el 44% de las veces.

Chris Wysopal, cofundador de Veracode, advierte que “los modelos pueden ser casi perfectos desde el punto de vista sintáctico, pero siguen fallando en casi la mitad de todas las tareas en las que se requiere seguridad”.

 

Los modelos especializados no son más seguros y el tamaño tampoco importa

El informe desmonta dos creencias extendidas. La primera es que los modelos diseñados específicamente para programar no son más seguros que los de uso general. Su tasa media de aprobación es del 51%, frente al 52% de los modelos generalistas. La segunda es que el tamaño del modelo no influye en la seguridad. Los modelos grandes, medianos y pequeños se sitúan entre el 51% y el 53%.

La única diferencia significativa aparece en los modelos con capacidades de razonamiento, que mantienen una ventaja del 56% frente al 51%, actuando como una especie de “revisión interna” del código.

En la clasificación de 2026, GPT-5.5 lidera con un 68% de aprobación, mientras que Qwen3.7-max queda último con un 50%. El mejor modelo disponible aún falla en casi una de cada tres tareas de seguridad. Cabe destacar que las ediciones anteriores del informe estaban dominadas por modelos de IA occidentales.

Las tasas de aprobación por lenguaje muestran grandes diferencias. Python alcanza el 63%, mientras que Java cae al 30%. Aun así, Java es el único lenguaje que ha mostrado una tendencia de mejora constante en el último año.

Wysopal insiste en que la solución no es restringir el acceso a modelos avanzados, sino garantizar una seguridad transparente y basada en pruebas. “El código generado por IA debe tratarse como cualquier otro código no revisado: hay que analizarlo, corregirlo y nunca lanzarlo a ciegas”, afirma.