Actualización 19 de julio: Desde que publicamos este blog, se lanzó Kimi K3. También lo comparamos y empató con GPT-5.6 en la puntuación más alta, quedando ligeramente por detrás en capacidades generales. Consulte la sección de Kimi K3 al final para más detalles.
TL;DR
- GPT-5.6 obtiene la puntuación de recall más alta, alcanzando un máximo de 23/26, por delante de grok-4.5 (20), los modelos Claude Opus (15 a 18) y todo lo demás que probamos. Esto significa que puede redescubrir el 88,5% de los CVEs.
- La opción más cara no es necesaria. Las variantes más económicas de GPT-5.6 se sitúan a una o dos detecciones de su versión insignia por una fracción del coste, y agrupar varias ejecuciones de un modelo de gama media rivaliza con una única pasada de un modelo insignia.
- Las ejecuciones del modelo son inconsistentes, pero la agrupación significa que ganan. Cualquier ejecución individual omite errores que detectaría en otra; ejecutar un modelo varias veces y agrupar los resultados (pass@3) supera de forma fiable una única pasada de un modelo más potente y caro.
- Los modelos de código abierto están poniéndose al día rápidamente. GLM-5.2 ya redescubre el 59% del conjunto (16/26), en la mitad de la tabla entre los modelos propietarios.
Cada lanzamiento de modelo de vanguardia viene ahora con la misma afirmación de ciberseguridad: encuentra vulnerabilidades. Pero, ¿funciona en un error real en un repositorio real, o solo en un ejemplo curado? De la docena de modelos que podrías elegir, ¿cuál merece la pena confiar para la revisión de código? Y dado que los modelos más potentes cuestan diez veces o más por ejecución que los más baratos, ¿qué te aporta realmente ese gasto extra en errores encontrados?
Es fácil clasificar los modelos por su capacidad bruta y llamar al más caro el ganador, pero la pregunta más importante es si el precio merece la pena. Así que ejecutamos 13 de los modelos entre los que los equipos están eligiendo hoy contra 26 vulnerabilidades conocidas de la base de datos de avisos de GitHub. Abarcan una variedad de lenguajes y tipos de proyectos. Medimos dos cosas: cuántos errores encontró cada modelo y cuánto costó encontrarlos.

Cómo funciona el análisis comparativo
Tomamos 26 vulnerabilidades de la base de datos de avisos de GitHub, una distribución aleatoria entre lenguajes y tipos de proyectos, desde una inyección SQL en un framework web hasta una RCE por deserialización en un kit de herramientas de ML, y pedimos a cada modelo que las redescubriera, un repositorio a la vez, dentro del mismo arnés de análisis de código con IA que ejecutamos en producción. En lugar de una ventana de chat, es un modelo con herramientas reales que navega por el repositorio y razona sobre el código como lo haría un auditor.
El arnés es lo que convierte un modelo de lenguaje en un auditor. Un asistente de codificación de propósito general está diseñado para un trabajo diferente, que es tomar una tarea y producir código funcional. Apúntalo a un repositorio y pregunta si es seguro, y se comporta como un desarrollador que busca algo obviamente roto, y luego se detiene una vez que ha encontrado algo plausible. El análisis de código con IA está construido de manera diferente. Explora la base de código en busca de puntos de entrada candidatos, investiga cada flujo sospechoso en profundidad y luego clasifica lo que encuentra para que solo sobrevivan las vulnerabilidades reales.
Como sabíamos dónde residía cada vulnerabilidad, dirigimos a cada agente investigador directamente al fragmento de código vulnerable. De esa manera, un fallo refleja un problema de razonamiento en lugar de un presupuesto desperdiciado al deambular por la parte incorrecta de la base de código. El modelo aún tiene que entender el flujo, juzgar la explotabilidad y reportarlo correctamente. Las indicaciones se mantuvieron cortas y agnósticas al modelo para que ningún proveedor se viera favorecido por la redacción.
Ejecutamos cada modelo tres veces y agrupamos los resultados. Se considera que un CVE ha sido 'encontrado' si el modelo lo detecta en cualquier ejecución (pass@3).
Elegimos una variedad de los últimos modelos de diferentes proveedores:
- OpenAI: gpt-5.4-nano, gpt-5.4-mini, gpt-5.5, y la serie gpt-5.6 (luna / terra / sol)
- Anthropic: claude-haiku-4-5, claude-opus-4-7, claude-opus-4-8
- xAI: grok-4.5
- Google: gemini-3.1-pro, gemini-3.5-flash
- Modelos de código abierto: glm-5.2
Resultados por severidad y vulnerabilidad
Cada modelo redescubrió ambos CVEs críticos (una RCE por deserialización y un XSS almacenado). La verdadera diferenciación aparece en los hallazgos de severidad alta y media.

CVEs más difíciles y más fáciles
Los dos errores críticos y varias fallas claras de inyección/control de acceso fueron encontrados por todos los modelos. Unas pocas cadenas específicas derrotaron a casi todos ellos.
Los CVEs que cada modelo encuentra comparten el mismo patrón: entradas controladas por el atacante que alcanzan una operación peligrosa bien conocida a través de un flujo corto y local, como una llamada de deserialización, una ejecución de shell, un sumidero HTML o una verificación de firma rota. Esto es reconocimiento de patrones, y está efectivamente resuelto. Los modelos baratos y los insignia por igual los puntúan 13/13, sin ninguna separación de capacidad.
La verdadera frontera, y donde la capacidad del modelo realmente se diferencia, es el razonamiento sobre las verificaciones que no están presentes y el seguimiento de cadenas complejas que ninguna línea individual revela. El caso más claro es SQL Injection-1 en nuestro conjunto de datos, una inyección indirecta a través de un alias de columna que el ORM nunca escapa. Solo GPT-5.5 y los modelos más potentes de GPT-5.6 (sol y terra) lo rastrearon.
Lo que nos dice la diferencia entre el promedio y la unión
El número más útil en este benchmark es la distancia entre la ejecución promedio de un modelo y la unión de sus ejecuciones. Dado que cada pasada revela un subconjunto diferente de los errores, agruparlos (pass@3) recupera una cantidad sorprendente:

Observe gpt-5.4-nano: ninguna ejecución individual supera los 14, sin embargo, tres ejecuciones agrupadas alcanzan los 18, un salto de cuatro CVE, porque cada pasada revela errores diferentes. claude-haiku-4-5 es el caso más claro de varianza, obteniendo 7 en una ejecución y 13 en otra del mismo modelo en la misma tarea.
La conclusión aquí es que no es necesario optar directamente por el modelo más caro. Tres ejecuciones de gpt-5.4-nano cuestan alrededor de 170 $ y alcanzan 18/26, tanto como una sola pasada de un modelo insignia como gpt-5.6-terra promedia por sí solo, por una fracción del precio. Tres ejecuciones de gpt-5.4-mini (aproximadamente 460 $) alcanzan 20. Repetir un modelo sólido de gama media supera a una sola pasada de un modelo insignia con mucha más frecuencia de lo que sugiere la diferencia de precio.
¿Vale la pena un razonamiento superior?
Ejecutamos los modelos aplicables en dos niveles de razonamiento, el predeterminado "high" y el más alto disponible ("xhigh" para los modelos GPT-5.4/5.5 y Claude, "max" para GPT-5.6, grok-4.5 y glm-5.2). Todas las cifras son uniones pass@3, por lo que son directamente comparables.

Las victorias claras son gpt-5.5 (+3 con 1.5x el coste) y glm-5.2 (+3 con 1.3x). claude-opus-4-8 gana +2 pero paga el doble por ello. En cualquier otro lugar, el nivel superior obtiene un hallazgo o ninguno, y para gpt-5.6-luna y gpt-5.4-nano, aterrizó uno más bajo, dentro del ruido de ejecución a ejecución. gpt-5.6-terra es el caso más claro de rendimientos decrecientes: 2.2x el coste por los mismos 23.
Los modelos Gemini no tienen ninguna configuración por encima de "high", por lo que se omiten de esta comparación.
Actualización: Kimi K3
Después de escribir este artículo, se lanzó Kimi K3. Comparamos Kimi K3 durante el fin de semana y compartimos los resultados. Kimi K3 es el modelo de código abierto más potente para ciberseguridad, mucho más capaz que GLM-5.2.
Estos son los resultados:
- Aunque GPT-5.6-Sol sigue siendo más potente, Kimi K3 está extremadamente cerca y a una fracción del coste.
- Tiene un rendimiento similar al de GPT-5.6-terra, siendo un 15% más económico.
- Utilizando nuestro arnés especializado que genera múltiples agentes en paralelo, es capaz de redescubrir 23 de 26 CVEs en nuestro arnés, igualando a los modelos de vanguardia y siendo 4 veces más barato que GPT-5.6-Sol, el modelo más potente de OpenAI.

La evaluación comparativa es privada y utiliza CVEs revelados recientemente. Esto significa que el modelo no fue entrenado con ellos. El rendimiento refleja un gran salto en las capacidades de los modelos Kimi.
Conclusión
Apunte un modelo de frontera a una base de código, dentro de un arnés construido para el trabajo, y redescubre la mayoría de las vulnerabilidades conocidas. Los errores con un sink peligroso obvio se resuelven. Los que aún separan a los modelos no tienen un sink al que apuntar. Una comprobación de autorización faltante, o una inyección a la que solo se puede llegar siguiendo una cadena larga y oscura a través de varios archivos.
El nivel más caro rara vez justifica su precio. Ejecutar un modelo más barato varias veces y agrupar los resultados encuentra más, por menos, que una sola pasada de un modelo insignia, y esa ventaja solo crece a medida que los modelos se vuelven más baratos y potentes. El arnés sigue siendo lo que decide si ese razonamiento se dirige a la parte correcta de la base de código en primer lugar.

