AIKIDO ARENA
Pruebas comparativas de modelos de IA para la ciberseguridad
Descubre los mejores modelos de ciberseguridad. Probamos los modelos más avanzados frente a vulnerabilidades en software real. Se actualiza a medida que se publican nuevos modelos.
Última actualización: 21 de agosto de 2026
Registro de cambios
Octubre 2, 2026
- Se han añadido los resultados del Xiaomi MiMo 2.6 Pro
- Se constató que 25 de las 32 vulnerabilidades superaban la prueba «pass@3», igualando a GPT-6.1 Sol, Kimi K3 y GLM 5.3, y solo una por detrás de Opus 5.
- Alcanzó una precisión del 88 %, por delante de todos los modelos de Qwen y DeepSeek
- Una ejecución dio un resultado medio del 64,6 %; al combinar tres, se alcanzó el 78,1 %.
- Todo eso por solo 11,79 dólares por cada CVE detectado
Septiembre 29, 2026
- Se han añadido los resultados de Grok 4.7
- La versión 4.7 detectó 3 vulnerabilidades que la 4.6 no detectó en ninguna de las tres ejecuciones, mientras que la 4.6 detectó 2 que la 4.7 no detectó. La contrapartida es la repetibilidad. La 4.7 detectó 18 de 32 en las tres ejecuciones, frente a las 21 de 32 de la 4.6. Mayor alcance a cambio de un poco menos de consistencia.
- Se han añadido los resultados de GPT-6 Luna y GPT-6 Sol
- Hemos sometido a GPT-6 Luna y Sol a nuestra prueba de rendimiento cibernético 32-CVE y ¡los resultados han sido inesperados! Luna ha redescubierto el 53,1 %. Sol ha alcanzado el 68,8 %.
- Ninguna de las dos superó a las variantes de GPT-5.6 en cuanto a la tasa de recuperación. Pero ambas resultaron MUCHO más baratas por vulnerabilidad detectada: Luna, de 3,43 $ a 2,01 $ por CVE, y Sol, de 56,88 $ a 34,18 $ por CVE.
Septiembre 11, 2026
- Se han añadido los resultados de GPT-6 Astra y GLM-5.3 Flash.
Un modelo sólido es solo el principio.
La herramienta de Aikido transforma el razonamiento en resultados de seguridad de alta calidad para toda tu aplicación, tanto si se trata de Code Security Audit, que analiza tu código fuente, como de Aikido Attack, que pone a prueba tu aplicación en ejecución.
Colaboradores
Debarshi
Investigador
Philippe Dourassov
Responsable de pruebas de penetración con IA
Rein Daelman
Cazador de fallos
Protege tu ordenador hoy mismo:
, de forma rápida y gratuita.
Protege tu código, tu nube y tu entorno de ejecución en un único sistema centralizado. Conecta un repositorio para descubrir qué encuentran los agentes de razonamiento en tu código fuente.
No se requiere tarjeta de crédito | Resultados del escaneo en 32 segundos.
Más de 150 000 organizaciones confían en nosotros



