Se podría decir que Claude Mythos es el modelo de ciberseguridad más potente que ha creado Anthropic. Pero sabemos que la capacidad del modelo es solo uno de los factores que determinan el rendimiento de un producto de detección de vulnerabilidades de IA.
Para comprobarlo, hemos comparado directamente Claude Security de Anthropic —que se ejecuta en Mythos— y Code Security Audit de Aikido sobre un objetivo exactamente igual, con el fin de ver qué herramienta ofrece la mejor cobertura y a qué coste. Code Security Audit forma parte de la suite « análisis de código con IA » de Aikido. También hemos probado Codex Security.
Sometimos los tres productos a pruebas con una aplicación de referencia privada en la que se habían identificado previamente 89 vulnerabilidades conocidas en todo el conjunto.
¿Los resultados? Claude Security, con Mythos, detectó 60 de las 89 vulnerabilidades (el 67 %) por un coste de 157 dólares, mientras que la auditoría de seguridad de código de Aikido detectó 68 de las 89 (el 76 %) por 75 dólares. Codex Security detectó 58 de las 89 por 125 dólares.
Aikido detectó ocho vulnerabilidades más que Claude Security con Mythos, entre ellas una de gravedad crítica y tres de gravedad alta, y todo ello por menos de la mitad del coste. Aikido detectó nada menos que diez más que Codex Security. Estos resultados son un ejemplo más de que el rendimiento y la eficiencia dependen del sistema que rodea al modelo, y de que, incluso con el modelo más potente, el rendimiento puede seguir siendo inferior.
El arnés sigue marcando la diferencia
Como ya hemos señalado anteriormente, la detección de vulnerabilidades es, en esencia, un problema de búsqueda. Una herramienta debe decidir dónde buscar, qué hipótesis seguir, hasta qué punto investigarlas y cuándo un hallazgo cuenta con pruebas suficientes como para ser comunicado.
Claude Security utiliza un sofisticado proceso que incluye la cartografía de repositorios, agentes de análisis y verificación en varias fases. Aikido cuenta con su propio proceso sofisticado, pero se diferencia en cómo distribuye ese trabajo, utilizando modelos más pequeños y de menor coste que se seleccionan específicamente para las tareas en las que rinden mejor. Estos modelos más pequeños pueden explorar una gama más amplia de hipótesis independientes, mientras que el costoso razonamiento de vanguardia se reserva para las fases en las que es más probable que marque la diferencia en el resultado.
Esa asignación es lo que permitió que este proyecto destinara su presupuesto a ampliar el alcance de la investigación, en lugar de aplicar el modelo más caro a todo, y esto es lo que dio lugar a un recuerdo sustancialmente mayor.
Esta mayor tasa de detección incluyó varios problemas con repercusiones en el mundo real que la red de agentes de Aikido detectó, pero que Mythos pasó por alto. Uno de ellos fue un fallo crítico de autorización entre inquilinos que permitía a los usuarios actualizar la configuración de su propia cuenta y cambiar su asignación a una organización para añadirse a otra, lo que les daba acceso a los datos de dicha organización. Aikido también detectó problemas más sutiles y fáciles de pasar por alto, como una discrepancia en el formato de las marcas de tiempo entre la aplicación y la base de datos que permitía que las claves API caducadas siguieran siendo válidas.

La inteligencia de vanguardia se encarece rápidamente
Mythos tiene un coste inicial de 10 dólares por cada millón de tokens de entrada y de 50 dólares por cada millón de tokens de salida. El coste se dispara rápidamente cuando una revisión abarca cientos de trayectorias de agentes en un repositorio de gran tamaño.
La dificultad radica en que las auditorías de código orientadas a la agencia no tienen un volumen de trabajo fijo. Dependiendo de factores como el tamaño del repositorio y la complejidad de la aplicación, el número de pistas que hay que investigar y el razonamiento necesario suelen variar de un repositorio a otro.
Claude Security te deja a ti la responsabilidad de esta variabilidad. Los usuarios van a ciegas porque Claude Security no te indica el coste del análisis hasta que este ya ha finalizado. Así que, cuando todo haya terminado, puedes encontrarte con un coste mucho más elevado de lo que esperabas.
El aikido opta por otra vía. Nosotros mismos asumimos esa incertidumbre. Antes de que comience el análisis, calculamos de forma dinámica su coste a partir del tamaño del repositorio, el código revisable y la complejidad, y mostramos esa estimación al usuario.
Como usuario, puedes aumentar o reducir el nivel de cobertura para ajustarlo a esa estimación antes de confirmarla. Nuestra ejecución en el repositorio de referencia te habría costado 75 dólares con la profundidad recomendada, mientras que Claude Security te habría costado una tarifa fija de 157,06 dólares.

Y si consideras que el repositorio merece una cobertura aún más exhaustiva de la que hemos estimado automáticamente, tienes total libertad para aumentarla.

En nuestra prueba con Claude Security, no se nos facilitó ningún presupuesto previo y el importe total no quedó claro hasta que se completó el análisis.
El repositorio que utilizamos para el análisis tiene unas 15 000 líneas de código. El hecho de no poder consultar una estimación previa de los costes ni ajustar el nivel de esfuerzo del análisis a tu presupuesto resulta manejable en un repositorio de este tamaño. Sin embargo, se convierte en un problema mucho mayor a medida que los costes de la búsqueda de vulnerabilidades aumentan en función del tamaño del repositorio, el tipo de aplicación y la complejidad del proceso.
Si utilizas un modelo caro para analizar un monorepo, o lo ejecutas con cada solicitud de incorporación de cambios, la falta de una estimación previa del análisis puede acarrearte unos costes considerablemente superiores a lo que cabría esperar.

Qué significa esto
Llevamos tiempo defendiendo que el diseño del entorno de pruebas determina los resultados en materia de seguridad más que el modelo que se utiliza en él. Esta prueba comparativa nos ofrece un primer vistazo a los resultados directos, al comparar Mythos 5 y Codex Security con Code Security Audit en los mismos repositorios, y el entorno de pruebas siguió marcando la diferencia.
Por supuesto, un único estudio comparativo no zanja la discusión, pero sí aporta pruebas de que la «teoría del arnés frente a la del modelo» ya no se basa únicamente en afirmaciones.

