pentesting de IA Sigue siendo una categoría relativamente nueva, y el término engloba productos muy diferentes que se presentan con un mismo lenguaje. Algunas herramientas se comportan más bien como escáneres automatizados (DAST con un «maquillaje» de LLM), mientras que otras exploran los flujos de trabajo de las aplicaciones, intentan llevar a cabo ataques de varios pasos y validan los resultados frente a un sistema en funcionamiento. Por eso es importante ir más allá de la terminología y evaluar lo que el producto hace realmente en la práctica.
En nuestro informe «El estado de la IA en las pruebas de penetración», encuestamos a 200 responsables de seguridad de la información (CISO) y a 200 responsables de ingeniería. El 76 % afirmó que implementa cambios significativos cada semana o con mayor frecuencia, pero solo el 21 % comprueba la seguridad en cada lanzamiento. Para eso sirven las pruebas de penetración basadas en IA.
Esta lista de verificación abarca los aspectos que consideramos más importantes a la hora de evaluar un proveedor de servicios de «pentesting de IA », entre los que se incluyen la validación y la calidad de la señal, la profundidad de las pruebas, el acceso al código, la fiabilidad operativa, la incorporación, las medidas de control técnico, la flexibilidad del modelo y cómo se integran las pruebas en tu flujo de trabajo de desarrollo actual.
Una forma sencilla de que la evaluación resulte más significativa es solicitar acceso directo a cada proveedor y observar la ejecución de las pruebas en directo, en lugar de limitarse a comparar los informes finales. Mantén un alcance comparable de las pruebas, ten en cuenta el esfuerzo que ha supuesto poner en marcha cada una de ellas y calcula el presupuesto o la capacidad de pruebas que ha consumido cada proveedor. De este modo, obtendrás una comparación mucho más precisa entre elementos equivalentes.
pentesting de IA Resumen de los criterios de evaluación
- Validación y calidad de la señal: los resultados van acompañados de pruebas que te permiten actuar de inmediato
- Profundidad de pentesting de IA: los agentes comprueban los límites de los permisos y los flujos de varios pasos en toda la aplicación
- Visibilidad e informes: puedes ver qué se ha comprobado y cómo
- Rapidez y adaptación al flujo de trabajo: los resultados llegan a tiempo para que sean relevantes
- Fiabilidad operativa: las pruebas se realizan sin necesidad de una supervisión constante
- Control del ámbito de aplicación y seguridad: la aplicación se lleva a cabo en el propio sistema
- Configuración e incorporación: una prueba real se lleva a cabo sin un largo periodo de puesta en marcha
- Flexibilidad en cuanto a modelos: no se limita a un único modelo o proveedor
pentesting de IA lista de verificación para la evaluación
La mayoría de los proveedores dan una buena impresión en una demostración. Los siguientes criterios se centran en el rendimiento de su producto en la práctica.
Validación y calidad de la señal
- Los resultados incluyen pruebas claras y son reproducibles
- Los problemas se validan en un sistema en producción
- Los resultados pueden utilizarse directamente sin necesidad de una clasificación previa adicional
- Los resultados reflejan las vías de explotación reales
Profundidad de pentesting de IA
- Las pruebas abarcan los flujos de trabajo, las funciones y el estado de la aplicación
- Se pueden detectar y confirmar problemas que implican varios pasos
- Las pruebas se adaptan al comportamiento de la aplicación
- ¿Puede utilizar el código fuente o el contexto interno para mejorar la cobertura?
El acceso al código influye en el resultado en este caso más que cualquier otro factor de esta lista. En más de 1.000 pruebas de penetración basadas en IA, las pruebas en las que se tuvo acceso al código revelaron, de media, siete veces más vulnerabilidades graves y críticas que las pruebas en las que no se tuvo acceso al código, con un coste por hallazgo aproximadamente la mitad del de los agentes.
Visibilidad y presentación de informes
- Puedes ver qué se ha probado y cómo ha respondido el sistema
- Existe un registro claro de las medidas adoptadas durante las pruebas
- Los informes contienen suficiente información para reproducir los problemas
Velocidad y adaptación al flujo de trabajo
- Se puede ejecutar una prueba significativa sin necesidad de una configuración prolongada
- Los resultados llegan a tiempo para poder actuar en consecuencia
- Las correcciones pueden volver a someterse a prueba y confirmarse
- Las pruebas se integran en el proceso de lanzamiento de software de tu equipo
La rapidez con la que se ejecuta una prueba influye en la parte del sistema a la que realmente llega. Una plataforma de servicios financieros llevó a cabo una prueba de penetración manual de 120 horas que no detectó ningún hallazgo. La misma aplicación, sometida a prueba con agentes de pentesting de IA que tenían acceso al código fuente, tardó poco más de dos horas y reveló 13 incidencias válidas, entre ellas tres hallazgos de alta gravedad que la prueba manual no había detectado en absoluto. Pide a los proveedores que te muestren los tiempos comparativos junto con el informe final.
Fiabilidad operativa
- Las pruebas se completan sin necesidad de reinicios frecuentes
- Los fallos son comprensibles cuando se producen
- Las carreras no requieren una supervisión constante
- El sistema funciona de forma fiable en el uso diario
Todos los sistemas fallan de vez en cuando. Lo que importa es con qué frecuencia ocurre y cuánto esfuerzo se necesita para recuperarse.
Control del alcance y seguridad
- El ámbito se aplica durante la ejecución
- Las restricciones de ámbito se aplican en el propio sistema, independientemente de las instrucciones o la política.
- El acceso está limitado a dominios específicos
- La producción solo se incluye cuando se configura explícitamente.
- Las solicitudes que no entran dentro del ámbito de aplicación se bloquean automáticamente
- Las comprobaciones previas a la ejecución verifican el alcance y la configuración del entorno antes de que comience la prueba
Pregunta cómo gestiona un proveedor los agentes que no se comportan de forma predecible. Como dice Philippe Dourassov, responsable de pruebas de penetración con IA de Aikido: «Siempre habrá un 5 % de agentes que no actúen de forma sensata, y por eso nos aseguramos de hacer frente a ese 5 %». Un proveedor que no ofrezca una respuesta clara a esta pregunta está confiando en el criterio del modelo en lugar de contar con un mecanismo de protección a nivel del sistema.
Para obtener más información sobre cómo garantizar la seguridad de los agentes de pruebas de penetración basadas en IA desde su diseño, lee esto.
Aislamiento y protección de datos
- El acceso saliente y la filtración de datos quedan restringidos durante la ejecución
- Los datos permanecen dentro de los entornos autorizados
- Los entornos de ejecución están aislados entre sí
- Las pruebas se pueden supervisar, pausar y detener de inmediato
Configuración e incorporación
- Se puede iniciar una prueba sin necesidad de un largo proceso de incorporación
- La configuración es muy sencilla
- La autenticación y la configuración del ámbito son estables
La configuración suele ser la fase en la que los problemas se detectan más pronto. Si los primeros pasos resultan complicados, esto suele repercutir en el uso habitual.
Flexibilidad del modelo y nivel de validación
- El producto no está limitado a un único modelo de IA ni a un único proveedor.
- Se pueden utilizar distintos modelos para distintas tareas de prueba
- Varios agentes pueden explorar y realizar pruebas al mismo tiempo
- Los agentes pueden adaptarse en función del comportamiento de la aplicación durante las pruebas.
- Las pruebas no se limitan a las firmas de vulnerabilidad predefinidas
- Los agentes pueden seguir rutas de ataque de varios pasos y encadenar vulnerabilidades entre sí
- Los resultados se confirman sometiéndolos a pruebas en un sistema en funcionamiento, por lo que no se extraen conclusiones basándose únicamente en los resultados del modelo.
- El comportamiento del modelo se ve limitado por medidas de seguridad técnicas durante la ejecución
Si un proveedor no cumple claramente estos criterios, los resultados acabarán requiriendo una validación manual para que sean fiables, lo que va en contra del objetivo de pentesting de IA.
Señales de alerta a las que hay que prestar atención
- Las pruebas no se completan de forma fiable
- La configuración tarda demasiado
- Las conclusiones no están demostradas
- Los resultados no dan lugar a soluciones
- No hay función integrada para volver a realizar la prueba
- Solo evalúa el comportamiento a nivel superficial
- El ámbito no se aplica técnicamente
- Queda bien en una demostración, pero da problemas en la práctica
Lista rápida de cosas que hay que comprobar con los proveedores
- Se ejecuta cuando realizas un envío
- Ofrece la opción de acceso al código para un análisis más detallado
- Detecta problemas reales y contrastados
- Detecta errores de lógica y de autorización
- Fácil de poner en marcha
- Se mantiene dentro del ámbito definido
- ¿Es lo suficientemente rápido como para adaptarse a tu calendario de lanzamientos?
- Resultados que se pueden reproducir
- Las correcciones se verifican
- Se adapta a la forma en que tu equipo publica y corrige el código
- Funciona de forma fiable
Pruebas sobre el terreno
Tyro, la empresa australiana de pagos financieros, llevó a cabo una prueba de concepto en la que comparó la tecnología « pentesting de IA » con sus evaluadores humanos habituales en relación con un nuevo producto sanitario antes de su lanzamiento.
«A nuestros probadores de penetración actuales les llevó aproximadamente 15 días. Hicimos lo mismo con la prueba de penetración basada en IA de Aikido. Tardó cinco horas y media y detectó aproximadamente 30 vulnerabilidades, nueve de ellas de alto riesgo, mientras que los probadores humanos detectaron cinco vulnerabilidades, una de ellas de alto riesgo», afirmó Arun Singh, antiguo responsable de seguridad de la información de Tyro.
El plan de cara al futuro mantiene a los revisores humanos y añade la IA para ampliar la cobertura: «Nuestro plan es un modelo híbrido, que combina pruebas de penetración con IA y auditorías de código con IA, junto con una revisión humana por parte de nuestros socios especializados en pruebas de penetración. Los costes son considerablemente inferiores a lo que pagábamos antes, por lo que podemos hacer mucho más con los recursos de los que disponemos».
Ponlo a prueba
La forma más rápida de aplicar esta lista de comprobación es observar cómo trabajan los propios proveedores. Solicita acceso a la plataforma, realiza una prueba comparable con cada uno de ellos y valóralos según los apartados anteriores mientras se lleva a cabo la prueba.
Comprueba cómo se aplican estos criterios en una plataforma real o lee la «Guía del comprador para pruebas de penetración con IA» completa para conocer el estudio en el que se basa esta lista de verificación.

