Hoy presentamos Altar, nuestro primer modelo de seguridad de peso abierto, diseñado para aportar una seguridad defensiva de vanguardia a la infraestructura que tú controlas.

Dimos nuestro primer paso hacia la inteligencia de seguridad soberana con nuestro dispositivo de « pentesting autónomo » (detección y respuesta a amenazas) Aikido Machine, que se ejecuta íntegramente dentro de la propia infraestructura del cliente, incluidos los entornos totalmente aislados (air-gapped). Los equipos que cuentan con normas estrictas sobre el mantenimiento del código dentro de la propia empresa pueden detectar, explotar y validar continuamente las vulnerabilidades en toda su superficie de ataque sin infringir dichas normas.
Altar dota a Aikido Machine de una IA avanzada que protege la información, sin enviar los datos más confidenciales de una organización a un servicio de inferencia de terceros.
Para ello, teníamos que salvar la brecha de implementación. La mayoría de los modelos de peso abierto más potentes siguen siendo difíciles de implementar a escala de producción sin perder la calidad de razonamiento de los modelos de vanguardia.
Empezamos con GLM-5.3, uno de los modelos más potentes de nuestras evaluaciones de seguridad. El modelo completo ocupa 1,51 TB; la cuantificación reduce esa cifra a 488 GB, y nuestro proceso de poda realizado por expertos la reduce aún más, hasta los 328 GB, todo ello conservando la mayor parte de la calidad de razonamiento del modelo original.
.png)
Explicación de la diferencia entre los modelos «frontier» y de «peso libre»
Modelos de «frontera cerrada» que se ejecutan en la infraestructura de terceros
Utilizar uno de ellos implica que el código fuente, la documentación sobre la arquitectura interna y los hallazgos no subsanados salgan de la red. Para un banco que opera bajo una normativa de residencia de datos, un grupo hospitalario sujeto a estrictas normas de tratamiento de datos o un operador industrial cuyo entorno de tecnología operativa (OT) no tenga ningún tipo de conexión a Internet, no es una concesión que puedan permitirse.
La brecha en el despliegue
La ejecución de un modelo como el GLM 5.3 con precisión máxima requiere cientos de gigabytes de memoria unificada y ofrece una velocidad de inferencia limitada a la hora de gestionar conversaciones paralelas con ventanas de contexto amplias. En términos sencillos, son enormes.
Esas demandas de recursos se deben, en parte, a la forma en que se construyen estos modelos. Muchos de los modelos más potentes de la actualidad utilizan arquitecturas de «mezcla de expertos». Estos modelos están formados por una multitud de pequeñas redes neuronales especializadas, cada una de las cuales se denomina «experto». Solo un pequeño número de expertos está activo para cada token, mientras que el conjunto completo de expertos debe almacenarse y estar disponible. Eso significa asumir un coste significativo de memoria e infraestructura por una capacidad que puede contribuir muy poco a la carga de trabajo que realmente estás ejecutando.
Las tareas de seguridad, como revisar el código en busca de vulnerabilidades, proponer parches y realizar pruebas de penetración, solo requieren una pequeña parte de ese conjunto de expertos. Sin embargo, el coste de memoria no se reduce en consecuencia: cada solicitud sigue teniendo que cargar el modelo completo, sea o no relevante para la tarea.
Ahora, si añadimos agentes a la ecuación, el uso del contexto se dispara, lo que satura la memoria y hace que los agentes compitan entre sí por espacio. Cada uno de ellos mantiene un registro actualizado de todo lo que ha visto y hecho, y ese registro se almacena en la memoria de la GPU junto con el propio modelo, creciendo a medida que avanza una investigación y multiplicándose en cada una de las investigaciones que se ejecutan en paralelo.
Por eso el tamaño del modelo es importante en este caso: tanto el modelo como todo ese contexto en expansión consumen recursos de la misma reserva fija de memoria, por lo que cuanto más ocupa uno, menos espacio queda para el otro. El objetivo es lograr que un modelo de vanguardia funcione de forma más eficiente para una carga de trabajo específica, conservando las capacidades que importan y liberando al mismo tiempo capacidad para todo lo que se ejecuta en paralelo.
¿Qué podemos eliminar sin perder lo que realmente importa?
La gran carga que supone incorporar a tantos expertos en un modelo puede convertirse en una ventaja si se utilizan las técnicas adecuadas. Con el fin de minimizar el tamaño de los modelos de peso abierto en un contexto de seguridad basada en agentes, sin dejar de mantener una alta precisión, hemos utilizado la cuantificación y la poda.
La poda de expertos elimina a algunos de los expertos del modelo, normalmente borrando bloques completos de pesos de expertos y ajustando el modelo para que cada token solo elija entre los que quedan. La eliminación en sí misma es mecánica. Lo difícil es decidir qué expertos eliminar, y la pérdida puede ser desigual: un modelo más pequeño puede conservar un buen rendimiento en la codificación, pero perder gran parte de su capacidad para comprender un lenguaje natural concreto. Esto puede hacer que sea incapaz de interpretar de forma fiable la documentación, las reglas de negocio o las características de la aplicación descritas en ese lenguaje.
Para decidir qué conservar, partimos del dato más natural: los registros de nuestro entorno de pruebas de penetración al ejecutar pruebas de rendimiento internas. Estos registran el código, las llamadas a herramientas y las respuestas que procesan los agentes durante una prueba de penetración completa, lo que nos proporciona información representativa para orientar la selección de expertos. En ningún momento se utilizaron datos de clientes.
Este paso de calibración nos proporciona una base específica para cada carga de trabajo a la hora de seleccionar expertos, sin necesidad de entrenar nuevas habilidades en el modelo.
Las trazas del arnés cubrían la carga de trabajo técnico. También necesitábamos mantener la comprensión del lenguaje: analizar una aplicación implica comprender sus características, sus reglas de negocio y los flujos de trabajo previstos, incluso cuando su documentación o interfaz están en francés, neerlandés u otro idioma. Por ello, añadimos texto multilingüe para ayudar a mantener esas capacidades durante la poda.
La selección es tan importante como el tamaño
Existen muchas técnicas de poda para reducir el tamaño de los modelos de lenguaje grande (LLM), por lo que decidimos optar por una técnica que permitiera mantener el rendimiento en nuestros casos de uso: Cerebras REAP( Router-weighted Expert Activation Pruning). Utilizamos la puntuación de contribución de REAP con una estrategia de agregación que preserva el dominio, seleccionada mediante experimentos de fidelidad. Contar la frecuencia con la que se selecciona un experto solo ofrece una visión parcial. REAP estima su contribución utilizando tanto la ponderación del enrutador como la magnitud de la salida del experto.
También analizamos las aportaciones de los distintos grupos de ejemplos. De lo contrario, una competencia relevante para una carga de trabajo menos habitual podría perderse en la media general. Las competencias en ciberseguridad, programación y idiomas se reparten entre los distintos expertos; no existe un grupo claramente definido de «expertos en ciberseguridad» que se pueda mantener o descartar.
En el estudio de compresión complementario, los modelos que conservaban el mismo número de expertos diferían sustancialmente en cuanto al grado de coincidencia de sus resultados con el modelo de referencia. El tamaño por sí solo no determinaba cuáles sobrevivían.
De 1,51 TB a 328 GB
Hemos logrado una reducción total del tamaño del modelo del 78,2 % en comparación con GLM 5.3 a plena precisión, y una reducción del 32,8 % en comparación con GLM 5.3 con cuantificación AWQ INT4. Altar conserva 168 de los 256 expertos enrutados originales en cada capa de expertos de la estructura principal, eliminando 88, es decir, el 34,4 % de ellos. El enrutador sigue seleccionando ocho por token, ahora del banco más reducido.
La otra parte de la reducción proviene de la cuantificación. Los pesos de un modelo son los valores numéricos que aprende durante el entrenamiento. La cuantificación almacena esos números con menos bits, sacrificando algo de precisión a cambio de pesos almacenados más pequeños. A diferencia de la poda, no elimina los «expertos».
Nuestro punto de referencia inicial utilizaba AWQ para almacenar la mayoría de los pesos de los expertos en cuatro bits, en lugar de los dieciséis del modelo BF16. AWQ utiliza información sobre la actividad del modelo en entradas de ejemplo para limitar los errores introducidos por una menor precisión. Los valores intermedios generados durante la inferencia, denominados «activaciones», siguen siendo de 16 bits: de ahí el nombre W4A16, es decir, pesos de cuatro bits y activaciones de 16 bits. Algunos pesos también conservan una mayor precisión. A continuación, aplicamos la poda a este punto de control ya cuantificado.
Al comparar ambas representaciones de los padres, se aprecia qué aporta cada paso:
Eso supone un 78,2 % menos de espacio de almacenamiento que el modelo completo de 16 bits. En comparación con el modelo original, ya cuantificado, la poda elimina otros 160 GB, lo que supone una reducción del 32,8%.
El impacto de la compresión en la capacidad de identificación de vulnerabilidades
Anteriormente hemos creado un banco de pruebas interno de CVE que utilizamos para evaluar la capacidad de un modelo a la hora de identificar vulnerabilidades complejas del mundo real mediante nuestro conjunto de pruebas « análisis de código con IA »: 32 vulnerabilidades conocidas repartidas en 30 repositorios, con tres ejecuciones por caso.
Lo sometimos a pruebas con Altar. Altar registró una tasa media de detección del 60,4 % por ejecución y volvió a detectar 23 de las 32 vulnerabilidades al menos una vez a lo largo de tres ejecuciones.

En comparación, el modelo GLM-5.3 AWQ cuantificado obtuvo una tasa media de recuperación del 61,5 % y detectó las mismas 23 vulnerabilidades. El modelo GLM-5.3 original, con precisión máxima, obtuvo una tasa media de recuperación del 65,6 % y detectó 25 de las 32 vulnerabilidades.
En otras palabras, la reducción del punto de control ya cuantificado de 488 GB a 328 GB —lo que supone una reducción del 32,8 % en los pesos almacenados— dio lugar a una disminución de aproximadamente un punto porcentual en la recuperación media en comparación con la línea de base de AWQ, al tiempo que se conservaba toda su cobertura de vulnerabilidades. En comparación con el modelo original, Altar conservó 23 de las 25 vulnerabilidades cubiertas —es decir, el 92 %—, con una disminución de 5,2 puntos porcentuales en la recuperación media. Esto supone mantener el 92 % de la cobertura de vulnerabilidades del modelo original con un 33 % menos de almacenamiento.
Esa es la solución que buscábamos: un modelo considerablemente más pequeño que, al mismo tiempo, conservara la mayor parte de las prestaciones de seguridad del modelo original.
Presentamos la tasa media de detección por ejecución por separado de la cobertura en las tres ejecuciones: detectar una vulnerabilidad una sola vez no es lo mismo que detectarla de forma sistemática. Las ejecuciones completadas sin que se haya detectado ninguna vulnerabilidad se contabilizan como «fallos»; las ejecuciones incompletas se presentan por separado.
Esta prueba mide el redescubrimiento selectivo de vulnerabilidades CVE dentro de un proceso que utiliza otros modelos para las fases adyacentes. No mide el descubrimiento ciego en toda una base de código, ni ejecuta exploits para validar los resultados, ni evalúa la fase de propuesta de correcciones. Esos límites diferencian esta prueba de rendimiento del flujo de trabajo más amplio de pruebas de penetración para el que estamos diseñando Altar.
Además, implementamos Altar en nuestra flota de Aikido Machine inmediatamente después de completar estas evaluaciones. Poco después de la implementación, identificó una vulnerabilidad válida de gravedad crítica durante una prueba de penetración en el entorno de producción de un cliente.
{{cta}}
¿Y ahora qué?
La idea subyacente es más amplia: la inteligencia de seguridad soberana debería funcionar dentro de cualquier entorno que proteja.
Altar es solo el principio. En cuanto a la compresión, estamos explorando formatos de menor número de bits, como el EXL3, que podrían permitirnos conservar más datos de expertos, además de seguir optimizando la entrega de H200.
El siguiente paso consiste en ir más allá de la compresión y centrarnos en el entrenamiento: ajustar los modelos para los flujos de trabajo de seguridad, mejorar el uso de las herramientas y el razonamiento a largo plazo, y crear un proceso de autoaprendizaje basado en nuestros puntos de referencia internos para orientar y dar forma a los modelos futuros.
Esa labor abarcará la investigación de vulnerabilidades, el análisis de código, la corrección de problemas y otros procesos de seguridad defensiva.
Aikido Labs tiene como objetivo seguir avanzando en esa línea: modelos que ganen en capacidad con el tiempo sin perder la restricción fundamental, a saber, que los defensores deben poder ejecutarlos íntegramente dentro de los entornos que tienen la responsabilidad de proteger.
Agradecemos a Z.AI por GLM-5.3, a Cerebras por REAP, a cyanwiki por el modelo cuantificado y a 0xSero por el trabajo de compresión. El estudio público sobre la fidelidad, así como los planes de mantenimiento y el conjunto de herramientas de poda, ofrecen más detalles técnicos, sin publicar las conversaciones sin editar de los agentes.
Los pesos de Altar están disponibles a través de la organización Aikido. Altar se puede implementar y ejecutar cómodamente utilizando un nodo 4-H200s y la última versión de vLLM. Descarga Altar para obtener la ficha del modelo, la licencia, los parámetros de ejecución y las instrucciones de implementación.
¿Necesitas ayuda para ponerlo en marcha en tu propio entorno? Ponte en contacto con el departamento de ventas para que te expliquen cómo implementar Altar en tus propias instalaciones.
Este enfoque se está extendiendo a toda la gama de productos de Aikido, entre los que se incluyen Aikido Attack (pentesting de IA), Code Security Audit y Deep PR Review.

