APIMart
Claude Mythos descubre un fallo criptográfico en 60 horas

Claude Mythos descubre un fallo criptográfico en 60 horas

Descubre cómo Claude Mythos dedicó 60 horas y $100,000 a revelar un fallo de nonce en HAWK, por qué fue clave la verificación humana y qué pueden aprender los equipos de seguridad.

Análisis de modelos

En resumen, yo interpretaría esta historia como una lección sobre coste, concentración y revisión humana, no como una prueba de que la AI puede romper por sí sola la criptografía moderna.

En 60 horas y con un gasto de $100,000, Claude Mythos ayudó a encontrar un fallo en la generación de nonces relacionado con HAWK. El problema podría permitir que un atacante utilizara firmas públicas para avanzar hacia la recuperación de una clave privada mediante un ataque de retícula. Al mismo tiempo, el artículo deja clara una distinción: AES con menos rondas no es AES completo.

Si tuviera que resumir el artículo en unas líneas, sería así:

  • Objetivo: HAWK y AES con menos rondas
  • Resultado: un problema confirmado de sesgo en los nonces de HAWK
  • Riesgo: una cantidad suficiente de nonces débiles puede convertir las firmas públicas en una vía para robar claves
  • Coste: $100,000 durante un esfuerzo concentrado al estilo de un fin de semana
  • Proceso: la AI generó pistas; los humanos las filtraron y comprobaron
  • Lección: empezar con bajo coste, verificar pronto y usar los modelos de primer nivel al final del flujo de trabajo

Lo que más me llama la atención es la separación entre búsqueda y demostración. El modelo parece haber ayudado a examinar código e ideas de ataque con rapidez, con una tasa de reproducción de exploits al primer intento del 83.1% citada en el artículo. Sin embargo, el propio mensaje del texto es claro: las personas todavía tuvieron que confirmar qué era real.

Para desarrolladores y equipos de seguridad, los consejos del artículo son directos:

  • usar primero modelos más pequeños
  • fijar límites estrictos de presupuesto
  • validar antes de aumentar el gasto
  • tratar la salida del modelo como pistas, no como hallazgos definitivos

Esa es la parte con la que me quedaría. La conclusión principal no es que la AI haya descubierto algo nuevo. Es que un flujo de trabajo muy acotado y revisado por humanos puede convertir un patrón de ataque conocido en un hallazgo probado, si se está dispuesto a invertir tiempo y dinero.

Cómo encuentra la AI vulnerabilidades en bibliotecas criptográficas

2. Cómo empleó Claude Mythos el tiempo y el dinero

Claude Mythos

Flujo de auditoría criptográfica asistido por AI: $100K en 60 horas
Flujo de auditoría criptográfica asistido por AI: $100K en 60 horas

Cronología de la investigación de 60 horas

El esfuerzo de 60 horas siguió una secuencia clara: planteamiento del ataque, análisis guiado por el modelo, refinamiento y verificación con HAWK y AES de rondas reducidas. Al principio, el equipo eligió objetivos de ataque concretos y definió qué contaría como hallazgo confirmado. Después, Claude Mythos pasó a buscar variantes repetidamente, relacionando patrones de vulnerabilidades conocidos con posibles fallos del código criptográfico sin utilizar herramientas SAST estándar [4].

La parte intermedia se centró en probar posibles debilidades y eliminar falsos positivos. Los revisores humanos se ocuparon de ese filtrado. Claude Mythos reprodujo los exploits al primer intento el 83.1% de las veces, lo que supuso menos callejones sin salida y menos esfuerzo desperdiciado [1].

En la fase final, el equipo contrastó los candidatos más sólidos con el código fuente y los supuestos criptográficos de cada objetivo. Esas comprobaciones prepararon los escenarios de ataque descritos a continuación.

En qué se gastaron los $100,000

Los $100,000 cubrieron ejecuciones repetidas del modelo, la orquestación del flujo de trabajo y la revisión humana. En pocas palabras, el dinero no se destinó a un único gran intento. Se empleó en repetir el ciclo hasta descartar las pistas débiles y confirmar que las fuertes resistían el análisis.

Los modelos de pesos abiertos más pequeños también pueden ayudar en la verificación. En algunos casos, pueden recuperar cadenas de exploits complejas por solo $0.11 por millón de tokens [3].

Cómo encaja APIMart en los flujos de seguridad con varios modelos

APIMart

APIMart puede dirigir la generación de hipótesis, el análisis y la verificación a través de un único endpoint compatible con OpenAI. Esto facilita pasar del descubrimiento de candidatos a la comprobación sin tener que montar una transferencia complicada entre herramientas.

3. El fallo en la práctica: qué podrían hacer los atacantes

Escenarios de ataque que permite el descubrimiento

La pista más sólida fue un fallo de generación de nonces que convertía las firmas públicas en una vía para recuperar claves privadas. Claude Mythos encontró una generación sesgada de nonces en la implementación analizada. Cuando los nonces no siguen una distribución uniforme, un atacante puede recopilar firmas con el tiempo y ejecutar ataques de retícula contra el Hidden Number Problem (HNP) para recuperar la clave privada [5].

Los objetivos más fáciles son los sistemas que exponen muchas firmas en público. Una tasa de nonces fuera del intervalo de alrededor del 6% puede bastar para detectar una generación débil y justificar un intento de recuperación de la clave mediante firmas públicas [5]. Cuando el atacante tiene la clave privada, puede falsificar firmas y suplantar al propietario de la clave [5]. Esto es lo que vuelve práctico el ataque. Las propias firmas públicas se convierten en su materia prima.

Impacto medido frente a referencias de ataques anteriores

El cambio principal aquí es operativo. El modelo convirtió una clase de ataque conocida en una vía funcional con mayor rapidez que una clasificación puramente manual. Esa velocidad importa porque Claude Mythos reprodujo exploits al primer intento el 83.1% de las veces [1].

4. Qué significa esto para desarrolladores, equipos de seguridad y operaciones de AI

Dónde aporta más la AI a la investigación criptográfica

La AI no inventó una nueva clase de ataque. Lo que hizo fue acelerar el trabajo laborioso: encontrar candidatos probables, comprobar hipótesis y aplicar patrones de ataque conocidos a una base de código con grandes exigencias de seguridad.

Esa diferencia importa en la práctica. La AI puede reducir el espacio de búsqueda, pero no puede decidir qué constituye un problema real. Las personas todavía deben leer el código, probar la afirmación y contrastarla con el diseño criptográfico.

En julio de 2026, zkao, el agente de auditoría de AI de zkSecurity, confirmó siete errores reales en CIRCL, la biblioteca criptográfica experimental de Cloudflare. Entre ellos había una pérdida crítica de precisión de float64 en RSA de umbral y una ruptura del control de acceso en el cifrado basado en atributos; todos se corrigieron posteriormente en el proyecto original [2]. Esa es la división de tareas en términos sencillos: la AI ayuda a los equipos a encontrar más elementos que inspeccionar y los revisores humanos deciden cuáles resisten el análisis.

Cómo planificar una auditoría similar sin desperdiciar presupuesto

Un buen proceso de auditoría es bastante sencillo:

  • Empezar con modelos más económicos para encontrar las rutas de código adecuadas y señalar candidatos obvios
  • Contrastar esos hallazgos con el código fuente y los supuestos criptográficos
  • Pasar a un modelo insignia solo después de que un candidato supere esa revisión
  • Establecer límites de presupuesto antes de empezar el trabajo
  • Añadir un punto de validación temprano para que el equipo pueda continuar, cambiar de rumbo o detenerse antes de gastar dinero en un callejón sin salida

El orden importa. Un modelo de pesos abiertos con 3.6 mil millones de parámetros puede detectar exploits complejos por solo $0.11 por millón de tokens [3]. Por tanto, la computación costosa debe llegar al final del proceso, no al principio.

Esto es lo que hace útil la AI en las auditorías criptográficas. No se trata solo de avanzar más rápido. La principal lección del esfuerzo de Mythos es el equilibrio entre velocidad, verificación y coste: los $100,000 y las 60 horas produjeron un hallazgo confirmado y verificado por personas porque el proceso igualó el nivel de rigor que exigía el objetivo.

5. Conclusión: coste y valor de seguridad del criptoanálisis asistido por AI

Mythos confirmó un fallo de generación de nonces en HAWK mediante subagentes LLM que escanearon archivos en paralelo e inspeccionaron directamente el código fuente. La verificación humana fue lo que dio credibilidad al resultado. El trabajo de la AI redujo el tiempo de búsqueda y sacó a la luz un posible problema que los revisores pudieron confirmar y medir [4]. Esto cambia el foco. La pregunta principal no es tanto la novedad como el coste.

La siguiente cuestión es la eficiencia: ¿cuánto costó realmente esa búsqueda? A esta escala, la presión presupuestaria es difícil de ignorar y la respuesta depende mucho del alcance. Una configuración razonable consiste en utilizar modelos de pesos abiertos más pequeños para la primera pasada y reservar los modelos insignia para las partes que requieren un razonamiento más profundo [3].

Para los equipos, la conclusión es práctica, no abstracta. Limiten el alcance, validen pronto y traten la salida de la AI como pistas en lugar de respuestas definitivas. Daniel Stenberg, de Curl, lo expresó con claridad:

La AI apoya la revisión humana, no la sustituye

Ese punto se observa claramente en una auditoría de Curl. Mythos señaló cinco problemas, pero la revisión manual redujo la lista a un CVE de gravedad baja y un error [4].

Preguntas frecuentes

¿Podría este fallo exponer una clave privada en sistemas reales?

Sí. Si alguien explota un fallo que proporciona acceso a nivel de kernel, puede tomar el control de todo el sistema. Eso puede exponer datos sensibles, incluidas las claves privadas almacenadas en esas máquinas.

La investigación demuestra que el análisis asistido por AI puede encontrar y encadenar vulnerabilidades complejas. En términos sencillos, esto significa que a los atacantes podría resultarles más fácil unir pequeños fallos en una brecha mucho mayor, lo que aumenta el riesgo de ataques a escala.

¿Por qué costó la auditoría cerca de $100,000?

El coste aproximado de $100,000 se debió al uso intensivo de computación especializada, herramientas avanzadas e infraestructura de pruebas necesaria para ejecutar un análisis de seguridad profundo durante 60 horas.

También cubrió el trabajo técnico necesario para identificar, verificar y documentar fallos críticos en sistemas criptográficos complejos y de alto riesgo.

¿Qué verificaron los humanos que no pudo comprobar la AI?

Las personas comprobaron los hallazgos de la AI leyendo ellas mismas el código fuente y revisando cada caso manualmente para detectar errores.

Descubrieron que muchos problemas que la AI había «confirmado» eran en realidad falsos positivos o simples errores, no fallos de seguridad. Esa revisión adicional ayudó a garantizar que los hallazgos de alta gravedad fueran precisos antes de tratarlos como válidos.

¿Listo para probar?

Elige el modelo que quieres en el marketplace

Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.

Modelos de chatModelos de imagenModelos de video
Explorar marketplace