
dots-note-3.0 logra una puntuación perfecta en la IMO
Según los informes, dots-note-3.0 de Xiaohongshu obtuvo 42/42 en la IMO de 2026. Descubre cómo su flujo de redacción de demostraciones utiliza autocomprobaciones y validación con Python.
Un modelo de IA obtuvo una puntuación perfecta de 42/42 en la IMO de 2026 bajo una evaluación humana oficial. Esto significa que dots-note-3.0 de Xiaohongshu no se limitó a acertar las respuestas finales: redactó seis demostraciones completas que los evaluadores aceptaron.
Esta es la versión breve:
- Fecha: julio de 2026
- Evento: Olimpiada Matemática Internacional en Shanghái
- Puntuación: 42 de 42
- Comparación con participantes humanos: solo 7 de 666 estudiantes también obtuvieron una puntuación perfecta
- Qué cambió: el mejor resultado previo de una IA fue de 35/42 en 2025
- Por qué interesa: la IMO evalúa la redacción de demostraciones largas y paso a paso, no la capacidad de adivinar respuestas
Dicho de forma sencilla: este resultado demuestra que la redacción de demostraciones por parte de la IA ha alcanzado un nuevo nivel en una prueba muy difícil. Eso no significa que la IA sea infalible en el uso diario. Los problemas de la IMO son claros y estructurados. Las tareas habituales no suelen serlo.
Lo que más me llama la atención es el flujo del modelo. Leyó LaTeX sin procesar, construyó demostraciones de álgebra, geometría, combinatoria y teoría de números, y aplicó un ciclo de autocomprobación con razonamiento textual y comprobaciones de Python antes de enviar las soluciones. Esto es importante porque ese mismo control de cada paso puede ayudar en sistemas donde el resultado de un modelo sirve como entrada para otro.
Así que, si buscas la conclusión sin tecnicismos, es esta: dots-note-3.0 logró una puntuación poco común en un concurso de matemáticas, y la historia más importante es la calidad de sus demostraciones, no solo su destreza matemática.

Por primera vez, un modelo de IA ha obtenido un 100% perfecto en la Olimpiada Matemática Internacional

El benchmark de la IMO y el resultado oficial de dots-note-3.0

La IMO es un concurso de demostraciones para estudiantes menores de 20 años que dura dos días y consta de seis problemas. Cada problema vale 7 puntos, por lo que la puntuación máxima es 42. Y no es el tipo de concurso matemático en el que basta con acertar el número final para recibir todos los puntos. Para obtener una buena puntuación, los participantes deben presentar demostraciones completas y lógicamente válidas. La puntuación parcial depende de lo completa que sea la demostración.[5][3]
En julio de 2026, la IMO se celebró en Shanghái con 666 participantes de 117 países. Una vez finalizado el concurso para los participantes humanos, Xiaohongshu sometió a dots-note-3.0 a las reglas oficiales de evaluación, sin intervención humana, y envió sus soluciones para su calificación oficial. El modelo obtuvo 7 de 7 en cada uno de los seis problemas, lo que dio una puntuación perfecta de 42 de 42.[1][2][4]
Ese detalle es importante. Una puntuación perfecta en la IMO no significa que quien resolvió los problemas acertara por suerte o por reconocer patrones. Significa que el trabajo presentado se mantuvo sólido como razonamiento completo basado en demostraciones, de principio a fin.
Cómo se califica una puntuación perfecta de 42 sobre 42
Un 42/42 perfecto exige que cada demostración esté completa. Sin pasos omitidos. Sin lagunas lógicas. Sin condiciones ignoradas. Los evaluadores de la IMO juzgan la calidad del razonamiento en sí, no solo el punto de llegada.[5][3]
En pocas palabras, el listón está muy alto. Quien resuelve los problemas debe mantener una cadena lógica limpia en los seis y hacerlo de manera que supere la revisión oficial.
Por qué este resultado es históricamente significativo
Este es el primer modelo de lenguaje de gran tamaño que recibe una puntuación perfecta bajo la evaluación oficial de la IMO.[1][4]
Qué capacidades tuvo que demostrar dots-note-3.0
Para obtener 42/42, dots-note-3.0 tuvo que hacer algo más que llegar a la respuesta correcta. Debía leer los enunciados de los problemas en LaTeX sin procesar, elegir un camino de demostración y redactar después una demostración completa que los evaluadores humanos pudieran comprobar dentro del límite de tiempo del concurso. [1] Por tanto, el formato de la entrada y la calidad de la demostración importaban tanto como el resultado final.
Leer problemas en LaTeX y redactar demostraciones completas
dots-note-3.0 trabajó directamente a partir de enunciados en LaTeX sin procesar y produjo demostraciones completas, legibles para las personas y evaluadas por calificadores oficiales. [1] Ese salto —del enunciado sin procesar a una demostración verificada— es donde empieza a manifestarse un razonamiento más profundo.
Razonamiento de varios pasos en álgebra, geometría, combinatoria y teoría de números
Resolver los seis problemas de la IMO implica demostrar una amplia capacidad de razonamiento en álgebra, geometría, combinatoria y teoría de números. [1][2] En términos sencillos, supone construir argumentos geométricos, demostrar propiedades de los números enteros, recorrer divisiones de casos combinatorios y enlazar lemas intermedios en una única línea válida de razonamiento.
Algunos problemas de 2026 también estaban planteados como historias, por lo que el modelo tuvo que apartar la narración y llegar a las matemáticas subyacentes. [1]
Ejemplos de tareas que puede abordar este nivel de razonamiento
Así se ve este nivel de razonamiento en la práctica:
| Área | Tarea de ejemplo |
|---|---|
| Geometría | Construir argumentos geométricos a partir de una configuración dada |
| Teoría de números | Demostrar propiedades de los números enteros |
| Combinatoria | Analizar divisiones de casos para contar o descartar disposiciones válidas |
| Álgebra | Encadenar identidades y lemas hasta llegar a la única conclusión válida |
El modelo también tuvo que demostrar por qué la conclusión debía ser cierta en un formato que cumpliera los criterios oficiales de evaluación de la IMO. [1][2] Esas mismas habilidades de demostración son una razón importante por la que este resultado interesa a la investigación más amplia sobre el razonamiento de la IA.
Por qué este resultado importa para la investigación sobre el razonamiento de la IA
La IMO es especialmente difícil para la IA porque no es un examen tipo test. Los participantes deben redactar demostraciones completas y paso a paso, y hasta un solo caso ignorado o una condición omitida puede costar puntos. Por ello, este benchmark evalúa la validez de la demostración de principio a fin, no solo si la respuesta final parece correcta.
Esto es muy relevante. Los benchmarks que solo evalúan respuestas pueden ocultar un razonamiento débil si un modelo llega al resultado correcto por el motivo equivocado. La IMO no lo pasa por alto. Comprueba si el modelo puede mantener la lógica unida de principio a fin.
Qué revela esto sobre la precisión del razonamiento avanzado
Una puntuación perfecta de 42/42 sugiere que el modelo pudo trazar una demostración, comprobar sus propios pasos intermedios y terminar cada argumento sin romper la cadena lógica. Dicho sin tecnicismos: apunta a una autocomprobación más sólida en demostraciones largas.
El salto también destaca al ponerlo en contexto. En 2025, los sistemas más avanzados alcanzaron 35/42, por lo que 42/42 supone una mejora clara en la exhaustividad de las demostraciones [3].
La pregunta más difícil es cuánto de ese razonamiento se transfiere más allá de las matemáticas de concurso.
Por qué siguen importando los límites de los benchmarks
Una puntuación perfecta en la IMO tampoco demuestra una fiabilidad general en los entornos cotidianos, más desordenados. Los problemas de concurso están estructurados. Las entradas reales a menudo no lo están: pueden contener ruido, ser ambiguas o carecer de detalles esenciales [6].
Por tanto, el resultado constituye una prueba sólida de razonamiento matemático avanzado, pero no debe interpretarse como una promesa de comprensión generalista.
Esa misma coherencia es la que hace útil el razonamiento avanzado en flujos multimodales e impulsados por API.
Cómo puede aplicarse el razonamiento de nivel IMO a aplicaciones multimodales e impulsadas por API
Dónde ayuda un razonamiento sólido en flujos reales
Este nivel de coherencia importa sobre todo cuando el razonamiento solo es una parte de un proceso más amplio. En producción, una única restricción omitida puede desviar todo el resultado. Un asistente de investigación, una herramienta educativa o un agente de programación se enfrentan a la misma tarea: mantener todas las restricciones de principio a fin.
Ahí es donde ayuda un ciclo de autocomprobación. Puede detectar pequeños errores pronto, antes de que se acumulen y causen fallos mayores.
Usar APIMart para combinar el razonamiento con modelos de vídeo, imagen y lenguaje

En procesos multimodales, un modelo de razonamiento puede comprobar la entrada antes de que llegue a un generador de vídeo o imágenes. La misma idea funciona cuando el razonamiento debe actuar como filtro antes de iniciar la generación multimedia.
APIMart permite a los equipos combinar modelos de razonamiento, imagen, vídeo y lenguaje mediante una sola API. De este modo, pueden validar primero las entradas y después enviarlas a un modelo de vídeo.
En el uso diario, la precisión del razonamiento se convierte en una capa de fiabilidad para los procesos multimodales. Por eso el razonamiento de nivel IMO importa más allá de las matemáticas: permite comprobar, dirigir y utilizar los sistemas multimodales con mayor confianza.
Conclusión: un hito verificado del razonamiento con enseñanzas prácticas
dots-note-3.0 obtuvo una puntuación perfecta de 42 sobre 42 en la Olimpiada Matemática Internacional (IMO) de 2026. Es la primera vez que un modelo de IA alcanza esa marca bajo una evaluación humana oficial, en la que jueces humanos leen y califican cada línea de cada demostración [1][7].
El modelo redactó demostraciones completas para todo el conjunto de problemas de la IMO sin ayuda humana. Utilizó un ciclo iterativo con razonamiento textual y comprobaciones de Python para probar, revisar y depurar sus propias demostraciones antes del envío final [7]. Lo más destacable es esto: el modelo fue capaz de comprobar su propio trabajo y corregir errores sobre la marcha.
Para los usuarios de APIMart que crean flujos multimodales, esa es la gran enseñanza. Redactar demostraciones de nivel IMO no implica una fiabilidad perfecta en todos los casos de uso, pero sí señala algo importante: el razonamiento verificable está cada vez más cerca de ser una capacidad en la que los equipos pueden confiar en sus flujos de producción.
En pocas palabras, el razonamiento con autocomprobación puede mejorar la confianza en los flujos de APIMart que combinan modelos de lenguaje, imagen y vídeo.
Preguntas frecuentes
¿Por qué una puntuación perfecta en la IMO es tan importante para la IA?
Una puntuación perfecta en la Olimpiada Matemática Internacional (IMO) es importante porque apunta a algo que va más allá del reconocimiento de patrones. La IMO no solo pide respuestas, sino demostraciones matemáticas completas.
Por eso, cuando un modelo obtiene 42 de 42, no se trata de un logro menor. Significa que puede construir argumentos largos y paso a paso, y mantenerlos intactos de principio a fin, sin errores lógicos, condiciones omitidas ni afirmaciones sin fundamento.
Ese nivel de precisión importa cuando el razonamiento debe abarcar muchos pasos, no limitarse a un solo salto.
¿Significa esto que dots-note-3.0 es fiable fuera de los concursos de matemáticas?
Una puntuación perfecta en la Olimpiada Matemática Internacional apunta a un razonamiento lógico sólido y sin errores, pero no garantiza la fiabilidad en todos los escenarios reales.
La IMO evalúa un tipo limitado de razonamiento matemático bajo condiciones estrictas. dots-note-3.0 todavía debe probarse con las cargas de trabajo, los criterios y los patrones de tráfico reales de tu entorno de producción antes de desplegarlo por completo.
¿Cómo puede ayudar el razonamiento de nivel IMO en flujos de IA reales?
El razonamiento de nivel IMO ayuda en los flujos de IA reales porque obliga al modelo a resolver problemas difíciles paso a paso, en lugar de limitarse a arrojar una respuesta al final. Esto es muy importante en las matemáticas de varios pasos, donde un pequeño error al principio puede desviar todo lo que viene después.
También facilita la comprobación del trabajo intermedio. En lugar de tratar el resultado como una caja negra, puedes inspeccionar cada paso, detectar eslabones débiles y encontrar errores de demostración o de lógica antes de que se propaguen.
En el uso diario, esto puede traducirse en menos fallos en sistemas que utilizan herramientas, una mayor precisión cuando el modelo debe respetar restricciones estrictas y un apoyo más sólido para aplicaciones multimodales avanzadas o impulsadas por API que dependen de una coherencia lógica estable.
Elige el modelo que quieres en el marketplace
Prueba modelos de chat, imagen y video en el marketplace de APIMart y experimenta rápidamente sus capacidades con una API unificada.