
dots-note-3.0 obtient un score parfait à l’IMO
dots-note-3.0 de Xiaohongshu aurait obtenu 42/42 à l’IMO 2026. Découvrez comment son processus de rédaction des preuves associe autovérification et validation Python.
Un modèle d’IA a obtenu le score parfait de 42/42 à l’IMO 2026 sous le contrôle de correcteurs humains officiels. Cela signifie que dots-note-3.0 de Xiaohongshu ne s’est pas contenté de trouver les bonnes réponses : il a rédigé six preuves complètes que les correcteurs ont acceptées.
Voici la version courte :
- Date : juillet 2026
- Événement : Olympiade internationale de mathématiques à Shanghai
- Score : 42 sur 42
- Comparaison avec les humains : seuls 7 des 666 élèves ont également obtenu un score parfait
- Évolution : le meilleur résultat précédent d’une IA était de 35/42 en 2025
- Pourquoi ce résultat compte : l’IMO évalue la rédaction de preuves longues et détaillées, pas la capacité à deviner une réponse
Pour le dire simplement, ce résultat montre que la rédaction de preuves par l’IA a franchi un cap lors d’une épreuve particulièrement difficile. Cela ne signifie pas que l’IA est infaillible au quotidien. Les problèmes de l’IMO sont clairs et structurés ; les tâches ordinaires ne le sont souvent pas.
Ce qui me frappe, c’est le processus suivi par le modèle. Il a lu du LaTeX brut, construit des preuves en algèbre, géométrie, combinatoire et théorie des nombres, puis utilisé une boucle d’autovérification associant raisonnement textuel et vérifications Python avant la soumission. C’est important, car le même type de contrôle des étapes peut aider dans des systèmes où le résultat d’un modèle alimente le suivant.
Voici donc la conclusion en termes simples : dots-note-3.0 a atteint un score exceptionnel dans un concours de mathématiques, mais l’essentiel réside dans la qualité de ses preuves, pas seulement dans ses aptitudes mathématiques.

Pour la première fois, un modèle d’IA obtient un score parfait de 100 % à l’Olympiade internationale de mathématiques

Le benchmark de l’IMO et le résultat officiel de dots-note-3.0

L’IMO est un concours de preuves composé de six problèmes, organisé sur deux jours pour des élèves de moins de 20 ans. Chaque problème vaut 7 points, pour un score maximal de 42. Et ce n’est pas le genre de concours de mathématiques où le bon résultat numérique suffit à obtenir tous les points. Pour réussir, les candidats doivent présenter des preuves complètes et logiquement valides. Le nombre de points partiels dépend du degré d’exhaustivité de la preuve.[5][3]
En juillet 2026, l’IMO s’est tenue à Shanghai avec 666 candidats venus de 117 pays. Après la fin du concours humain, Xiaohongshu a évalué dots-note-3.0 selon les règles officielles de notation, sans intervention humaine, puis a soumis ses solutions à la correction officielle. Le modèle a obtenu 7 sur 7 à chacun des six problèmes, soit un score parfait de 42 sur 42.[1][2][4]
Ce détail est important. Un score parfait à l’IMO ne signifie pas que le candidat a trouvé les bonnes réponses par chance ou par reconnaissance de motifs. Cela veut dire que le travail soumis a été jugé comme un raisonnement complet fondé sur des preuves, du début à la fin.
Comment est attribué un score parfait de 42 sur 42
Un score parfait de 42/42 exige que chaque preuve soit complète. Aucune étape manquante. Aucune lacune logique. Aucune condition oubliée. Les correcteurs de l’IMO évaluent la qualité du raisonnement lui-même, et pas seulement son aboutissement.[5][3]
Autrement dit, la barre est haute. Le candidat doit maintenir une chaîne logique irréprochable sur les six problèmes et la présenter d’une manière qui résiste à l’examen officiel.
Pourquoi ce résultat est historiquement important
Il s’agit du premier grand modèle de langage à recevoir un score parfait lors d’une correction officielle de l’IMO.[1][4]
Les capacités que dots-note-3.0 a dû démontrer
Pour obtenir 42/42, dots-note-3.0 ne pouvait pas se contenter d’aboutir à la bonne réponse. Il devait lire les énoncés bruts en LaTeX, choisir une méthode de démonstration, puis rédiger dans le temps imparti une preuve complète que des correcteurs humains pourraient vérifier. [1] Le format de l’entrée et la qualité de la preuve comptaient donc tout autant que le résultat final.
Lire des problèmes en LaTeX et rédiger des preuves complètes
dots-note-3.0 a travaillé directement à partir d’énoncés bruts en LaTeX et produit des preuves complètes et lisibles par l’humain, telles que celles qu’évaluent les correcteurs officiels. [1] Ce passage de l’énoncé brut à la preuve validée est précisément là où un raisonnement plus profond commence à apparaître.
Un raisonnement en plusieurs étapes couvrant l’algèbre, la géométrie, la combinatoire et la théorie des nombres
Résoudre les six problèmes de l’IMO suppose de démontrer une large capacité de raisonnement en algèbre, en géométrie, en combinatoire et en théorie des nombres. [1][2] Concrètement, il faut construire des arguments géométriques, démontrer des propriétés des nombres entiers, analyser différents cas combinatoires et relier des lemmes intermédiaires au sein d’un raisonnement valide et cohérent.
Certains problèmes de 2026 étaient également présentés sous forme narrative ; le modèle devait donc écarter le récit pour atteindre la structure mathématique sous-jacente. [1]
Exemples de tâches accessibles à ce niveau de raisonnement
Voici à quoi ressemble ce niveau de raisonnement dans la pratique :
| Domaine | Exemple de tâche |
|---|---|
| Géométrie | Construire des arguments géométriques à partir d’une configuration donnée |
| Théorie des nombres | Démontrer des propriétés des nombres entiers |
| Combinatoire | Analyser différents cas pour compter ou exclure les configurations valides |
| Algèbre | Enchaîner identités et lemmes jusqu’à l’unique conclusion valide |
Le modèle devait aussi montrer pourquoi la conclusion était nécessairement vraie, sous une forme conforme aux critères de correction officiels de l’IMO. [1][2] Ces mêmes aptitudes à la démonstration expliquent en grande partie pourquoi ce résultat compte pour la recherche plus générale sur le raisonnement de l’IA.
Pourquoi ce résultat compte pour la recherche sur le raisonnement de l’IA
L’IMO est particulièrement difficile pour l’IA, car ce n’est pas un QCM. Les candidats doivent rédiger des preuves complètes, étape par étape, et un seul cas manqué ou une seule condition omise peut coûter des points. Ce benchmark évalue donc la validité de bout en bout d’une preuve, pas seulement l’apparente justesse de la réponse finale.
C’est un point essentiel. Les benchmarks qui n’évaluent que la réponse peuvent dissimuler un raisonnement fragile si un modèle arrive au bon résultat pour de mauvaises raisons. L’IMO ne laisse pas passer cela : elle vérifie si le modèle maintient sa logique du début à la fin.
Ce que cela indique sur la précision du raisonnement avancé
Un score parfait de 42/42 suggère que le modèle a pu tracer le plan d’une preuve, vérifier ses propres étapes intermédiaires et mener chaque argument à son terme sans rompre la chaîne logique. En termes simples, cela témoigne d’une meilleure autovérification sur de longues preuves.
La progression ressort également du contexte. En 2025, les meilleurs systèmes avaient atteint 35/42 ; le passage à 42/42 marque donc une nette amélioration de l’exhaustivité des preuves [3].
La question la plus difficile est de savoir dans quelle mesure ce raisonnement se transpose au-delà des mathématiques de concours.
Pourquoi les limites des benchmarks restent importantes
Même un score parfait à l’IMO ne démontre pas une fiabilité générale dans les situations quotidiennes, souvent désordonnées. Les problèmes de concours sont structurés ; les entrées du monde réel ne le sont fréquemment pas. Elles peuvent être bruitées, vagues ou dépourvues de détails essentiels [6].
Ce résultat constitue donc une preuve solide de capacités avancées en raisonnement mathématique. Mais il ne faut pas l’interpréter comme la promesse d’une compréhension universelle.
C’est cette même constance qui rend le raisonnement avancé utile dans les processus multimodaux et pilotés par API.
Comment un raisonnement de niveau IMO peut s’appliquer aux applications multimodales et pilotées par API
Où un raisonnement solide aide dans les processus réels
Ce niveau de constance est surtout important lorsque le raisonnement ne constitue qu’une partie d’une chaîne plus vaste. En production, une seule contrainte oubliée peut fausser l’ensemble du résultat. Un assistant de recherche, un outil de tutorat ou un agent de programmation sont tous confrontés à la même exigence : conserver chaque contrainte du début à la fin.
C’est là qu’une boucle d’autovérification est utile. Elle peut détecter les petites erreurs tôt, avant qu’elles ne se transforment en défaillances plus graves.
Utiliser APIMart pour associer des modèles de raisonnement, de vidéo, d’image et de langage

Dans les pipelines multimodaux, un modèle de raisonnement peut vérifier l’entrée avant qu’elle n’atteigne un générateur de vidéos ou d’images. Le même principe s’applique lorsque le raisonnement doit servir de filtre avant le lancement de la génération de médias.
APIMart permet aux équipes d’associer des modèles de raisonnement, d’image, de vidéo et de langage via une seule API. Elles peuvent ainsi valider les entrées avant de les transmettre à un modèle vidéo.
Au quotidien, la précision du raisonnement devient une couche de fiabilité pour les pipelines multimodaux. C’est pourquoi un raisonnement de niveau IMO compte au-delà des mathématiques : il aide à vérifier, acheminer et utiliser les systèmes multimodaux avec davantage de confiance.
Conclusion : une étape vérifiée dans le raisonnement, riche d’enseignements pratiques
dots-note-3.0 a obtenu un score parfait de 42 sur 42 à l’Olympiade internationale de mathématiques (IMO) 2026. C’est la première fois qu’un modèle d’IA atteint ce résultat sous le contrôle de correcteurs humains officiels, qui ont lu et noté chaque ligne de chaque preuve [1][7].
Le modèle a rédigé des preuves complètes pour toute la série de l’IMO, sans aide humaine. Il a suivi une boucle itérative combinant raisonnement textuel et vérifications Python afin de tester, corriger et affiner ses propres preuves avant la soumission finale [7]. L’aspect le plus remarquable est le suivant : le modèle pouvait vérifier son propre travail et corriger ses erreurs en cours de route.
Pour les utilisateurs d’APIMart qui créent des processus multimodaux, c’est la principale leçon. La rédaction de preuves de niveau IMO ne garantit pas une fiabilité parfaite dans tous les cas d’usage. Elle indique toutefois quelque chose d’important : le raisonnement vérifiable se rapproche d’une capacité sur laquelle les équipes pourront compter dans leurs processus de production.
Autrement dit, un raisonnement capable de s’autovérifier peut renforcer la confiance dans les processus APIMart qui réunissent des modèles de langage, d’image et de vidéo.
FAQ
Pourquoi un score parfait à l’IMO est-il si important pour l’IA ?
Un score parfait à l’Olympiade internationale de mathématiques (IMO) est important parce qu’il révèle quelque chose de plus profond que la reconnaissance de motifs. L’IMO ne demande pas seulement des réponses, mais des preuves mathématiques complètes.
Lorsqu’un modèle obtient 42 sur 42, ce n’est donc pas un mince exploit. Cela signifie qu’il peut construire de longs raisonnements étape par étape et les maintenir intacts du début à la fin, sans erreur logique, condition manquante ni affirmation non étayée.
Ce degré de précision compte lorsque le raisonnement s’étend sur de nombreuses étapes, et pas seulement lorsqu’il s’effectue en un seul saut.
Cela signifie-t-il que dots-note-3.0 est fiable en dehors des concours de mathématiques ?
Un score parfait à l’Olympiade internationale de mathématiques témoigne d’un raisonnement logique solide et sans erreur. Mais il ne garantit pas la fiabilité dans toutes les situations réelles.
L’IMO évalue une forme étroite de raisonnement mathématique dans des conditions strictes. dots-note-3.0 doit encore être testé sur vos propres charges de production, critères et profils de trafic avant un déploiement complet.
Comment un raisonnement de niveau IMO peut-il améliorer de véritables processus d’IA ?
Un raisonnement de niveau IMO aide dans les processus d’IA réels parce qu’il pousse le modèle à résoudre les problèmes difficiles étape par étape, au lieu de simplement produire une réponse finale. C’est particulièrement important pour les calculs en plusieurs étapes, où une petite erreur initiale peut fausser tout ce qui suit.
Il facilite également la vérification du travail intermédiaire. Plutôt que de traiter le résultat comme une boîte noire, il devient possible d’examiner chaque étape, de repérer les maillons faibles et d’identifier les erreurs de preuve ou de logique avant qu’elles ne se propagent.
Au quotidien, cela peut se traduire par moins de défaillances dans les systèmes utilisant des outils, une meilleure précision lorsque le modèle doit respecter des contraintes strictes, et une prise en charge plus solide des applications multimodales avancées ou pilotées par API qui dépendent d’une logique constante.
Choisissez le modèle qui vous convient dans le marketplace
Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.