
Au cœur de dots-note-3.0 : une percée de l’IA en mathématiques
Découvrez comment dots-note-3.0 aurait obtenu le score parfait de 42/42 à l’IMO grâce à des preuves en langage naturel, des vérifications Python et un processus itératif d’autoévaluation.
Un modèle d’IA aurait obtenu 42/42 à l’IMO 2026, mais l’essentiel ne tient pas au score seul. Je le résumerais ainsi : dots-note-3.0 est conçu pour rédiger, vérifier et corriger des preuves mathématiques avant de répondre. Il s’attaque ainsi à un problème difficile pour l’IA : garantir la validité de chaque étape d’une démonstration, du début à la fin.
Voici la version courte :
- dots-note-3.0 est un modèle spécialisé en mathématiques de RedNote/Xiaohongshu.
- Il aurait obtenu un score parfait de 42/42 à l’Olympiade internationale de mathématiques 2026, organisée à Shanghai.
- En 2025, les meilleurs scores d’IA annoncés à l’IMO étaient de 35/42 ; ce résultat représenterait donc un gain de 7 points.
- Le modèle associe raisonnement en langage naturel et vérifications Python.
- Sa méthode centrale repose sur une boucle d’autoévaluation : rédiger une preuve, tester les étapes, corriger les erreurs, puis répondre.
- Cette performance reste annoncée par l’entreprise ; une vérification externe demeure donc importante.
- L’article examine également ce que cela implique pour les chercheurs, enseignants, étudiants, développeurs et utilisateurs d’API.
Le point essentiel est simple : les problèmes de l’IMO évaluent des preuves complètes, pas seulement les réponses finales. Une seule étape fragile peut donc tout compromettre. Si dots-note-3.0 confirme ses résultats lors de tests externes, il marquerait le passage d’une « IA qui trouve souvent la réponse » à une IA capable de défendre cette réponse étape par étape.
Je vois aussi un second fil conducteur dans cet article : ce modèle se situe entre la rédaction de preuves en langage courant et la démonstration formelle de théorèmes. Ses résultats restent ainsi plus faciles à lire pour les humains, sans offrir toutefois les mêmes garanties de vérification automatique qu’un système de preuve formelle.
L’équipe IMO d’OpenAI explique pourquoi les modèles résolvent enfin des problèmes mathématiques de très haut niveau

Comparaison rapide
| Sujet | dots-note-3.0 |
|---|---|
| Objectif principal | Raisonnement mathématique fondé sur des preuves |
| Score annoncé à l’IMO 2026 | 42/42 |
| Meilleur score antérieur cité pour 2025 | 35/42 |
| Méthode centrale | Boucle d’autocritique et de révision |
| Outils utilisés | Langage naturel et Python |
| Principal atout | Repérer les lacunes avant la réponse finale |
| Principale limite | Vérification externe encore attendue |
| Utilisateurs les plus concernés | Chercheurs, enseignants, étudiants et développeurs |
Dans cet article, je considère donc le score comme le grand titre, et le processus de vérification des preuves comme l’aspect le plus important.
Ce qu’est dots-note-3.0 et pourquoi son résultat annoncé à l’IMO est important
dots-note-3.0 est le plus petit modèle de la famille dots3 de Xiaohongshu. Il a été conçu pour le raisonnement mathématique tout en utilisant moins de ressources de calcul que les modèles jazz et aria, plus grands. Le modèle est encore en version bêta, et l’entreprise indique que son code source sera publié ultérieurement, sans avoir communiqué de date. Ce contexte compte, car le modèle est ici évalué sur un raisonnement exigeant des preuves, et non sur la seule apparence de sa réponse finale. [2][4]
Le score annoncé de 42/42 à l’IMO 2026
Xiaohongshu affirme que dots-note-3.0 a obtenu le score parfait de 42 points sur 42 à l’Olympiade internationale de mathématiques 2026 à Shanghai. Selon l’entreprise, le modèle a résolu les six problèmes à partir de leurs énoncés officiels et rédigé des preuves complètes en langage naturel, sans lacune logique ni condition omise. Aucune aide humaine n’a été utilisée pendant l’évaluation, et les solutions ont été soumises aux organisateurs de l’IMO pour notation. [2][4][3]
Ce score dépasse les 35/42 annoncés pour les meilleurs modèles en 2025. [2][4] Oui, ce titre attire l’attention. Mais il doit encore être confirmé de manière indépendante.
Pourquoi cette affirmation va plus loin qu’une victoire classique sur un benchmark
L’IMO ne fonctionne ni comme un QCM ni comme un benchmark à réponses courtes. Elle évalue des preuves complètes. Ce résultat porte donc sur la capacité à maintenir un raisonnement du début à la fin, et pas seulement à choisir la bonne réponse ou à aboutir à la bonne conclusion.
Les limites de vérification à garder à l’esprit
Pour l’instant, le résultat de 42/42 repose sur les données communiquées par Xiaohongshu. L’entreprise affirme avoir soumis les solutions générées par son IA aux organisateurs officiels de l’IMO pour notation, mais une évaluation externe et davantage de détails sur le processus de notation restent nécessaires avant de pouvoir vérifier pleinement cette affirmation. [3][2]
À ce stade, il est raisonnable de considérer le résultat de 42/42 comme prometteur, mais pas encore confirmé. La situation devrait s’éclaircir lorsque le code source sera publié et que des chercheurs indépendants pourront tester le modèle sur de nouveaux problèmes afin de voir si ses performances se maintiennent.
Comment dots-note-3.0 améliore le raisonnement mathématique

Autocritique récursive et révision avant la réponse finale
dots-note-3.0 associe le raisonnement en langage naturel à des vérifications Python pour valider les étapes intermédiaires [1]. Au lieu de s’en tenir à sa première tentative, il suit un cycle de révision répété : il teste chaque étape, repère les erreurs et réécrit la preuve avant de fournir sa réponse finale [1]. C’est la principale explication avancée pour son résultat annoncé à l’IMO.
Puisque l’IMO note des preuves complètes, dots-note-3.0 est conçu pour préserver la logique de l’ensemble du raisonnement, et pas seulement pour parvenir à la bonne réponse finale [1][2]. C’est essentiel pour les problèmes de type théorème, où une seule étape erronée peut invalider tout ce qui suit [1][2].
Les domaines mathématiques où l’autovérification récursive est la plus utile
Les gains les plus importants apparaissent dans les domaines où chaque étape doit être valable par elle-même.
| Domaine mathématique | Approche de dots-note-3.0 | Exemple concret |
|---|---|---|
| Preuves d’olympiade | Vérification itérative des hypothèses | Repérer un cas limite manquant dans un problème de combinatoire avant la finalisation |
| Algèbre symbolique | Exécution de code Python pour vérifier les étapes | Détecter une erreur de signe lors du développement d’un polynôme complexe |
| Preuves géométriques | Vérification rigoureuse des conditions géométriques | Réviser une preuve après avoir constaté qu’une propriété précise d’un triangle était supposée mais non démontrée |
| Calcul infinitésimal | Vérification des dérivations en plusieurs étapes | Corriger une intégration par parties erronée en recalculant la dérivée intermédiaire |
Tableau comparatif des méthodes de raisonnement
Ce tableau montre en quoi cette approche diffère des processus de raisonnement courants.
| Méthode de raisonnement | Atouts | Limites | Tâches mathématiques les plus adaptées |
|---|---|---|---|
| Autocritique récursive (dots-note-3.0) | Grande rigueur ; repère les lacunes logiques ; corrige les erreurs intermédiaires grâce à une autovérification itérative | Coût de calcul et latence plus élevés en raison des rédactions successives | Preuves de type olympiade, théorèmes complexes en plusieurs étapes, preuves géométriques |
| Chaîne de pensée standard (CoT) | Améliore les performances sur les problèmes simples rédigés ; facile à mettre en œuvre | Tendance à inventer des étapes logiques ; ne peut pas se corriger si une première étape est fausse | Arithmétique élémentaire, problèmes simples d’algèbre rédigés |
| Raisonnement enrichi par des outils | Grande précision des calculs grâce à Python ; gère les manipulations symboliques complexes | La qualité du résultat de l’outil dépend de la logique ayant conduit à l’appeler ; absence d’autoévaluation logique approfondie | Algèbre symbolique, dérivations en calcul infinitésimal, calculs arithmétiques lourds |
| Processus de preuve formelle | Offre une certitude mathématique absolue grâce à la vérification formelle | Nécessite une traduction vers des langages formels ; barrière d’entrée très élevée | Démonstration de théorèmes, formalisation d’exercices de manuels |
Le compromis est simple : davantage de calcul et d’attente, en échange d’une meilleure protection contre les erreurs susceptibles d’invalider une preuve.
La place de dots-note-3.0 dans la recherche actuelle sur l’IA mathématique
Preuves en langage naturel et démonstration formelle de théorèmes
Cette méthode est importante parce qu’elle se situe à mi-chemin entre les preuves lisibles par l’humain et la vérification formelle par machine.
Cette distinction est utile dans la recherche actuelle sur l’IA mathématique. D’un côté se trouvent les systèmes de preuve en langage naturel, qui associent des explications écrites à des outils comme Python. De l’autre, les démonstrateurs formels de théorèmes, dans lesquels chaque étape est rédigée dans un langage tel que Lean, puis vérifiée par une machine.
dots-note-3.0 appartient à la première catégorie. Il associe un raisonnement en langage naturel à des vérifications Python. L’aspect intéressant ne réside pas seulement dans sa capacité à trouver la bonne réponse. Il transforme le raisonnement mathématique en un processus de preuve lisible et autocorrectif, au lieu de se comporter comme une boîte qui produit simplement un résultat final.
Cette différence compte. Les preuves en langage naturel sont plus faciles à suivre pour les humains. Les preuves formelles sont plus solides lorsque l’objectif est la vérification par machine. Le compromis est simple : une preuve en langage naturel peut encore dissimuler de petites lacunes logiques qu’un système formel détecterait immédiatement.
Les benchmarks importants au-delà d’un seul résultat marquant
La même distinction se retrouve dans le choix des benchmarks.
Le résultat à l’IMO est impressionnant, mais il ne s’agit que d’un benchmark. Les chercheurs suivent également GSM8K, MATH500, AIME, MathVista et GPQA, car chacun évalue une facette différente du raisonnement : profondeur, géométrie, mathématiques visuelles ou résolution de problèmes de niveau expert.
Ce qui distingue l’IMO, c’est qu’elle évalue des preuves écrites complètes. Un cas oublié ou une condition non précisée peut faire perdre de vrais points. C’est très différent des tests qui ne vérifient que la réponse finale. Pour un modèle destiné à l’arithmétique, l’algèbre, la géométrie, le calcul infinitésimal et les travaux fondés sur des preuves, l’IMO constitue donc une cible bien plus exigeante.
Tableau comparatif des modèles et des benchmarks
Le tableau ci-dessous place dots-note-3.0 aux côtés d’autres systèmes qui permettent de situer sa position dans la recherche actuelle sur l’IA mathématique.
| Système | Type de tâche principal | Benchmark clé | Format de sortie | Atout annoncé |
|---|---|---|---|---|
| dots-note-3.0 | Raisonnement d’olympiade | IMO 2026 (42/42) [1][2][4] | Langage naturel + Python | Boucle d’autocritique agentique ; rigueur d’une preuve complète |
| Huawei Celia | Raisonnement d’olympiade | IMO 2026 (42/42) [3] | Preuves mathématiques | Capacités mathématiques multidisciplinaires |
| Moonshot AI Kimi K3 | Raisonnement de haut niveau | IMO 2026 (42/42) [3] | Langage naturel | A atteint le seuil du score parfait |
| DeepMind/OpenAI (2025) | Raisonnement d’olympiade | IMO 2025 (35/42) [1][2][4] | Formel + langage naturel | Performances de niveau médaille d’or |
Le principal élément différenciateur n’est pas seulement le score. C’est la boucle d’autocritique qui corrige les preuves avant leur soumission. Voilà ce qui détermine la place du modèle dans les processus de recherche et de développement de produits.
Ce que cela signifie pour les chercheurs, les enseignants, les étudiants, les développeurs et les utilisateurs d’APIMart

Cas d’usage pratiques dans l’enseignement, la recherche et les logiciels
dots-note-3.0 ne se contente pas d’afficher de meilleurs scores sur les benchmarks. Son principal atout est de vérifier et de corriger son propre raisonnement, ce qui rend les processus quotidiens plus fiables. Autrement dit, il transforme un raisonnement de niveau démonstration en un outil utilisable pour la recherche, l’enseignement et les logiciels.
Les chercheurs peuvent l’utiliser pour tester des conjectures, chercher des contre-exemples et mettre les étapes d’une preuve à l’épreuve avant leur formalisation. C’est important, car sa boucle d’autovérification vise à réduire les lacunes logiques et les conditions oubliées [2][4].
Les enseignants peuvent se servir du modèle pour créer des exemples détaillés et des corrigés. Il peut suivre une dérivation, repérer l’étape fautive et produire une solution corrigée. Les étudiants bénéficient de l’autre versant de cette même aide : un tuteur qui explique pourquoi une réponse est fausse, et pas seulement qu’elle l’est [2].
Les développeurs qui créent des produits quantitatifs ont besoin de précision et d’un formatage constant. Un processus SaaS financier peut, par exemple, utiliser le modèle pour calculer des intérêts composés ou produire des résultats numériques structurés, tout en conservant le format numérique américain, comme 1,000.25 [2].
Comment APIMart peut prendre en charge à grande échelle les processus de raisonnement mathématique
L’API unifiée d’APIMart simplifie la création de processus de raisonnement mathématique pour les équipes, sans les obliger à jongler avec des intégrations distinctes.
Pour les développeurs, le principal avantage réside dans une intégration plus simple et une planification plus claire de l’utilisation. Au lieu de maintenir plusieurs endpoints et des processus propres à chaque outil, les équipes peuvent envoyer leurs requêtes par une seule API, puis adapter les résultats au format requis par leur produit.
Tableau des effets par groupe d’utilisateurs et conclusion
Ces processus sont surtout utiles lorsque les utilisateurs ont besoin d’explications, et pas seulement de réponses. Le tableau ci-dessous montre comment ce type de raisonnement correspond aux différents groupes d’utilisateurs.
| Groupe d’utilisateurs | Cas d’usage | Capacité requise | Processus APIMart |
|---|---|---|---|
| Chercheurs | Ébauche de théorèmes et test de conjectures | Logique formelle et génération rigoureuse de preuves | Modèle de raisonnement -> sortie JSON -> LaTeX |
| Enseignants | Vérification des solutions et aide à la notation | Diagnostic des erreurs étape par étape | Saisie de l’étudiant -> modèle de raisonnement -> commentaires |
| Étudiants | Tutorat interactif et exemples détaillés | Explications mathématiques en langage naturel | API de chat -> mode de raisonnement étape par étape |
| Développeurs | SaaS quantitatif et processus financiers | Analyse numérique et logique de haute précision | API unifiée -> JSON structuré (par ex. $1,250.00) |
RedNote a annoncé son intention de publier prochainement le code source, sans avoir encore précisé les conditions applicables [2][4]. Pour les utilisateurs d’APIMart, l’intérêt tient à un raisonnement fiable, étape par étape, qui s’intègre proprement aux processus des produits.
FAQ
Comment le score de 42/42 a-t-il été vérifié ?
Le score de 42/42 a été vérifié en transmettant aux organisateurs de l’IMO les solutions complètes rédigées par dots-note-3.0 afin qu’elles soient notées par des humains, sans aucune intervention humaine pendant l’évaluation.
La note reposait sur l’exactitude et l’exhaustivité de chaque étape requise des preuves, et non sur les seules réponses numériques finales.
Que peuvent confirmer les vérifications Python dans une preuve ?
Dans dots-note-3.0, les vérifications Python permettent d’évaluer la solidité d’une preuve en testant, en remettant en question et en affinant le raisonnement provisoire du modèle.
Elles peuvent repérer des cas omis ou des conditions non énoncées susceptibles d’affaiblir une preuve écrite. Chaque étape peut ainsi être vérifiée sur le plan logique avant la soumission.
À qui dots-note-3.0 serait-il le plus utile ?
dots-note-3.0 convient surtout aux chercheurs, aux enseignants et aux développeurs qui ont besoin d’une précision rigoureuse et vérifiable pour résoudre des problèmes difficiles.
Il fournit un raisonnement fiable, étape par étape, en algèbre, géométrie, calcul infinitésimal et logique formelle. Il est donc particulièrement adapté aux travaux fondés sur des théorèmes et à l’analyse quantitative, où même de petites erreurs logiques ou des conditions implicites peuvent coûter cher.
Choisissez le modèle qui vous convient dans le marketplace
Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.