APIMart
Au cœur de dots-note-3.0 : une percée de l’IA en mathématiques

Au cœur de dots-note-3.0 : une percée de l’IA en mathématiques

Découvrez comment dots-note-3.0 aurait obtenu le score parfait de 42/42 à l’IMO grâce à des preuves en langage naturel, des vérifications Python et un processus itératif d’autoévaluation.

Perspectives sur les modèles

Un modèle d’IA aurait obtenu 42/42 à l’IMO 2026, mais l’essentiel ne tient pas au score seul. Je le résumerais ainsi : dots-note-3.0 est conçu pour rédiger, vérifier et corriger des preuves mathématiques avant de répondre. Il s’attaque ainsi à un problème difficile pour l’IA : garantir la validité de chaque étape d’une démonstration, du début à la fin.

Voici la version courte :

  • dots-note-3.0 est un modèle spécialisé en mathématiques de RedNote/Xiaohongshu.
  • Il aurait obtenu un score parfait de 42/42 à l’Olympiade internationale de mathématiques 2026, organisée à Shanghai.
  • En 2025, les meilleurs scores d’IA annoncés à l’IMO étaient de 35/42 ; ce résultat représenterait donc un gain de 7 points.
  • Le modèle associe raisonnement en langage naturel et vérifications Python.
  • Sa méthode centrale repose sur une boucle d’autoévaluation : rédiger une preuve, tester les étapes, corriger les erreurs, puis répondre.
  • Cette performance reste annoncée par l’entreprise ; une vérification externe demeure donc importante.
  • L’article examine également ce que cela implique pour les chercheurs, enseignants, étudiants, développeurs et utilisateurs d’API.

Le point essentiel est simple : les problèmes de l’IMO évaluent des preuves complètes, pas seulement les réponses finales. Une seule étape fragile peut donc tout compromettre. Si dots-note-3.0 confirme ses résultats lors de tests externes, il marquerait le passage d’une « IA qui trouve souvent la réponse » à une IA capable de défendre cette réponse étape par étape.

Je vois aussi un second fil conducteur dans cet article : ce modèle se situe entre la rédaction de preuves en langage courant et la démonstration formelle de théorèmes. Ses résultats restent ainsi plus faciles à lire pour les humains, sans offrir toutefois les mêmes garanties de vérification automatique qu’un système de preuve formelle.

L’équipe IMO d’OpenAI explique pourquoi les modèles résolvent enfin des problèmes mathématiques de très haut niveau

OpenAI

Comparaison rapide

Sujetdots-note-3.0
Objectif principalRaisonnement mathématique fondé sur des preuves
Score annoncé à l’IMO 202642/42
Meilleur score antérieur cité pour 202535/42
Méthode centraleBoucle d’autocritique et de révision
Outils utilisésLangage naturel et Python
Principal atoutRepérer les lacunes avant la réponse finale
Principale limiteVérification externe encore attendue
Utilisateurs les plus concernésChercheurs, enseignants, étudiants et développeurs

Dans cet article, je considère donc le score comme le grand titre, et le processus de vérification des preuves comme l’aspect le plus important.

Ce qu’est dots-note-3.0 et pourquoi son résultat annoncé à l’IMO est important

dots-note-3.0 est le plus petit modèle de la famille dots3 de Xiaohongshu. Il a été conçu pour le raisonnement mathématique tout en utilisant moins de ressources de calcul que les modèles jazz et aria, plus grands. Le modèle est encore en version bêta, et l’entreprise indique que son code source sera publié ultérieurement, sans avoir communiqué de date. Ce contexte compte, car le modèle est ici évalué sur un raisonnement exigeant des preuves, et non sur la seule apparence de sa réponse finale. [2][4]

Le score annoncé de 42/42 à l’IMO 2026

Xiaohongshu affirme que dots-note-3.0 a obtenu le score parfait de 42 points sur 42 à l’Olympiade internationale de mathématiques 2026 à Shanghai. Selon l’entreprise, le modèle a résolu les six problèmes à partir de leurs énoncés officiels et rédigé des preuves complètes en langage naturel, sans lacune logique ni condition omise. Aucune aide humaine n’a été utilisée pendant l’évaluation, et les solutions ont été soumises aux organisateurs de l’IMO pour notation. [2][4][3]

Ce score dépasse les 35/42 annoncés pour les meilleurs modèles en 2025. [2][4] Oui, ce titre attire l’attention. Mais il doit encore être confirmé de manière indépendante.

Pourquoi cette affirmation va plus loin qu’une victoire classique sur un benchmark

L’IMO ne fonctionne ni comme un QCM ni comme un benchmark à réponses courtes. Elle évalue des preuves complètes. Ce résultat porte donc sur la capacité à maintenir un raisonnement du début à la fin, et pas seulement à choisir la bonne réponse ou à aboutir à la bonne conclusion.

Les limites de vérification à garder à l’esprit

Pour l’instant, le résultat de 42/42 repose sur les données communiquées par Xiaohongshu. L’entreprise affirme avoir soumis les solutions générées par son IA aux organisateurs officiels de l’IMO pour notation, mais une évaluation externe et davantage de détails sur le processus de notation restent nécessaires avant de pouvoir vérifier pleinement cette affirmation. [3][2]

À ce stade, il est raisonnable de considérer le résultat de 42/42 comme prometteur, mais pas encore confirmé. La situation devrait s’éclaircir lorsque le code source sera publié et que des chercheurs indépendants pourront tester le modèle sur de nouveaux problèmes afin de voir si ses performances se maintiennent.

Comment dots-note-3.0 améliore le raisonnement mathématique

Comparaison des méthodes de raisonnement mathématique par IA : dots-note-3.0 face aux autres approches
Comparaison des méthodes de raisonnement mathématique par IA : dots-note-3.0 face aux autres approches

Autocritique récursive et révision avant la réponse finale

dots-note-3.0 associe le raisonnement en langage naturel à des vérifications Python pour valider les étapes intermédiaires [1]. Au lieu de s’en tenir à sa première tentative, il suit un cycle de révision répété : il teste chaque étape, repère les erreurs et réécrit la preuve avant de fournir sa réponse finale [1]. C’est la principale explication avancée pour son résultat annoncé à l’IMO.

Puisque l’IMO note des preuves complètes, dots-note-3.0 est conçu pour préserver la logique de l’ensemble du raisonnement, et pas seulement pour parvenir à la bonne réponse finale [1][2]. C’est essentiel pour les problèmes de type théorème, où une seule étape erronée peut invalider tout ce qui suit [1][2].

Les domaines mathématiques où l’autovérification récursive est la plus utile

Les gains les plus importants apparaissent dans les domaines où chaque étape doit être valable par elle-même.

Domaine mathématiqueApproche de dots-note-3.0Exemple concret
Preuves d’olympiadeVérification itérative des hypothèsesRepérer un cas limite manquant dans un problème de combinatoire avant la finalisation
Algèbre symboliqueExécution de code Python pour vérifier les étapesDétecter une erreur de signe lors du développement d’un polynôme complexe
Preuves géométriquesVérification rigoureuse des conditions géométriquesRéviser une preuve après avoir constaté qu’une propriété précise d’un triangle était supposée mais non démontrée
Calcul infinitésimalVérification des dérivations en plusieurs étapesCorriger une intégration par parties erronée en recalculant la dérivée intermédiaire

Tableau comparatif des méthodes de raisonnement

Ce tableau montre en quoi cette approche diffère des processus de raisonnement courants.

Méthode de raisonnementAtoutsLimitesTâches mathématiques les plus adaptées
Autocritique récursive (dots-note-3.0)Grande rigueur ; repère les lacunes logiques ; corrige les erreurs intermédiaires grâce à une autovérification itérativeCoût de calcul et latence plus élevés en raison des rédactions successivesPreuves de type olympiade, théorèmes complexes en plusieurs étapes, preuves géométriques
Chaîne de pensée standard (CoT)Améliore les performances sur les problèmes simples rédigés ; facile à mettre en œuvreTendance à inventer des étapes logiques ; ne peut pas se corriger si une première étape est fausseArithmétique élémentaire, problèmes simples d’algèbre rédigés
Raisonnement enrichi par des outilsGrande précision des calculs grâce à Python ; gère les manipulations symboliques complexesLa qualité du résultat de l’outil dépend de la logique ayant conduit à l’appeler ; absence d’autoévaluation logique approfondieAlgèbre symbolique, dérivations en calcul infinitésimal, calculs arithmétiques lourds
Processus de preuve formelleOffre une certitude mathématique absolue grâce à la vérification formelleNécessite une traduction vers des langages formels ; barrière d’entrée très élevéeDémonstration de théorèmes, formalisation d’exercices de manuels

Le compromis est simple : davantage de calcul et d’attente, en échange d’une meilleure protection contre les erreurs susceptibles d’invalider une preuve.

La place de dots-note-3.0 dans la recherche actuelle sur l’IA mathématique

Preuves en langage naturel et démonstration formelle de théorèmes

Cette méthode est importante parce qu’elle se situe à mi-chemin entre les preuves lisibles par l’humain et la vérification formelle par machine.

Cette distinction est utile dans la recherche actuelle sur l’IA mathématique. D’un côté se trouvent les systèmes de preuve en langage naturel, qui associent des explications écrites à des outils comme Python. De l’autre, les démonstrateurs formels de théorèmes, dans lesquels chaque étape est rédigée dans un langage tel que Lean, puis vérifiée par une machine.

dots-note-3.0 appartient à la première catégorie. Il associe un raisonnement en langage naturel à des vérifications Python. L’aspect intéressant ne réside pas seulement dans sa capacité à trouver la bonne réponse. Il transforme le raisonnement mathématique en un processus de preuve lisible et autocorrectif, au lieu de se comporter comme une boîte qui produit simplement un résultat final.

Cette différence compte. Les preuves en langage naturel sont plus faciles à suivre pour les humains. Les preuves formelles sont plus solides lorsque l’objectif est la vérification par machine. Le compromis est simple : une preuve en langage naturel peut encore dissimuler de petites lacunes logiques qu’un système formel détecterait immédiatement.

Les benchmarks importants au-delà d’un seul résultat marquant

La même distinction se retrouve dans le choix des benchmarks.

Le résultat à l’IMO est impressionnant, mais il ne s’agit que d’un benchmark. Les chercheurs suivent également GSM8K, MATH500, AIME, MathVista et GPQA, car chacun évalue une facette différente du raisonnement : profondeur, géométrie, mathématiques visuelles ou résolution de problèmes de niveau expert.

Ce qui distingue l’IMO, c’est qu’elle évalue des preuves écrites complètes. Un cas oublié ou une condition non précisée peut faire perdre de vrais points. C’est très différent des tests qui ne vérifient que la réponse finale. Pour un modèle destiné à l’arithmétique, l’algèbre, la géométrie, le calcul infinitésimal et les travaux fondés sur des preuves, l’IMO constitue donc une cible bien plus exigeante.

Tableau comparatif des modèles et des benchmarks

Le tableau ci-dessous place dots-note-3.0 aux côtés d’autres systèmes qui permettent de situer sa position dans la recherche actuelle sur l’IA mathématique.

SystèmeType de tâche principalBenchmark cléFormat de sortieAtout annoncé
dots-note-3.0Raisonnement d’olympiadeIMO 2026 (42/42) [1][2][4]Langage naturel + PythonBoucle d’autocritique agentique ; rigueur d’une preuve complète
Huawei CeliaRaisonnement d’olympiadeIMO 2026 (42/42) [3]Preuves mathématiquesCapacités mathématiques multidisciplinaires
Moonshot AI Kimi K3Raisonnement de haut niveauIMO 2026 (42/42) [3]Langage naturelA atteint le seuil du score parfait
DeepMind/OpenAI (2025)Raisonnement d’olympiadeIMO 2025 (35/42) [1][2][4]Formel + langage naturelPerformances de niveau médaille d’or

Le principal élément différenciateur n’est pas seulement le score. C’est la boucle d’autocritique qui corrige les preuves avant leur soumission. Voilà ce qui détermine la place du modèle dans les processus de recherche et de développement de produits.

Ce que cela signifie pour les chercheurs, les enseignants, les étudiants, les développeurs et les utilisateurs d’APIMart

APIMart

Cas d’usage pratiques dans l’enseignement, la recherche et les logiciels

dots-note-3.0 ne se contente pas d’afficher de meilleurs scores sur les benchmarks. Son principal atout est de vérifier et de corriger son propre raisonnement, ce qui rend les processus quotidiens plus fiables. Autrement dit, il transforme un raisonnement de niveau démonstration en un outil utilisable pour la recherche, l’enseignement et les logiciels.

Les chercheurs peuvent l’utiliser pour tester des conjectures, chercher des contre-exemples et mettre les étapes d’une preuve à l’épreuve avant leur formalisation. C’est important, car sa boucle d’autovérification vise à réduire les lacunes logiques et les conditions oubliées [2][4].

Les enseignants peuvent se servir du modèle pour créer des exemples détaillés et des corrigés. Il peut suivre une dérivation, repérer l’étape fautive et produire une solution corrigée. Les étudiants bénéficient de l’autre versant de cette même aide : un tuteur qui explique pourquoi une réponse est fausse, et pas seulement qu’elle l’est [2].

Les développeurs qui créent des produits quantitatifs ont besoin de précision et d’un formatage constant. Un processus SaaS financier peut, par exemple, utiliser le modèle pour calculer des intérêts composés ou produire des résultats numériques structurés, tout en conservant le format numérique américain, comme 1,000.25 [2].

Comment APIMart peut prendre en charge à grande échelle les processus de raisonnement mathématique

L’API unifiée d’APIMart simplifie la création de processus de raisonnement mathématique pour les équipes, sans les obliger à jongler avec des intégrations distinctes.

Pour les développeurs, le principal avantage réside dans une intégration plus simple et une planification plus claire de l’utilisation. Au lieu de maintenir plusieurs endpoints et des processus propres à chaque outil, les équipes peuvent envoyer leurs requêtes par une seule API, puis adapter les résultats au format requis par leur produit.

Tableau des effets par groupe d’utilisateurs et conclusion

Ces processus sont surtout utiles lorsque les utilisateurs ont besoin d’explications, et pas seulement de réponses. Le tableau ci-dessous montre comment ce type de raisonnement correspond aux différents groupes d’utilisateurs.

Groupe d’utilisateursCas d’usageCapacité requiseProcessus APIMart
ChercheursÉbauche de théorèmes et test de conjecturesLogique formelle et génération rigoureuse de preuvesModèle de raisonnement -> sortie JSON -> LaTeX
EnseignantsVérification des solutions et aide à la notationDiagnostic des erreurs étape par étapeSaisie de l’étudiant -> modèle de raisonnement -> commentaires
ÉtudiantsTutorat interactif et exemples détaillésExplications mathématiques en langage naturelAPI de chat -> mode de raisonnement étape par étape
DéveloppeursSaaS quantitatif et processus financiersAnalyse numérique et logique de haute précisionAPI unifiée -> JSON structuré (par ex. $1,250.00)

RedNote a annoncé son intention de publier prochainement le code source, sans avoir encore précisé les conditions applicables [2][4]. Pour les utilisateurs d’APIMart, l’intérêt tient à un raisonnement fiable, étape par étape, qui s’intègre proprement aux processus des produits.

FAQ

Comment le score de 42/42 a-t-il été vérifié ?

Le score de 42/42 a été vérifié en transmettant aux organisateurs de l’IMO les solutions complètes rédigées par dots-note-3.0 afin qu’elles soient notées par des humains, sans aucune intervention humaine pendant l’évaluation.

La note reposait sur l’exactitude et l’exhaustivité de chaque étape requise des preuves, et non sur les seules réponses numériques finales.

Que peuvent confirmer les vérifications Python dans une preuve ?

Dans dots-note-3.0, les vérifications Python permettent d’évaluer la solidité d’une preuve en testant, en remettant en question et en affinant le raisonnement provisoire du modèle.

Elles peuvent repérer des cas omis ou des conditions non énoncées susceptibles d’affaiblir une preuve écrite. Chaque étape peut ainsi être vérifiée sur le plan logique avant la soumission.

À qui dots-note-3.0 serait-il le plus utile ?

dots-note-3.0 convient surtout aux chercheurs, aux enseignants et aux développeurs qui ont besoin d’une précision rigoureuse et vérifiable pour résoudre des problèmes difficiles.

Il fournit un raisonnement fiable, étape par étape, en algèbre, géométrie, calcul infinitésimal et logique formelle. Il est donc particulièrement adapté aux travaux fondés sur des théorèmes et à l’analyse quantitative, où même de petites erreurs logiques ou des conditions implicites peuvent coûter cher.

Prêt à essayer ?

Choisissez le modèle qui vous convient dans le marketplace

Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.

Modèles chatModèles imageModèles vidéo
Explorer le marketplace