
Por dentro do dots-note-3.0: avanço da IA na matemática
Explore como o dots-note-3.0 teria alcançado uma pontuação perfeita de 42/42 na IMO usando provas em linguagem natural, verificações com Python e um fluxo iterativo de autorrevisão.
Um modelo de IA teria obtido 42/42 na IMO de 2026, mas a principal história não é apenas a pontuação. Eu resumiria assim: o dots-note-3.0 foi desenvolvido para rascunhar, verificar e revisar provas matemáticas antes de responder, enfrentando um problema difícil da IA: manter cada etapa de uma demonstração correta do início ao fim.
Se você quer a versão curta, aqui está:
- O dots-note-3.0 é um modelo voltado à matemática da RedNote/Xiaohongshu.
- Ele teria obtido 42/42, a pontuação máxima, na Olimpíada Internacional de Matemática de 2026, em Xangai.
- Em 2025, as maiores pontuações de IA divulgadas na IMO foram de 35/42, portanto isso representaria um salto de 7 pontos.
- O modelo usa raciocínio em linguagem natural e verificações com Python.
- Seu principal método é um ciclo de autorrevisão: escrever uma prova, testar as etapas, corrigir erros e então responder.
- A alegação ainda foi divulgada pela própria empresa, por isso a verificação externa continua importante.
- O artigo também analisa o que isso significa para pesquisadores, professores, estudantes, desenvolvedores e usuários de API.
O ponto mais importante é simples: os problemas da IMO avaliam provas completas, não apenas respostas finais. Isso significa que uma única etapa fraca pode comprometer tudo. Portanto, se o desempenho do dots-note-3.0 se sustentar em testes externos, ele marcaria uma transição da “IA que muitas vezes chega à resposta” para uma IA capaz de defender a resposta etapa por etapa.
Também vejo um segundo tema neste artigo: esse modelo fica entre a redação de provas em linguagem comum e a demonstração formal de teoremas. Isso facilita a leitura por pessoas, ainda que não ofereça as mesmas garantias de verificação por máquina de um sistema formal de provas.
A equipe da IMO da OpenAI explica por que os modelos finalmente estão resolvendo matemática de nível avançado

Comparação rápida
| Tópico | dots-note-3.0 |
|---|---|
| Foco principal | Raciocínio matemático baseado em provas |
| Pontuação divulgada na IMO 2026 | 42/42 |
| Maior pontuação anterior citada, de 2025 | 35/42 |
| Método central | Ciclo de autocrítica + revisão |
| Ferramentas usadas | Linguagem natural + Python |
| Principal ponto forte | Detectar lacunas antes da resposta final |
| Principal limitação | A verificação externa ainda está pendente |
| Usuários mais indicados | Pesquisadores, educadores, estudantes e desenvolvedores |
Assim, neste artigo, eu trataria a pontuação como a manchete e o fluxo de verificação de provas como a parte mais importante.
O que é o dots-note-3.0 e por que seu resultado divulgado na IMO é importante
O dots-note-3.0 é o menor modelo da família dots3 da Xiaohongshu. Ele foi desenvolvido para raciocínio matemático usando menos poder computacional do que os modelos maiores jazz e aria. O modelo ainda está em beta, e a empresa afirma que o código-fonte será disponibilizado mais adiante, embora não tenha informado uma data. Esse contexto importa porque o modelo está sendo avaliado por um raciocínio intensivo em provas, e não apenas pela boa aparência do resultado final. [2][4]
A pontuação divulgada de 42/42 na IMO 2026
A Xiaohongshu afirma que o dots-note-3.0 obteve a pontuação perfeita de 42 pontos em 42 na Olimpíada Internacional de Matemática de 2026, em Xangai. Segundo a empresa, o modelo resolveu todos os seis problemas a partir dos enunciados oficiais e escreveu provas completas em linguagem natural, sem lacunas lógicas nem condições ausentes. Não houve ajuda humana durante os testes, e as soluções foram enviadas aos organizadores da IMO para avaliação. [2][4][3]
Essa pontuação é superior aos 35/42 divulgados para os principais modelos em 2025. [2][4] Portanto, sim, a manchete chama a atenção. Mas ela ainda precisa de confirmação externa.
Por que essa alegação vai além das vitórias comuns em benchmarks
A IMO não funciona como uma prova de múltipla escolha nem como um benchmark de respostas curtas. Ela avalia provas completas. Isso significa que o resultado diz respeito a um raciocínio sustentado do início ao fim, não apenas à escolha da resposta certa ou à chegada à linha final correta.
Limites da verificação que os leitores devem considerar
Por enquanto, o resultado de 42/42 se baseia em dados divulgados pela própria Xiaohongshu. A empresa afirma que suas soluções geradas por IA foram enviadas aos organizadores oficiais da IMO para avaliação, mas ainda são necessários uma análise externa e mais detalhes sobre o processo de pontuação antes que a alegação possa ser plenamente verificada. [3][2]
Por enquanto, faz sentido considerar o resultado de 42/42 promissor, mas ainda não confirmado. O cenário deverá ficar mais claro quando o código-fonte for disponibilizado e pesquisadores externos puderem testar o modelo em novos problemas para verificar se o mesmo desempenho se mantém.
Como o dots-note-3.0 aprimora o raciocínio matemático

Autocrítica recursiva e revisão antes das respostas finais
O dots-note-3.0 combina raciocínio em linguagem natural com verificações em Python para validar etapas intermediárias [1]. Em vez de manter sua primeira tentativa, ele passa por um ciclo repetido de revisão: testa cada etapa, identifica erros e reescreve a prova antes de fornecer uma resposta final [1]. Essa é a principal razão apontada para o resultado divulgado na IMO.
Como a IMO avalia provas completas, o dots-note-3.0 foi desenvolvido para preservar a lógica de todo o argumento, e não apenas chegar à resposta final correta [1][2]. Isso é especialmente importante em problemas no formato de teoremas, nos quais uma etapa incorreta pode comprometer tudo o que vem depois [1][2].
Áreas da matemática em que a autoverificação recursiva mais ajuda
Os maiores ganhos aparecem em áreas nas quais cada etapa precisa se sustentar por si só.
| Área da matemática | Como o dots-note-3.0 a aborda | Exemplo concreto |
|---|---|---|
| Provas de olimpíadas | Autoverificação iterativa das premissas | Identificar um caso extremo ausente em um problema de combinatória antes da finalização |
| Álgebra simbólica | Execução de código Python para verificar etapas | Detectar um erro de sinal durante a expansão de um polinômio complexo |
| Provas geométricas | Verificação rigorosa das condições geométricas | Revisar uma prova após identificar que uma propriedade específica de um triângulo foi presumida, mas não demonstrada |
| Cálculo | Verificação de derivações com várias etapas | Corrigir uma etapa incorreta de integração por partes reavaliando a derivada intermediária |
Tabela comparativa de métodos de raciocínio
Esta tabela mostra como essa abordagem difere dos fluxos de raciocínio mais comuns.
| Método de raciocínio | Pontos fortes | Limitações | Tarefas matemáticas mais indicadas |
|---|---|---|---|
| Autocrítica recursiva (dots-note-3.0) | Alto rigor; identifica lacunas lógicas; recupera-se de erros intermediários por meio de autoverificação iterativa | Maior custo computacional e latência devido à elaboração iterativa | Provas no estilo de olimpíadas, teoremas complexos com várias etapas, provas geométricas |
| Chain-of-Thought (CoT) padrão | Melhora o desempenho em problemas textuais simples; fácil de implementar | Propenso a inventar etapas lógicas; não consegue se recuperar se uma etapa inicial estiver errada | Aritmética básica, problemas textuais simples de álgebra |
| Raciocínio com apoio de ferramentas | Alta precisão nos cálculos por meio de Python; lida com manipulação simbólica complexa | A saída da ferramenta depende da qualidade da lógica usada para acioná-la; não oferece autorrevisão lógica profunda | Álgebra simbólica, derivações de cálculo, aritmética intensiva |
| Fluxos de provas formais | Oferecem certeza matemática absoluta por meio da verificação formal | Exigem tradução para linguagens formais; barreira de entrada muito alta | Demonstração de teoremas, formalização de exercícios de livros didáticos |
A contrapartida é simples: mais poder computacional e mais tempo de espera em troca de uma proteção maior contra erros capazes de invalidar uma prova.
Onde o dots-note-3.0 se encaixa na pesquisa atual sobre IA para matemática
Provas em linguagem natural versus demonstração formal de teoremas
Esse método é importante porque ocupa um espaço intermediário entre provas legíveis por humanos e a verificação formal feita por máquinas.
Na pesquisa atual sobre IA para matemática, essa divisão é útil. De um lado, há sistemas de provas em linguagem natural. Eles combinam explicações escritas com ferramentas como Python. Do outro, há demonstradores formais de teoremas, nos quais cada etapa é escrita em uma linguagem como Lean e depois verificada por uma máquina.
O dots-note-3.0 pertence ao primeiro grupo. Ele usa raciocínio em linguagem natural e verificações com Python. O ponto interessante não é apenas chegar à resposta certa. É transformar o raciocínio matemático em um processo de prova legível e autocorretivo, em vez de agir como uma caixa que simplesmente produz um resultado final.
Essa diferença importa. Provas em linguagem natural são mais fáceis de acompanhar. Provas formais são mais fortes quando o objetivo é a verificação por máquina. A contrapartida é simples: provas em linguagem natural ainda podem ocultar pequenas lacunas lógicas que um sistema formal detectaria imediatamente.
Benchmarks importantes para além de um único resultado de destaque
A mesma divisão aparece na escolha dos benchmarks.
O resultado na IMO é forte, mas representa apenas um benchmark. Pesquisadores também acompanham GSM8K, MATH500, AIME, MathVista e GPQA, porque cada um testa uma dimensão diferente do raciocínio, seja profundidade, geometria, matemática visual ou resolução de problemas em nível especializado.
O diferencial da IMO é que ela avalia provas escritas completas. Um caso ignorado ou uma condição não declarada pode custar pontos reais. Isso é muito diferente de testes que verificam apenas a resposta final. Para um modelo voltado a aritmética, álgebra, geometria, cálculo e trabalhos baseados em provas, a IMO se torna um alvo muito mais difícil.
Tabela comparativa de modelos e benchmarks
A tabela abaixo posiciona o dots-note-3.0 ao lado de outros sistemas que ajudam a mostrar sua situação na pesquisa atual sobre IA para matemática.
| Sistema | Tipo principal de tarefa | Benchmark principal | Estilo de saída | Ponto forte divulgado |
|---|---|---|---|---|
| dots-note-3.0 | Raciocínio de olimpíada | IMO 2026 (42/42) [1][2][4] | Linguagem natural + Python | Ciclo agêntico de autocrítica; rigor de prova completa |
| Huawei Celia | Raciocínio de olimpíada | IMO 2026 (42/42) [3] | Provas matemáticas | Capacidades matemáticas em várias áreas |
| Moonshot AI Kimi K3 | Raciocínio avançado | IMO 2026 (42/42) [3] | Linguagem natural | Atingiu o patamar de pontuação perfeita |
| DeepMind/OpenAI (2025) | Raciocínio de olimpíada | IMO 2025 (35/42) [1][2][4] | Formal + linguagem natural | Desempenho no nível de medalha de ouro |
O principal diferencial não é apenas a pontuação. É o ciclo de autocrítica que corrige as provas antes do envio. Essa é a parte que define como o modelo se encaixa nos fluxos de pesquisa e de produtos.
O que isso significa para pesquisadores, educadores, estudantes, desenvolvedores e usuários da APIMart

Casos de uso práticos em educação, pesquisa e produtos de software
O dots-note-3.0 não apresenta apenas pontuações melhores em benchmarks. Seu maior ponto forte é verificar e revisar o próprio raciocínio, o que torna os fluxos cotidianos mais confiáveis. Em termos simples, ele transforma o raciocínio em nível de prova em algo que as pessoas podem usar em pesquisa, ensino e software.
Pesquisadores podem usá-lo para testar conjecturas, procurar contraexemplos e submeter etapas de provas a testes rigorosos antes da formalização. Isso importa porque seu ciclo de autoverificação foi desenvolvido para reduzir lacunas lógicas e condições ignoradas [2][4].
Educadores podem usar o modelo para criar exemplos resolvidos e gabaritos. Ele consegue acompanhar uma derivação, identificar a etapa incorreta e produzir uma solução corrigida. Os estudantes recebem o outro lado dessa mesma ajuda: um tutor que explica por que uma resposta está errada, em vez de apenas apontar o erro [2].
Desenvolvedores que criam produtos quantitativos precisam de precisão e formatação consistente. Um fluxo de SaaS financeiro, por exemplo, pode usar o modelo para calcular juros compostos ou retornar resultados numéricos estruturados, mantendo a formatação numérica dos EUA, como 1,000.25 [2].
Como a APIMart pode oferecer suporte em escala a fluxos de raciocínio matemático
A API unificada da APIMart simplifica a criação de fluxos de raciocínio matemático para as equipes, sem a necessidade de administrar integrações separadas.
Para desenvolvedores, as principais vantagens são uma integração mais simples e um planejamento de uso mais claro. Em vez de manter vários endpoints e fluxos específicos para cada ferramenta, as equipes podem enviar solicitações por uma única API e então adaptar a saída ao formato exigido pelo produto.
Tabela de relação com o impacto nos usuários e conclusão
Esses fluxos são mais relevantes quando as pessoas precisam de explicações, não apenas de respostas. A tabela abaixo mostra como esse estilo de raciocínio se alinha a diferentes grupos de usuários.
| Grupo de usuários | Caso de uso | Capacidade necessária | Fluxo da APIMart |
|---|---|---|---|
| Pesquisadores | Esboço de teoremas e teste de conjecturas | Lógica formal e geração rigorosa de provas | Modelo de raciocínio -> saída JSON -> LaTeX |
| Educadores | Verificação de soluções e apoio à avaliação | Diagnóstico de erros etapa por etapa | Entrada do estudante -> modelo de raciocínio -> feedback |
| Estudantes | Tutoria interativa e exemplos resolvidos | Explicações matemáticas em linguagem natural | API de chat -> modo de raciocínio etapa por etapa |
| Desenvolvedores | SaaS quantitativo e fluxos financeiros | Análise numérica e lógica de alta precisão | API unificada -> JSON estruturado (por exemplo, $1,250.00) |
A RedNote anunciou planos de disponibilizar o código-fonte em breve, embora os termos específicos ainda não tenham sido divulgados [2][4]. Para usuários da APIMart, o atrativo é um raciocínio confiável, etapa por etapa, que se encaixa facilmente nos fluxos dos produtos.
Perguntas frequentes
Como a pontuação de 42/42 foi verificada?
A pontuação de 42/42 foi verificada por meio do envio das soluções completas do dots-note-3.0 para a IMO aos organizadores da competição, que fizeram uma avaliação humana, sem nenhuma intervenção humana durante os testes.
A pontuação se baseou na correção e na completude de cada etapa exigida da prova, e não apenas nas respostas numéricas finais.
O que as verificações com Python podem confirmar em uma prova?
No dots-note-3.0, as verificações com Python ajudam a avaliar a solidez de uma prova ao testar, questionar e aperfeiçoar o raciocínio preliminar do modelo.
Elas podem identificar casos ignorados ou condições não declaradas que enfraqueceriam uma prova escrita. Assim, cada etapa pode ter sua consistência lógica verificada antes do envio.
Quem mais se beneficiaria do dots-note-3.0?
O dots-note-3.0 é mais indicado para pesquisadores, educadores e desenvolvedores que precisam de precisão rigorosa e verificável ao trabalhar com problemas difíceis.
Ele oferece raciocínio confiável e passo a passo em álgebra, geometria, cálculo e lógica formal. Isso o torna uma ótima opção para trabalhos baseados em teoremas e análises quantitativas, nos quais até pequenos erros lógicos ou condições não declaradas podem ter consequências caras.
Escolha o modelo que você quer no marketplace
Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.