APIMart
Por dentro do dots-note-3.0: avanço da IA na matemática

Por dentro do dots-note-3.0: avanço da IA na matemática

Explore como o dots-note-3.0 teria alcançado uma pontuação perfeita de 42/42 na IMO usando provas em linguagem natural, verificações com Python e um fluxo iterativo de autorrevisão.

Insights de Modelos

Um modelo de IA teria obtido 42/42 na IMO de 2026, mas a principal história não é apenas a pontuação. Eu resumiria assim: o dots-note-3.0 foi desenvolvido para rascunhar, verificar e revisar provas matemáticas antes de responder, enfrentando um problema difícil da IA: manter cada etapa de uma demonstração correta do início ao fim.

Se você quer a versão curta, aqui está:

  • O dots-note-3.0 é um modelo voltado à matemática da RedNote/Xiaohongshu.
  • Ele teria obtido 42/42, a pontuação máxima, na Olimpíada Internacional de Matemática de 2026, em Xangai.
  • Em 2025, as maiores pontuações de IA divulgadas na IMO foram de 35/42, portanto isso representaria um salto de 7 pontos.
  • O modelo usa raciocínio em linguagem natural e verificações com Python.
  • Seu principal método é um ciclo de autorrevisão: escrever uma prova, testar as etapas, corrigir erros e então responder.
  • A alegação ainda foi divulgada pela própria empresa, por isso a verificação externa continua importante.
  • O artigo também analisa o que isso significa para pesquisadores, professores, estudantes, desenvolvedores e usuários de API.

O ponto mais importante é simples: os problemas da IMO avaliam provas completas, não apenas respostas finais. Isso significa que uma única etapa fraca pode comprometer tudo. Portanto, se o desempenho do dots-note-3.0 se sustentar em testes externos, ele marcaria uma transição da “IA que muitas vezes chega à resposta” para uma IA capaz de defender a resposta etapa por etapa.

Também vejo um segundo tema neste artigo: esse modelo fica entre a redação de provas em linguagem comum e a demonstração formal de teoremas. Isso facilita a leitura por pessoas, ainda que não ofereça as mesmas garantias de verificação por máquina de um sistema formal de provas.

A equipe da IMO da OpenAI explica por que os modelos finalmente estão resolvendo matemática de nível avançado

OpenAI

Comparação rápida

Tópicodots-note-3.0
Foco principalRaciocínio matemático baseado em provas
Pontuação divulgada na IMO 202642/42
Maior pontuação anterior citada, de 202535/42
Método centralCiclo de autocrítica + revisão
Ferramentas usadasLinguagem natural + Python
Principal ponto forteDetectar lacunas antes da resposta final
Principal limitaçãoA verificação externa ainda está pendente
Usuários mais indicadosPesquisadores, educadores, estudantes e desenvolvedores

Assim, neste artigo, eu trataria a pontuação como a manchete e o fluxo de verificação de provas como a parte mais importante.

O que é o dots-note-3.0 e por que seu resultado divulgado na IMO é importante

O dots-note-3.0 é o menor modelo da família dots3 da Xiaohongshu. Ele foi desenvolvido para raciocínio matemático usando menos poder computacional do que os modelos maiores jazz e aria. O modelo ainda está em beta, e a empresa afirma que o código-fonte será disponibilizado mais adiante, embora não tenha informado uma data. Esse contexto importa porque o modelo está sendo avaliado por um raciocínio intensivo em provas, e não apenas pela boa aparência do resultado final. [2][4]

A pontuação divulgada de 42/42 na IMO 2026

A Xiaohongshu afirma que o dots-note-3.0 obteve a pontuação perfeita de 42 pontos em 42 na Olimpíada Internacional de Matemática de 2026, em Xangai. Segundo a empresa, o modelo resolveu todos os seis problemas a partir dos enunciados oficiais e escreveu provas completas em linguagem natural, sem lacunas lógicas nem condições ausentes. Não houve ajuda humana durante os testes, e as soluções foram enviadas aos organizadores da IMO para avaliação. [2][4][3]

Essa pontuação é superior aos 35/42 divulgados para os principais modelos em 2025. [2][4] Portanto, sim, a manchete chama a atenção. Mas ela ainda precisa de confirmação externa.

Por que essa alegação vai além das vitórias comuns em benchmarks

A IMO não funciona como uma prova de múltipla escolha nem como um benchmark de respostas curtas. Ela avalia provas completas. Isso significa que o resultado diz respeito a um raciocínio sustentado do início ao fim, não apenas à escolha da resposta certa ou à chegada à linha final correta.

Limites da verificação que os leitores devem considerar

Por enquanto, o resultado de 42/42 se baseia em dados divulgados pela própria Xiaohongshu. A empresa afirma que suas soluções geradas por IA foram enviadas aos organizadores oficiais da IMO para avaliação, mas ainda são necessários uma análise externa e mais detalhes sobre o processo de pontuação antes que a alegação possa ser plenamente verificada. [3][2]

Por enquanto, faz sentido considerar o resultado de 42/42 promissor, mas ainda não confirmado. O cenário deverá ficar mais claro quando o código-fonte for disponibilizado e pesquisadores externos puderem testar o modelo em novos problemas para verificar se o mesmo desempenho se mantém.

Como o dots-note-3.0 aprimora o raciocínio matemático

Comparação de métodos de raciocínio matemático com IA: dots-note-3.0 versus outras abordagens
Comparação de métodos de raciocínio matemático com IA: dots-note-3.0 versus outras abordagens

Autocrítica recursiva e revisão antes das respostas finais

O dots-note-3.0 combina raciocínio em linguagem natural com verificações em Python para validar etapas intermediárias [1]. Em vez de manter sua primeira tentativa, ele passa por um ciclo repetido de revisão: testa cada etapa, identifica erros e reescreve a prova antes de fornecer uma resposta final [1]. Essa é a principal razão apontada para o resultado divulgado na IMO.

Como a IMO avalia provas completas, o dots-note-3.0 foi desenvolvido para preservar a lógica de todo o argumento, e não apenas chegar à resposta final correta [1][2]. Isso é especialmente importante em problemas no formato de teoremas, nos quais uma etapa incorreta pode comprometer tudo o que vem depois [1][2].

Áreas da matemática em que a autoverificação recursiva mais ajuda

Os maiores ganhos aparecem em áreas nas quais cada etapa precisa se sustentar por si só.

Área da matemáticaComo o dots-note-3.0 a abordaExemplo concreto
Provas de olimpíadasAutoverificação iterativa das premissasIdentificar um caso extremo ausente em um problema de combinatória antes da finalização
Álgebra simbólicaExecução de código Python para verificar etapasDetectar um erro de sinal durante a expansão de um polinômio complexo
Provas geométricasVerificação rigorosa das condições geométricasRevisar uma prova após identificar que uma propriedade específica de um triângulo foi presumida, mas não demonstrada
CálculoVerificação de derivações com várias etapasCorrigir uma etapa incorreta de integração por partes reavaliando a derivada intermediária

Tabela comparativa de métodos de raciocínio

Esta tabela mostra como essa abordagem difere dos fluxos de raciocínio mais comuns.

Método de raciocínioPontos fortesLimitaçõesTarefas matemáticas mais indicadas
Autocrítica recursiva (dots-note-3.0)Alto rigor; identifica lacunas lógicas; recupera-se de erros intermediários por meio de autoverificação iterativaMaior custo computacional e latência devido à elaboração iterativaProvas no estilo de olimpíadas, teoremas complexos com várias etapas, provas geométricas
Chain-of-Thought (CoT) padrãoMelhora o desempenho em problemas textuais simples; fácil de implementarPropenso a inventar etapas lógicas; não consegue se recuperar se uma etapa inicial estiver erradaAritmética básica, problemas textuais simples de álgebra
Raciocínio com apoio de ferramentasAlta precisão nos cálculos por meio de Python; lida com manipulação simbólica complexaA saída da ferramenta depende da qualidade da lógica usada para acioná-la; não oferece autorrevisão lógica profundaÁlgebra simbólica, derivações de cálculo, aritmética intensiva
Fluxos de provas formaisOferecem certeza matemática absoluta por meio da verificação formalExigem tradução para linguagens formais; barreira de entrada muito altaDemonstração de teoremas, formalização de exercícios de livros didáticos

A contrapartida é simples: mais poder computacional e mais tempo de espera em troca de uma proteção maior contra erros capazes de invalidar uma prova.

Onde o dots-note-3.0 se encaixa na pesquisa atual sobre IA para matemática

Provas em linguagem natural versus demonstração formal de teoremas

Esse método é importante porque ocupa um espaço intermediário entre provas legíveis por humanos e a verificação formal feita por máquinas.

Na pesquisa atual sobre IA para matemática, essa divisão é útil. De um lado, há sistemas de provas em linguagem natural. Eles combinam explicações escritas com ferramentas como Python. Do outro, há demonstradores formais de teoremas, nos quais cada etapa é escrita em uma linguagem como Lean e depois verificada por uma máquina.

O dots-note-3.0 pertence ao primeiro grupo. Ele usa raciocínio em linguagem natural e verificações com Python. O ponto interessante não é apenas chegar à resposta certa. É transformar o raciocínio matemático em um processo de prova legível e autocorretivo, em vez de agir como uma caixa que simplesmente produz um resultado final.

Essa diferença importa. Provas em linguagem natural são mais fáceis de acompanhar. Provas formais são mais fortes quando o objetivo é a verificação por máquina. A contrapartida é simples: provas em linguagem natural ainda podem ocultar pequenas lacunas lógicas que um sistema formal detectaria imediatamente.

Benchmarks importantes para além de um único resultado de destaque

A mesma divisão aparece na escolha dos benchmarks.

O resultado na IMO é forte, mas representa apenas um benchmark. Pesquisadores também acompanham GSM8K, MATH500, AIME, MathVista e GPQA, porque cada um testa uma dimensão diferente do raciocínio, seja profundidade, geometria, matemática visual ou resolução de problemas em nível especializado.

O diferencial da IMO é que ela avalia provas escritas completas. Um caso ignorado ou uma condição não declarada pode custar pontos reais. Isso é muito diferente de testes que verificam apenas a resposta final. Para um modelo voltado a aritmética, álgebra, geometria, cálculo e trabalhos baseados em provas, a IMO se torna um alvo muito mais difícil.

Tabela comparativa de modelos e benchmarks

A tabela abaixo posiciona o dots-note-3.0 ao lado de outros sistemas que ajudam a mostrar sua situação na pesquisa atual sobre IA para matemática.

SistemaTipo principal de tarefaBenchmark principalEstilo de saídaPonto forte divulgado
dots-note-3.0Raciocínio de olimpíadaIMO 2026 (42/42) [1][2][4]Linguagem natural + PythonCiclo agêntico de autocrítica; rigor de prova completa
Huawei CeliaRaciocínio de olimpíadaIMO 2026 (42/42) [3]Provas matemáticasCapacidades matemáticas em várias áreas
Moonshot AI Kimi K3Raciocínio avançadoIMO 2026 (42/42) [3]Linguagem naturalAtingiu o patamar de pontuação perfeita
DeepMind/OpenAI (2025)Raciocínio de olimpíadaIMO 2025 (35/42) [1][2][4]Formal + linguagem naturalDesempenho no nível de medalha de ouro

O principal diferencial não é apenas a pontuação. É o ciclo de autocrítica que corrige as provas antes do envio. Essa é a parte que define como o modelo se encaixa nos fluxos de pesquisa e de produtos.

O que isso significa para pesquisadores, educadores, estudantes, desenvolvedores e usuários da APIMart

APIMart

Casos de uso práticos em educação, pesquisa e produtos de software

O dots-note-3.0 não apresenta apenas pontuações melhores em benchmarks. Seu maior ponto forte é verificar e revisar o próprio raciocínio, o que torna os fluxos cotidianos mais confiáveis. Em termos simples, ele transforma o raciocínio em nível de prova em algo que as pessoas podem usar em pesquisa, ensino e software.

Pesquisadores podem usá-lo para testar conjecturas, procurar contraexemplos e submeter etapas de provas a testes rigorosos antes da formalização. Isso importa porque seu ciclo de autoverificação foi desenvolvido para reduzir lacunas lógicas e condições ignoradas [2][4].

Educadores podem usar o modelo para criar exemplos resolvidos e gabaritos. Ele consegue acompanhar uma derivação, identificar a etapa incorreta e produzir uma solução corrigida. Os estudantes recebem o outro lado dessa mesma ajuda: um tutor que explica por que uma resposta está errada, em vez de apenas apontar o erro [2].

Desenvolvedores que criam produtos quantitativos precisam de precisão e formatação consistente. Um fluxo de SaaS financeiro, por exemplo, pode usar o modelo para calcular juros compostos ou retornar resultados numéricos estruturados, mantendo a formatação numérica dos EUA, como 1,000.25 [2].

Como a APIMart pode oferecer suporte em escala a fluxos de raciocínio matemático

A API unificada da APIMart simplifica a criação de fluxos de raciocínio matemático para as equipes, sem a necessidade de administrar integrações separadas.

Para desenvolvedores, as principais vantagens são uma integração mais simples e um planejamento de uso mais claro. Em vez de manter vários endpoints e fluxos específicos para cada ferramenta, as equipes podem enviar solicitações por uma única API e então adaptar a saída ao formato exigido pelo produto.

Tabela de relação com o impacto nos usuários e conclusão

Esses fluxos são mais relevantes quando as pessoas precisam de explicações, não apenas de respostas. A tabela abaixo mostra como esse estilo de raciocínio se alinha a diferentes grupos de usuários.

Grupo de usuáriosCaso de usoCapacidade necessáriaFluxo da APIMart
PesquisadoresEsboço de teoremas e teste de conjecturasLógica formal e geração rigorosa de provasModelo de raciocínio -> saída JSON -> LaTeX
EducadoresVerificação de soluções e apoio à avaliaçãoDiagnóstico de erros etapa por etapaEntrada do estudante -> modelo de raciocínio -> feedback
EstudantesTutoria interativa e exemplos resolvidosExplicações matemáticas em linguagem naturalAPI de chat -> modo de raciocínio etapa por etapa
DesenvolvedoresSaaS quantitativo e fluxos financeirosAnálise numérica e lógica de alta precisãoAPI unificada -> JSON estruturado (por exemplo, $1,250.00)

A RedNote anunciou planos de disponibilizar o código-fonte em breve, embora os termos específicos ainda não tenham sido divulgados [2][4]. Para usuários da APIMart, o atrativo é um raciocínio confiável, etapa por etapa, que se encaixa facilmente nos fluxos dos produtos.

Perguntas frequentes

Como a pontuação de 42/42 foi verificada?

A pontuação de 42/42 foi verificada por meio do envio das soluções completas do dots-note-3.0 para a IMO aos organizadores da competição, que fizeram uma avaliação humana, sem nenhuma intervenção humana durante os testes.

A pontuação se baseou na correção e na completude de cada etapa exigida da prova, e não apenas nas respostas numéricas finais.

O que as verificações com Python podem confirmar em uma prova?

No dots-note-3.0, as verificações com Python ajudam a avaliar a solidez de uma prova ao testar, questionar e aperfeiçoar o raciocínio preliminar do modelo.

Elas podem identificar casos ignorados ou condições não declaradas que enfraqueceriam uma prova escrita. Assim, cada etapa pode ter sua consistência lógica verificada antes do envio.

Quem mais se beneficiaria do dots-note-3.0?

O dots-note-3.0 é mais indicado para pesquisadores, educadores e desenvolvedores que precisam de precisão rigorosa e verificável ao trabalhar com problemas difíceis.

Ele oferece raciocínio confiável e passo a passo em álgebra, geometria, cálculo e lógica formal. Isso o torna uma ótima opção para trabalhos baseados em teoremas e análises quantitativas, nos quais até pequenos erros lógicos ou condições não declaradas podem ter consequências caras.

Pronto para testar?

Escolha o modelo que você quer no marketplace

Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.

Modelos de chatModelos de imagemModelos de vídeo
Explorar marketplace