APIMart
dots-note-3.0 alcança pontuação perfeita na IMO

dots-note-3.0 alcança pontuação perfeita na IMO

O dots-note-3.0 da Xiaohongshu teria obtido 42/42 na IMO de 2026. Veja como seu fluxo de escrita de provas usa autoverificação e validação com Python.

Insights de Modelos

Um modelo de IA obteve a pontuação perfeita de 42/42 na IMO de 2026, com avaliação humana oficial. Isso significa que o dots-note-3.0 da Xiaohongshu não acertou apenas as respostas finais: ele escreveu seis provas completas que foram aceitas pelos avaliadores.

Aqui está a versão resumida:

  • Data: julho de 2026
  • Evento: Olimpíada Internacional de Matemática em Xangai
  • Pontuação: 42 de 42
  • Comparação com humanos: apenas 7 de 666 estudantes também obtiveram a pontuação perfeita
  • O que mudou: o melhor resultado anterior de uma IA era de 35/42 em 2025
  • Por que isso desperta interesse: a IMO testa a escrita de provas longas e detalhadas, não a adivinhação de respostas

Em termos simples: esse resultado mostra que a escrita de provas por IA atingiu um novo patamar em um teste muito difícil. Isso não significa que a IA seja infalível no uso cotidiano. Os problemas da IMO são claros e estruturados. As tarefas comuns muitas vezes não são.

O que mais me chama a atenção é o fluxo de trabalho do modelo. Ele leu LaTeX bruto, construiu provas em álgebra, geometria, combinatória e teoria dos números e usou um ciclo de autoverificação com raciocínio textual e verificações em Python antes do envio. Isso importa porque o mesmo tipo de controle por etapas pode ajudar em sistemas nos quais a saída de um modelo alimenta outro.

Portanto, em linguagem simples, a conclusão é esta: o dots-note-3.0 alcançou uma pontuação rara em uma competição de matemática, e a história mais importante é a qualidade das provas, não apenas a habilidade matemática.

dots-note-3.0 na IMO 2026: IA alcança pontuação perfeita - principais números em resumo
dots-note-3.0 na IMO 2026: IA alcança pontuação perfeita - principais números em resumo

Pela primeira vez, um modelo de IA obteve 100% na Olimpíada Internacional de Matemática

Olimpíada Internacional de Matemática

O benchmark da IMO e o resultado oficial do dots-note-3.0

dots-note-3.0

A IMO é uma competição de provas matemáticas com duração de dois dias e seis problemas, voltada a estudantes com menos de 20 anos. Cada problema vale 7 pontos, portanto a pontuação máxima é 42. E essa não é uma competição na qual o número final correto garante a nota máxima. Para obter uma boa pontuação, os participantes precisam apresentar provas completas e logicamente sólidas. A pontuação parcial depende do grau de completude da prova.[5][3]

Em julho de 2026, a IMO aconteceu em Xangai, com 666 participantes de 117 países. Depois do término da competição humana, a Xiaohongshu executou o dots-note-3.0 seguindo as regras oficiais de avaliação, sem intervenção humana, e enviou suas soluções para a correção oficial. O modelo recebeu 7 de 7 em todos os seis problemas, totalizando a pontuação perfeita de 42 de 42.[1][2][4]

Esse detalhe importa. Uma pontuação perfeita na IMO não significa que o participante acertou as respostas por sorte ou reconhecimento de padrões. Significa que o trabalho enviado se sustentou como um raciocínio completo e baseado em provas, do início ao fim.

Como se obtém a pontuação perfeita de 42 em 42

Uma pontuação perfeita de 42/42 exige que todas as provas estejam completas. Nenhuma etapa ausente. Nenhuma lacuna lógica. Nenhuma condição ignorada. Os avaliadores da IMO julgam a qualidade do raciocínio em si, não apenas seu resultado final.[5][3]

Em resumo, o nível de exigência é alto. É preciso manter uma cadeia lógica clara nos seis problemas e apresentá-la de uma forma que resista à análise oficial.

Por que esse resultado é historicamente significativo

Este é o primeiro grande modelo de linguagem a receber uma pontuação perfeita sob a avaliação oficial da IMO.[1][4]

Quais capacidades o dots-note-3.0 precisou demonstrar

Para obter 42/42, o dots-note-3.0 precisou fazer mais do que chegar à resposta correta. Ele teve de ler enunciados em LaTeX bruto, escolher um caminho para a demonstração e então escrever uma prova completa que pudesse ser verificada por avaliadores humanos dentro do limite de tempo da competição. [1] Portanto, o formato da entrada e a qualidade da prova foram tão importantes quanto o resultado final.

Leitura de problemas em LaTeX e escrita de provas completas

O dots-note-3.0 trabalhou diretamente com enunciados em LaTeX bruto e produziu provas completas e legíveis por humanos para avaliação oficial. [1] Esse salto, do enunciado bruto à prova verificada, é onde um raciocínio mais profundo começa a se manifestar.

Raciocínio em várias etapas na álgebra, geometria, combinatória e teoria dos números

Resolver os seis problemas da IMO exige demonstrar uma ampla capacidade de raciocínio em álgebra, geometria, combinatória e teoria dos números. [1][2] Em termos simples, isso significa construir argumentos geométricos, demonstrar fatos sobre números inteiros, explorar divisões de casos combinatórios e conectar lemas intermediários em uma única linha de raciocínio válida.

Alguns problemas de 2026 também usaram enunciados narrativos, de modo que o modelo precisou separar a história e chegar à matemática subjacente. [1]

Exemplos de tarefas que esse nível de raciocínio consegue resolver

Veja como esse nível de raciocínio se apresenta na prática:

ÁreaExemplo de tarefa
GeometriaConstruir argumentos geométricos a partir de uma configuração fornecida
Teoria dos númerosDemonstrar propriedades dos números inteiros
CombinatóriaExaminar divisões de casos para contar ou descartar arranjos válidos
ÁlgebraEncadear identidades e lemas para chegar à única conclusão válida

O modelo também precisou mostrar por que a conclusão necessariamente era verdadeira em um formato que atendesse aos padrões oficiais de avaliação da IMO. [1][2] Essas mesmas habilidades de demonstração são um dos principais motivos pelos quais esse resultado é importante para a pesquisa mais ampla sobre raciocínio em IA.

Por que esse resultado é importante para a pesquisa sobre raciocínio em IA

A IMO é especialmente difícil para a IA porque não é uma prova de múltipla escolha. Os participantes precisam escrever demonstrações completas e detalhadas, e até um único caso ignorado ou uma condição omitida pode custar pontos. Portanto, esse benchmark testa a validade da prova de ponta a ponta, não apenas se a resposta final parece correta.

Isso é muito relevante. Benchmarks que avaliam somente a resposta podem ocultar um raciocínio fraco quando o modelo chega ao resultado certo pelo motivo errado. A IMO não permite que isso passe. Ela verifica se o modelo consegue manter a lógica coesa do início ao fim.

O que isso revela sobre a precisão do raciocínio avançado

Uma pontuação perfeita de 42/42 sugere que o modelo conseguiu planejar uma prova, verificar as próprias etapas intermediárias e concluir cada argumento sem romper a cadeia lógica. Em linguagem simples: isso indica uma autoverificação mais forte ao longo de provas extensas.

O salto também se destaca quando visto em contexto. Em 2025, os melhores sistemas alcançaram 35/42, portanto 42/42 representa um avanço claro na completude das provas [3].

A questão mais difícil é até que ponto esse raciocínio se aplica fora da matemática competitiva.

Por que os limites dos benchmarks ainda importam

Uma pontuação perfeita na IMO ainda não comprova uma confiabilidade ampla em situações cotidianas desorganizadas. Os problemas de competições são estruturados. Entradas do mundo real muitas vezes não são. Elas podem conter ruído, ser vagas ou não incluir detalhes essenciais [6].

Portanto, o resultado é uma evidência forte de raciocínio matemático avançado. Mas não deve ser interpretado como uma promessa de compreensão para qualquer finalidade.

Essa mesma consistência é o que torna o raciocínio avançado útil em fluxos multimodais e orientados por API.

Como o raciocínio de nível da IMO pode ser aplicado a soluções multimodais e orientadas por API

Onde um raciocínio sólido ajuda em fluxos reais

Esse nível de consistência é mais importante quando o raciocínio representa apenas uma parte de um pipeline maior. Em produção, uma única restrição ignorada pode comprometer todo o resultado. Um assistente de pesquisa, uma ferramenta de tutoria ou um agente de programação enfrentam a mesma tarefa: manter todas as restrições do início ao fim.

É aí que um ciclo de autoverificação ajuda. Ele pode detectar pequenos erros logo no início, antes que se acumulem e causem falhas maiores.

Como usar a APIMart para combinar raciocínio com modelos de vídeo, imagem e linguagem

APIMart

Em pipelines multimodais, um modelo de raciocínio pode verificar a entrada antes que ela chegue a um gerador de vídeo ou imagem. A mesma ideia funciona quando o raciocínio precisa atuar como uma barreira de controle antes do início da geração de mídia.

A APIMart permite que as equipes combinem modelos de raciocínio, imagem, vídeo e linguagem por meio de uma única API. Assim, elas podem validar as entradas primeiro e depois enviá-las a um modelo de vídeo.

No uso cotidiano, a precisão do raciocínio se torna uma camada de confiabilidade para pipelines multimodais. É por isso que o raciocínio no nível da IMO importa para além da matemática: ele ajuda a verificar, direcionar e usar sistemas multimodais com mais confiança.

Conclusão: um marco de raciocínio verificado com aprendizados práticos

O dots-note-3.0 obteve a pontuação perfeita de 42 em 42 na Olimpíada Internacional de Matemática (IMO) de 2026. Esta é a primeira vez que um modelo de IA alcança essa marca sob avaliação humana oficial, na qual avaliadores leem e pontuam cada linha de todas as provas [1][7].

O modelo escreveu provas completas para todo o conjunto de problemas da IMO, sem ajuda humana. Ele usou um ciclo iterativo com raciocínio textual e verificações em Python para testar, revisar e aperfeiçoar as próprias provas antes do envio final [7]. O ponto que mais se destaca é este: o modelo conseguiu verificar o próprio trabalho e corrigir erros ao longo do processo.

Para usuários da APIMart que desenvolvem fluxos multimodais, essa é a principal lição. A escrita de provas no nível da IMO não significa confiabilidade perfeita em todos os casos de uso. Mas indica algo importante: o raciocínio verificável está cada vez mais próximo de se tornar um recurso no qual as equipes podem confiar em fluxos de produção.

Em termos simples, o raciocínio com autoverificação pode aumentar a confiança nos fluxos da APIMart que reúnem modelos de linguagem, imagem e vídeo.

Perguntas frequentes

Por que uma pontuação perfeita na IMO é tão importante para a IA?

Uma pontuação perfeita na Olimpíada Internacional de Matemática (IMO) importa porque indica algo maior do que o reconhecimento de padrões. A IMO não pede apenas respostas. Ela exige provas matemáticas completas.

Portanto, quando um modelo obtém 42 de 42, não se trata de uma conquista pequena. Isso significa que o modelo consegue construir argumentos longos e detalhados e mantê-los íntegros do início ao fim, sem erros lógicos, condições ausentes ou afirmações sem fundamento.

Esse nível de precisão é importante quando o raciocínio precisa acontecer ao longo de muitas etapas, e não em um único salto.

Isso significa que o dots-note-3.0 é confiável fora das competições de matemática?

Uma pontuação perfeita na Olimpíada Internacional de Matemática indica um raciocínio lógico sólido e sem erros. Porém, ela não garante confiabilidade em todas as situações do mundo real.

A IMO testa um tipo específico de raciocínio matemático sob condições rigorosas. O dots-note-3.0 ainda deve ser avaliado com suas cargas de trabalho, seus critérios e seus padrões de tráfego reais antes de uma implantação completa.

Como o raciocínio de nível da IMO pode ajudar fluxos reais de IA?

O raciocínio de nível da IMO ajuda em fluxos reais de IA porque leva o modelo a resolver problemas difíceis etapa por etapa, em vez de simplesmente produzir uma resposta no final. Isso é muito importante na matemática com várias etapas, em que um pequeno erro no início pode comprometer tudo o que vem depois.

Ele também facilita a verificação do trabalho durante o processo. Em vez de tratar o resultado como uma caixa-preta, você pode inspecionar cada etapa, identificar pontos frágeis e detectar erros de prova ou de lógica antes que se propaguem.

No uso cotidiano, isso pode significar menos falhas em sistemas que usam ferramentas, maior precisão quando o modelo precisa respeitar restrições rigorosas e um suporte melhor a aplicações multimodais avançadas ou orientadas por API que dependem de uma consistência lógica estável.

Pronto para testar?

Escolha o modelo que você quer no marketplace

Teste modelos de chat, imagem e vídeo no marketplace da APIMart e experimente rapidamente as capacidades dos modelos com uma API unificada.

Modelos de chatModelos de imagemModelos de vídeo
Explorar marketplace