APIMart
dots-note-3.0 获得 IMO 满分

dots-note-3.0 获得 IMO 满分

据称,小红书的 dots-note-3.0 在 2026 年 IMO 中取得了 42/42。了解其证明写作工作流如何运用自检和 Python 验证。

模型解读

一款 AI 模型在官方人工评分下取得了 2026 年 IMO 的 42/42 满分。 这意味着小红书的 dots-note-3.0 不只是最终答案正确,它还写出了六份获得评分者认可的完整证明。

以下是简要版本:

  • 日期: 2026 年七月
  • 赛事: 在上海举行的国际数学奥林匹克竞赛
  • 成绩: 42 分中的 42 分
  • 与人类选手对比: 666 名学生中也只有 7 人取得满分
  • 发生了什么变化: 此前 AI 的最高成绩是 2025 年的 35/42
  • 人们为何关注: IMO 考查的是长篇、逐步的证明写作,而不是猜答案

简单来说,这一结果表明,AI 证明写作在一项极其困难的测试中迈上了新台阶。这并不意味着 AI 在日常使用中毫无瑕疵。 IMO 题目清晰且结构严谨,普通任务往往并非如此。

最令我关注的是该模型的工作流。它读取原始 LaTeX,在代数、几何、组合数学和数论领域构建证明,并在提交前使用结合文本推理与 Python 检查的自检循环。这一点很重要,因为当一个模型的输出被传递给另一个模型时,同样的步骤控制能力也能为系统提供帮助。

所以,如果你想要一个直白易懂的结论,那就是:dots-note-3.0 取得了罕见的数学竞赛高分,而更重要的故事是证明质量,不只是数学能力。

dots-note-3.0 IMO 2026:AI 取得满分——关键数据一览
dots-note-3.0 IMO 2026:AI 取得满分——关键数据一览

AI 模型首次在国际数学奥林匹克竞赛中取得 100% 满分

国际数学奥林匹克竞赛

IMO 基准测试与 dots-note-3.0 的官方成绩

dots-note-3.0

IMO 是一项面向 20 岁以下学生、为期两天、包含六道题的证明竞赛。每道题价值 7 分,因此最高成绩为 42 分。而且,这类数学竞赛并不是只要最终数字正确就能得满分。要取得好成绩,参赛者必须展示完整且逻辑严密的证明。能否获得部分分数取决于证明的完整程度。[5][3]

2026 年七月,IMO 在上海举行,共有来自 117 个国家的 666 名参赛者。人类选手的比赛结束后,小红书按照官方评分规则对 dots-note-3.0 进行了测试,全程没有人工干预,并提交了解答接受官方评分。该模型在全部六道题中都获得了 7 分中的 7 分,最终取得 42 分中的 42 分满分。[1][2][4]

这个细节很重要。IMO 满分并不意味着答题者靠运气或模式匹配得出了正确答案,而是意味着提交的成果从头到尾都经受住了完整证明式推理的检验。

42 分中的 42 分满分是如何评定的

取得 42/42 意味着每份证明都必须完整,不能缺少步骤,不能存在逻辑缺口,也不能遗漏条件。IMO 评分者评判的是推理本身的质量,而不只是终点。[5][3]

简单来说,门槛很高。答题者必须在全部六道题中保持一条清晰的逻辑链,并确保它能经受住官方审查。

为什么这一结果具有历史意义

这是首个在 IMO 官方评审下获得满分的大语言模型。[1][4]

dots-note-3.0 必须展现哪些能力

要取得 42/42,dots-note-3.0 不能只得出正确答案。它必须阅读原始 LaTeX 题目、选择证明路径,然后在比赛时限内写出供人类评分者检查的完整证明。 [1] 因此,输入格式和证明质量与最终结果同样重要。

阅读 LaTeX 题目并撰写完整证明

dots-note-3.0 直接处理原始 LaTeX 题目,并生成由官方评分者评判的完整、人类可读证明。 [1] 从原始题目到经过验证的证明,这一跨越正是深层推理开始显现的地方。

横跨代数、几何、组合数学和数论的多步推理

解出全部六道 IMO 题目意味着要在代数、几何、组合数学和数论领域展现广泛的推理能力。 [1][2] 简单来说,这意味着构建几何论证、证明有关整数的事实、处理组合问题中的分类讨论,并将中间引理串联成一条有效的推理路线。

2026 年的一些题目还采用了故事化的背景,因此模型必须剥离叙事,找出背后的数学本质。 [1]

这种推理水平能够处理的任务示例

以下是这种推理水平在实际任务中的表现:

领域示例任务
几何根据给定图形构建几何论证
数论证明整数的性质
组合数学通过分类讨论来计数或排除有效排列
代数串联恒等式和引理,得出唯一有效的结论

该模型还必须以符合 IMO 官方评审标准的形式,说明结论为什么必然成立。 [1][2] 这些证明能力也是这一结果对更广泛 AI 推理研究意义重大的重要原因。

为什么这一结果对 AI 推理研究很重要

IMO 对 AI 来说格外困难,因为它不是选择题考试。参赛者需要写出完整的逐步证明,即使遗漏一种情况或一个条件也可能失分。因此,这项基准测试考查的是端到端证明有效性,而不只是最终答案看起来是否正确。

这一点非常关键。如果模型因错误的理由碰巧得出正确结果,只看答案的基准测试可能会掩盖薄弱的推理。IMO 不会放过这一问题,它会检查模型能否从头到尾维持逻辑的完整性。

这对高级推理准确性意味着什么

42/42 的满分表明,该模型能够规划证明、检查自己的中间步骤,并在不破坏逻辑链的情况下完成每个论证。用直白的话说,这体现了它在长篇证明中更强的自检能力。

结合背景来看,这一进步也很突出。2025 年顶尖系统达到 35/42,因此 42/42 代表证明完整性明显提升 [3]

更难回答的问题是,这种推理能力有多少能够迁移到竞赛数学之外。

为什么基准测试的局限仍然重要

IMO 满分仍不能证明模型在混乱的日常场景中具有广泛可靠性。竞赛题目结构严谨,现实输入往往并非如此。它们可能充满噪声、含糊不清或缺少关键信息 [6]

因此,这一结果有力证明了先进的数学推理能力,但不应被解读为对通用理解能力的保证。

同样的一致性也让高级推理能够在多模态和 API 驱动的工作流中发挥作用。

IMO 级推理如何应用于多模态和 API 驱动的应用

强大推理能力在真实工作流中的作用

当推理只是更大管线中的一个环节时,这种一致性最为重要。在生产环境中,遗漏一个约束就可能使整个结果偏离预期。研究助手、辅导工具或编码智能体面对的都是同一项任务:从头到尾始终遵守每一个约束。

这正是自检循环能够发挥作用的地方。它可以及早发现小错误,避免它们滚雪球般演变成更大的故障。

使用 APIMart 将推理与视频、图像和语言模型结合

APIMart

在多模态管线中,推理模型可以在输入到达视频或图像生成器前对其进行检查。当推理需要在媒体生成开始前充当关卡时,同样的思路也适用。

APIMart 让团队可以通过一个 API 组合推理、图像、视频和语言模型。这意味着团队可以先验证输入,再将其发送给视频模型。

在日常使用中,推理准确性会成为多模态管线的一层可靠性保障。这正是 IMO 级推理在数学之外也很重要的原因:它有助于更有把握地检查、路由和使用多模态系统。

结论:经过验证的推理里程碑及其实际启示

dots-note-3.0 在 2026 年国际数学奥林匹克竞赛(IMO)中取得了 42 分中的 42 分满分。这是 AI 模型首次在官方人工评分下达到这一成绩,由人类评委阅读并评判每份证明的每一行 [1][7]

该模型在无人帮助的情况下为整套 IMO 题目写出了完整证明。它结合文本推理与 Python 检查,通过迭代循环检验、修订并完善自己的证明,之后才进行最终提交 [7]。最突出的部分在于:该模型能够检查自己的工作,并在过程中修正错误。

对于构建多模态工作流的 APIMart 用户而言,这正是最重要的启示。IMO 级证明写作并不意味着在每个用例中都能实现完美可靠性,但它确实揭示了一项重要进展:可验证推理正在变得更接近团队能够在生产工作流中依赖的能力。

简单来说,自检式推理可以提升人们对 APIMart 工作流的信任,而这些工作流会将语言、图像和视频模型整合在一起。

常见问题

为什么 IMO 满分对 AI 来说意义如此重大?

国际数学奥林匹克竞赛(IMO)满分之所以重要,是因为它体现了比模式匹配更高层次的能力。IMO 不只要求答案,还要求_完整的数学证明_。

因此,当一个模型取得 42 分中的 42 分时,这绝非小事。它意味着模型可以构建长篇、逐步的论证,从头到尾保持其完整性,不出现逻辑错误、条件遗漏或缺乏依据的主张。

当推理需要跨越许多步骤、而不是一步完成时,这种精确性尤为重要。

这是否意味着 dots-note-3.0 在数学竞赛之外也很可靠?

国际数学奥林匹克竞赛满分体现了强大且无误的逻辑推理能力,但不能保证它在每个现实场景中都可靠。

IMO 在严格条件下测试的是一种范围狭窄的数学推理。全面部署 dots-note-3.0 前,仍应根据你的实际生产工作负载、评判标准和流量模式对其进行检验。

IMO 级推理如何帮助真实的 AI 工作流?

IMO 级推理之所以能帮助真实的 AI 工作流,是因为它会推动模型逐步解决难题,而不只是最后吐出一个答案。这对多步数学问题非常重要,因为前期的一个小错误就可能让后续所有步骤偏离正轨。

它还让检查中间过程变得更加容易。你不必把结果视为黑箱,而是可以检查每一步、找出薄弱环节,并在证明或逻辑错误扩散前发现它们。

在日常使用中,这可以减少使用工具的系统发生故障的次数,在模型必须遵守严格约束时提高准确性,并为依赖稳定逻辑一致性的高级多模态或 API 驱动应用提供更强支持。

看完就试试

去模型市场挑选你想要的模型

在 APIMart 模型市场尝试聊天、图像和视频模型,用统一 API 快速体验模型能力。

聊天模型图像模型视频模型
进入模型市场