
深入 dots-note-3.0:AI 数学推理新突破
探索 dots-note-3.0 如何通过自然语言证明、Python 检查和迭代式自我审查工作流,据称在 IMO 中取得 42/42 的满分成绩。
据称,一款 AI 模型在 2026 年 IMO 中取得了 42/42 的满分,但真正值得关注的不只是分数。 我会这样概括:dots-note-3.0 的设计目标是在作答前起草、检查并修订数学证明,直面 AI 领域的一项难题:确保一份证明从头到尾的每一步都严密成立。
如果你只想看简要版本,重点如下:
- dots-note-3.0 是 RedNote/小红书推出的数学专用模型。
- 据称,它在上海举行的 **2026 年国际数学奥林匹克竞赛**中取得了 42/42 的满分。
- 2025 年公开报道的 AI IMO 最高成绩为 35/42,因此这相当于提升了 7 分。
- 该模型结合使用自然语言推理与 Python 检查。
- 它的核心方法是一个自我审查循环:撰写证明、检验步骤、修正错误,然后再给出答案。
- 这一说法目前仍是公司方面的报告,因此外部核验依然重要。
- 本文还会探讨这对研究人员、教师、学生、开发者和 API 用户意味着什么。
最关键的一点很简单:IMO 评判的是完整证明,而不只是最终答案。 这意味着一个薄弱环节就可能让整道题失分。因此,如果 dots-note-3.0 能经受住外部测试,它将标志着 AI 从“经常能得出答案”迈向_能够逐步为答案辩护_。
本文还有第二条主线:该模型处于自然语言证明写作与形式化定理证明之间。这让人们更容易阅读它的输出,但它无法提供形式化证明系统那样的机器可检验保证。
OpenAI IMO 团队解读模型为何终于能攻克顶尖数学难题

快速对比
| 主题 | dots-note-3.0 |
|---|---|
| 核心方向 | 基于证明的数学推理 |
| 公开报道的 IMO 2026 成绩 | 42/42 |
| 文中提及的 2025 年此前最高成绩 | 35/42 |
| 核心方法 | 自我批判 + 修订循环 |
| 使用的工具 | 自然语言 + Python |
| 主要优势 | 在最终输出前发现推理缺口 |
| 主要局限 | 仍有待外部验证 |
| 最适合的用户 | 研究人员、教育工作者、学生、开发者 |
因此在本文中,我会把分数视为醒目的标题,而将证明检查工作流视为最值得关注的部分。
dots-note-3.0 是什么,以及其公开报道的 IMO 成绩为何重要
dots-note-3.0 是小红书 dots3 系列中规模最小的模型。它专为数学推理而构建,同时比更大的 jazz 和 aria 模型使用更少的算力。该模型仍处于测试阶段,公司表示稍后将发布源代码,但尚未给出具体日期。这一点在此很重要,因为评判该模型的依据是以证明为核心的推理能力,而不只是最终输出看上去是否正确。 [2][4]
公开报道的 2026 年 IMO 42/42 成绩
小红书称,dots-note-3.0 在上海举行的 2026 年国际数学奥林匹克竞赛中取得了 42 分中的 42 分。据该公司介绍,模型直接根据官方题目解出了全部六道题,并写出了没有逻辑缺口或条件遗漏的完整自然语言证明。测试过程中没有人工帮助,解答已提交给 IMO 主办方评分。 [2][4][3]
这一成绩高于 2025 年领先模型公开报道的 35/42。 [2][4] 所以,这一成绩的确非常醒目,但仍需要外部确认。
为什么这一主张比常见的基准测试胜利更进一步
IMO 不像选择题考试或简答基准测试。它评判的是完整证明。这意味着该结果体现的是从头到尾持续推理的能力,而不只是选对答案或得出正确的最终结论。
读者应留意的验证局限
目前,42/42 的结果依据的是小红书方面公布的数据。该公司表示,AI 生成的解答已提交给 IMO 官方主办方评分,但在这一说法得到全面核验之前,仍需要外部审查以及更多有关评分过程的细节。 [3][2]
现阶段,将 42/42 的结果视为前景可期但尚未确认,是较为合理的态度。等源代码发布、外部研究人员能够用新问题测试该模型,并观察它能否维持相同表现后,情况会更加明朗。
dots-note-3.0 如何改进数学推理

在最终作答前进行递归式自我批判与修订
dots-note-3.0 将自然语言推理与 Python 检查结合起来,以验证中间步骤 [1]。它不会固守第一次尝试,而是经历反复的审查循环:检验每一步、发现错误,并在给出最终答案前重写证明 [1]。这正是其取得所报道 IMO 成绩背后的主要原因。
由于 IMO 评判的是_完整证明_,dots-note-3.0 的设计目标是保障整个论证的逻辑,而不只是得出正确的最终答案 [1][2]。这对定理类问题尤其重要,因为一个错误步骤就可能破坏后续的一切 [1][2]。
递归式自检最能发挥作用的数学领域
最大的提升出现在每一步都必须独立成立的领域。
| 数学领域 | dots-note-3.0 的应对方式 | 具体示例 |
|---|---|---|
| 奥赛证明 | 迭代式自检假设 | 在定稿前发现组合数学问题中遗漏的边界情况 |
| 符号代数 | 执行 Python 代码以验证步骤 | 在展开复杂多项式时发现符号错误 |
| 几何证明 | 严格验证几何条件 | 发现某一三角形性质只是被假设而未被证明后,修订证明 |
| 微积分 | 检查多步推导 | 重新计算中间导数,修正错误的分部积分步骤 |
推理方法对比表
下表展示了这种方法与常见推理工作流的区别。
| 推理方法 | 优势 | 局限 | 最适合的数学任务 |
|---|---|---|---|
| 递归式自我批判(dots-note-3.0) | 严谨性高;能发现逻辑缺口;通过迭代式自检从中间错误中恢复 | 迭代起草会带来更高的算力成本与延迟 | 奥赛式证明、复杂的多步定理、几何证明 |
| 标准思维链(CoT) | 可提升简单文字题的表现;易于实现 | 容易臆造逻辑步骤;如果前面的步骤出错便无法恢复 | 基础算术、简单代数文字题 |
| 工具增强推理 | 通过 Python 实现高精度计算;能处理复杂符号运算 | 工具输出的质量取决于调用工具时所用的逻辑;缺少深入的逻辑自我审查 | 符号代数、微积分推导、大量算术运算 |
| 形式化证明工作流 | 通过形式化验证提供绝对的数学确定性 | 需要转换为形式语言;使用门槛非常高 | 定理证明、教材习题形式化 |
取舍很简单:投入更多算力、等待更长时间,换取对破坏证明的错误更强的防护能力。
dots-note-3.0 在当前 AI 数学研究中的定位
自然语言证明与形式化定理证明
这种方法的重要之处在于,它处于人类可读证明与机器检验式形式验证之间的中间地带。
在当前的 AI 数学研究中,这种区分很有用。一边是自然语言证明系统,它们将书面解释与 Python 等工具结合起来;另一边是形式化定理证明器,其中每一步都要用 Lean 这样的语言写成,再由机器检查。
dots-note-3.0 属于前一种。它使用自然语言推理与 Python 检查。真正有趣的不只是它能得出正确答案,还在于它将数学推理转化为可读、能够自我纠错的证明过程,而不是像一个只会吐出最终结果的黑箱。
这种差异很重要。自然语言证明更便于人们理解;当目标是机器验证时,形式化证明则更强。取舍也很清楚:自然语言证明仍可能隐藏细小的逻辑缺口,而形式系统会当场发现这些问题。
一次醒目成绩之外同样重要的基准测试
同样的差异也体现在基准测试的选择上。
IMO 成绩很强,但它只是一个基准测试。研究人员还关注 GSM8K、MATH500、AIME、MathVista 和 GPQA,因为每个基准测试都考查推理的不同方面,包括深度、几何、视觉数学或专家级问题求解能力。
IMO 的突出之处在于,它评判的是完整的书面证明。遗漏一种情况或未说明一个条件都可能导致实际失分。这与只核对最终答案的测试截然不同。对于旨在处理算术、代数、几何、微积分和证明类工作的模型而言,IMO 因而是一个难度高得多的目标。
模型与基准测试对比表
下表将 dots-note-3.0 与其他系统并列,以说明它在当前 AI 数学研究中的位置。
| 系统 | 主要任务类型 | 关键基准测试 | 输出形式 | 公开报道的优势 |
|---|---|---|---|---|
| dots-note-3.0 | 奥赛推理 | IMO 2026 (42/42) [1][2][4] | 自然语言 + Python | 智能体式自我批判循环;完整证明的严谨性 |
| Huawei Celia | 奥赛推理 | IMO 2026 (42/42) [3] | 数学证明 | 跨领域数学能力 |
| Moonshot AI Kimi K3 | 高级推理 | IMO 2026 (42/42) [3] | 自然语言 | 达到满分门槛 |
| DeepMind/OpenAI (2025) | 奥赛推理 | IMO 2025 (35/42) [1][2][4] | 形式化 + 自然语言 | 金牌水平表现 |
主要差异不只是分数,而是提交前修复证明的自我批判循环。正是这部分决定了该模型如何融入研究与产品工作流。
这对研究人员、教育工作者、学生、开发者和 APIMart 用户意味着什么

教育、研究和软件产品中的实际用例
dots-note-3.0 不只是取得了更好的基准测试成绩。它更大的优势是会检查并修订自己的推理,从而让日常工作流更加可靠。简单来说,它把证明级推理变成了可用于研究、教学和软件的能力。
研究人员可以用它检验猜想、寻找反例,并在形式化之前对证明步骤进行压力测试。这一点很重要,因为它的自检循环旨在减少逻辑缺口和条件遗漏 [2][4]。
教育工作者可以利用该模型制作带解题过程的示例和答案。它能够追踪推导、找出错误步骤并给出修正后的解答。学生则能从同一种能力的另一面获得帮助:一个不仅会指出答案错误,还会解释_为什么_错误的辅导工具 [2]。
构建定量产品的开发者需要高精度和稳定的格式。例如,金融 SaaS 工作流可以使用该模型计算复利,或返回结构化数值输出,同时保留美国数字格式,如 1,000.25 [2]。
APIMart 如何支持规模化数学推理工作流
APIMart 的统一 API 让团队可以更轻松地构建数学推理工作流,无需同时维护多个独立集成。
对开发者而言,主要优势是集成更简单、用量规划更清晰。团队不必维护多个端点和特定于工具的工作流,而是可以通过一个 API 发送请求,再将输出塑造成产品所需的格式。
用户影响映射表与结论
当人们需要解释而不只是答案时,这些工作流最有价值。下表展示了这种推理方式如何对应不同用户群体。
| 用户群体 | 用例 | 所需能力 | APIMart 流程 |
|---|---|---|---|
| 研究人员 | 定理构思与猜想检验 | 形式逻辑与严谨的证明生成 | 推理模型 -> JSON 输出 -> LaTeX |
| 教育工作者 | 解答检查与评分辅助 | 逐步诊断错误 | 学生输入 -> 推理模型 -> 反馈 |
| 学生 | 交互式辅导与带过程的示例 | 自然语言数学解释 | Chat API -> 逐步推理模式 |
| 开发者 | 定量 SaaS 与金融工作流 | 高精度数值与逻辑分析 | 统一 API -> 结构化 JSON(例如 $1,250.00) |
RedNote 已宣布计划在不久的将来发布源代码,但尚未披露具体条款 [2][4]。对 APIMart 用户而言,它的吸引力在于可靠的逐步推理能力可以顺畅融入产品工作流。
常见问题
42/42 的成绩是如何验证的?
42/42 的成绩通过将 dots-note-3.0 的完整 IMO 解答提交给 IMO 主办方进行人工评分来核验,测试期间没有人工干预。
评分依据是每个必要证明步骤的正确性和完整性,而不只是最终的数值答案。
Python 检查可以确认证明中的哪些内容?
在 dots-note-3.0 中,Python 检查通过测试、质疑和完善模型的推理草稿,帮助验证证明是否严密。
它们可以发现可能削弱书面证明的遗漏情况或未声明条件。这样一来,提交前就能检查每一步在逻辑上是否成立。
哪些人最能从 dots-note-3.0 中受益?
dots-note-3.0 最适合需要在解决难题时获得严谨、可验证准确性的研究人员、教育工作者和开发者。
它能在代数、几何、微积分和形式逻辑中提供可靠的逐步推理。因此,它非常适合基于定理的工作和定量分析,因为在这些场景中,即使很小的逻辑错误或未声明条件也可能造成高昂代价。
去模型市场挑选你想要的模型
在 APIMart 模型市场尝试聊天、图像和视频模型,用统一 API 快速体验模型能力。