APIMart
深入 dots-note-3.0:AI 数学推理新突破

深入 dots-note-3.0:AI 数学推理新突破

探索 dots-note-3.0 如何通过自然语言证明、Python 检查和迭代式自我审查工作流,据称在 IMO 中取得 42/42 的满分成绩。

模型解读

据称,一款 AI 模型在 2026 年 IMO 中取得了 42/42 的满分,但真正值得关注的不只是分数。 我会这样概括:dots-note-3.0 的设计目标是在作答前起草、检查并修订数学证明,直面 AI 领域的一项难题:确保一份证明从头到尾的每一步都严密成立。

如果你只想看简要版本,重点如下:

  • dots-note-3.0 是 RedNote/小红书推出的数学专用模型。
  • 据称,它在上海举行的 **2026 年国际数学奥林匹克竞赛**中取得了 42/42 的满分
  • 2025 年公开报道的 AI IMO 最高成绩为 35/42,因此这相当于提升了 7 分
  • 该模型结合使用自然语言推理与 Python 检查
  • 它的核心方法是一个自我审查循环:撰写证明、检验步骤、修正错误,然后再给出答案。
  • 这一说法目前仍是公司方面的报告,因此外部核验依然重要。
  • 本文还会探讨这对研究人员、教师、学生、开发者和 API 用户意味着什么。

最关键的一点很简单:IMO 评判的是完整证明,而不只是最终答案。 这意味着一个薄弱环节就可能让整道题失分。因此,如果 dots-note-3.0 能经受住外部测试,它将标志着 AI 从“经常能得出答案”迈向_能够逐步为答案辩护_。

本文还有第二条主线:该模型处于自然语言证明写作形式化定理证明之间。这让人们更容易阅读它的输出,但它无法提供形式化证明系统那样的机器可检验保证。

OpenAI IMO 团队解读模型为何终于能攻克顶尖数学难题

OpenAI

快速对比

主题dots-note-3.0
核心方向基于证明的数学推理
公开报道的 IMO 2026 成绩42/42
文中提及的 2025 年此前最高成绩35/42
核心方法自我批判 + 修订循环
使用的工具自然语言 + Python
主要优势在最终输出前发现推理缺口
主要局限仍有待外部验证
最适合的用户研究人员、教育工作者、学生、开发者

因此在本文中,我会把分数视为醒目的标题,而将证明检查工作流视为最值得关注的部分。

dots-note-3.0 是什么,以及其公开报道的 IMO 成绩为何重要

dots-note-3.0 是小红书 dots3 系列中规模最小的模型。它专为数学推理而构建,同时比更大的 jazz 和 aria 模型使用更少的算力。该模型仍处于测试阶段,公司表示稍后将发布源代码,但尚未给出具体日期。这一点在此很重要,因为评判该模型的依据是以证明为核心的推理能力,而不只是最终输出看上去是否正确。 [2][4]

公开报道的 2026 年 IMO 42/42 成绩

小红书称,dots-note-3.0 在上海举行的 2026 年国际数学奥林匹克竞赛中取得了 42 分中的 42 分。据该公司介绍,模型直接根据官方题目解出了全部六道题,并写出了没有逻辑缺口或条件遗漏的完整自然语言证明。测试过程中没有人工帮助,解答已提交给 IMO 主办方评分。 [2][4][3]

这一成绩高于 2025 年领先模型公开报道的 35/42[2][4] 所以,这一成绩的确非常醒目,但仍需要外部确认。

为什么这一主张比常见的基准测试胜利更进一步

IMO 不像选择题考试或简答基准测试。它评判的是完整证明。这意味着该结果体现的是从头到尾持续推理的能力,而不只是选对答案或得出正确的最终结论。

读者应留意的验证局限

目前,42/42 的结果依据的是小红书方面公布的数据。该公司表示,AI 生成的解答已提交给 IMO 官方主办方评分,但在这一说法得到全面核验之前,仍需要外部审查以及更多有关评分过程的细节。 [3][2]

现阶段,将 42/42 的结果视为前景可期但尚未确认,是较为合理的态度。等源代码发布、外部研究人员能够用新问题测试该模型,并观察它能否维持相同表现后,情况会更加明朗。

dots-note-3.0 如何改进数学推理

AI 数学推理方法对比:dots-note-3.0 与其他方法
AI 数学推理方法对比:dots-note-3.0 与其他方法

在最终作答前进行递归式自我批判与修订

dots-note-3.0 将自然语言推理与 Python 检查结合起来,以验证中间步骤 [1]。它不会固守第一次尝试,而是经历反复的审查循环:检验每一步、发现错误,并在给出最终答案前重写证明 [1]。这正是其取得所报道 IMO 成绩背后的主要原因。

由于 IMO 评判的是_完整证明_,dots-note-3.0 的设计目标是保障整个论证的逻辑,而不只是得出正确的最终答案 [1][2]。这对定理类问题尤其重要,因为一个错误步骤就可能破坏后续的一切 [1][2]

递归式自检最能发挥作用的数学领域

最大的提升出现在每一步都必须独立成立的领域。

数学领域dots-note-3.0 的应对方式具体示例
奥赛证明迭代式自检假设在定稿前发现组合数学问题中遗漏的边界情况
符号代数执行 Python 代码以验证步骤在展开复杂多项式时发现符号错误
几何证明严格验证几何条件发现某一三角形性质只是被假设而未被证明后,修订证明
微积分检查多步推导重新计算中间导数,修正错误的分部积分步骤

推理方法对比表

下表展示了这种方法与常见推理工作流的区别。

推理方法优势局限最适合的数学任务
递归式自我批判(dots-note-3.0)严谨性高;能发现逻辑缺口;通过迭代式自检从中间错误中恢复迭代起草会带来更高的算力成本与延迟奥赛式证明、复杂的多步定理、几何证明
标准思维链(CoT)可提升简单文字题的表现;易于实现容易臆造逻辑步骤;如果前面的步骤出错便无法恢复基础算术、简单代数文字题
工具增强推理通过 Python 实现高精度计算;能处理复杂符号运算工具输出的质量取决于调用工具时所用的逻辑;缺少深入的逻辑自我审查符号代数、微积分推导、大量算术运算
形式化证明工作流通过形式化验证提供绝对的数学确定性需要转换为形式语言;使用门槛非常高定理证明、教材习题形式化

取舍很简单:投入更多算力、等待更长时间,换取对破坏证明的错误更强的防护能力。

dots-note-3.0 在当前 AI 数学研究中的定位

自然语言证明与形式化定理证明

这种方法的重要之处在于,它处于人类可读证明与机器检验式形式验证之间的中间地带。

在当前的 AI 数学研究中,这种区分很有用。一边是自然语言证明系统,它们将书面解释与 Python 等工具结合起来;另一边是形式化定理证明器,其中每一步都要用 Lean 这样的语言写成,再由机器检查。

dots-note-3.0 属于前一种。它使用自然语言推理与 Python 检查。真正有趣的不只是它能得出正确答案,还在于它将数学推理转化为可读、能够自我纠错的证明过程,而不是像一个只会吐出最终结果的黑箱。

这种差异很重要。自然语言证明更便于人们理解;当目标是机器验证时,形式化证明则更强。取舍也很清楚:自然语言证明仍可能隐藏细小的逻辑缺口,而形式系统会当场发现这些问题。

一次醒目成绩之外同样重要的基准测试

同样的差异也体现在基准测试的选择上。

IMO 成绩很强,但它只是一个基准测试。研究人员还关注 GSM8KMATH500AIMEMathVistaGPQA,因为每个基准测试都考查推理的不同方面,包括深度、几何、视觉数学或专家级问题求解能力。

IMO 的突出之处在于,它评判的是完整的书面证明。遗漏一种情况或未说明一个条件都可能导致实际失分。这与只核对最终答案的测试截然不同。对于旨在处理算术、代数、几何、微积分和证明类工作的模型而言,IMO 因而是一个难度高得多的目标。

模型与基准测试对比表

下表将 dots-note-3.0 与其他系统并列,以说明它在当前 AI 数学研究中的位置。

系统主要任务类型关键基准测试输出形式公开报道的优势
dots-note-3.0奥赛推理IMO 2026 (42/42) [1][2][4]自然语言 + Python智能体式自我批判循环;完整证明的严谨性
Huawei Celia奥赛推理IMO 2026 (42/42) [3]数学证明跨领域数学能力
Moonshot AI Kimi K3高级推理IMO 2026 (42/42) [3]自然语言达到满分门槛
DeepMind/OpenAI (2025)奥赛推理IMO 2025 (35/42) [1][2][4]形式化 + 自然语言金牌水平表现

主要差异不只是分数,而是提交前修复证明的自我批判循环。正是这部分决定了该模型如何融入研究与产品工作流。

这对研究人员、教育工作者、学生、开发者和 APIMart 用户意味着什么

GccAi

教育、研究和软件产品中的实际用例

dots-note-3.0 不只是取得了更好的基准测试成绩。它更大的优势是会检查并修订自己的推理,从而让日常工作流更加可靠。简单来说,它把证明级推理变成了可用于研究、教学和软件的能力。

研究人员可以用它检验猜想、寻找反例,并在形式化之前对证明步骤进行压力测试。这一点很重要,因为它的自检循环旨在减少逻辑缺口和条件遗漏 [2][4]

教育工作者可以利用该模型制作带解题过程的示例和答案。它能够追踪推导、找出错误步骤并给出修正后的解答。学生则能从同一种能力的另一面获得帮助:一个不仅会指出答案错误,还会解释_为什么_错误的辅导工具 [2]

构建定量产品的开发者需要高精度和稳定的格式。例如,金融 SaaS 工作流可以使用该模型计算复利,或返回结构化数值输出,同时保留美国数字格式,如 1,000.25 [2]

APIMart 如何支持规模化数学推理工作流

APIMart 的统一 API 让团队可以更轻松地构建数学推理工作流,无需同时维护多个独立集成。

对开发者而言,主要优势是集成更简单、用量规划更清晰。团队不必维护多个端点和特定于工具的工作流,而是可以通过一个 API 发送请求,再将输出塑造成产品所需的格式。

用户影响映射表与结论

当人们需要解释而不只是答案时,这些工作流最有价值。下表展示了这种推理方式如何对应不同用户群体。

用户群体用例所需能力APIMart 流程
研究人员定理构思与猜想检验形式逻辑与严谨的证明生成推理模型 -> JSON 输出 -> LaTeX
教育工作者解答检查与评分辅助逐步诊断错误学生输入 -> 推理模型 -> 反馈
学生交互式辅导与带过程的示例自然语言数学解释Chat API -> 逐步推理模式
开发者定量 SaaS 与金融工作流高精度数值与逻辑分析统一 API -> 结构化 JSON(例如 $1,250.00)

RedNote 已宣布计划在不久的将来发布源代码,但尚未披露具体条款 [2][4]。对 APIMart 用户而言,它的吸引力在于可靠的逐步推理能力可以顺畅融入产品工作流。

常见问题

42/42 的成绩是如何验证的?

42/42 的成绩通过将 dots-note-3.0 的完整 IMO 解答提交给 IMO 主办方进行人工评分来核验,测试期间没有人工干预

评分依据是每个必要证明步骤的正确性和完整性,而不只是最终的数值答案。

Python 检查可以确认证明中的哪些内容?

在 dots-note-3.0 中,Python 检查通过测试、质疑和完善模型的推理草稿,帮助验证证明是否严密。

它们可以发现可能削弱书面证明的遗漏情况或未声明条件。这样一来,提交前就能检查每一步在逻辑上是否成立。

哪些人最能从 dots-note-3.0 中受益?

dots-note-3.0 最适合需要在解决难题时获得严谨、可验证准确性的研究人员、教育工作者和开发者。

它能在代数、几何、微积分和形式逻辑中提供可靠的逐步推理。因此,它非常适合基于定理的工作和定量分析,因为在这些场景中,即使很小的逻辑错误或未声明条件也可能造成高昂代价。

看完就试试

去模型市场挑选你想要的模型

在 APIMart 模型市场尝试聊天、图像和视频模型,用统一 API 快速体验模型能力。

聊天模型图像模型视频模型
进入模型市场