Xiaohongshu dots-note-3.0 在 IMO 2026 斩获满分:AI 证明写作迈入新纪元
在 2026 年 7 月于上海举行的国际数学奥林匹克(International Mathematical Olympiad, IMO)中,Xiaohongshu 发布的 AI 模型 dots-note-3.0 创造了历史。在官方人工评分下,该模型以 42/42 的满分成绩,成为首个在 IMO 官方规则下获得完美分数的 AI 系统。
这一成绩不仅意味着模型给出了正确的最终答案,更关键的是,它成功撰写了六道难题的完整、无逻辑漏洞的数学证明。在 IMO 这种对步骤严谨性要求极高的竞赛中,满分意味着模型在代数、几何、组合数论和数论四个领域的推理链条均经得起人类专家的逐字审查。
核心突破:从“猜答案”到“写证明”
过往的 AI 数学竞赛成绩多集中在选择题或填空题,容易通过模式匹配得出正确结果。然而,IMO 的六道大题要求参赛者必须展示完整的推导过程,任何一步逻辑缺失都会导致扣分。
dots-note-3.0 的突破在于其独特的 Proof-Writing Workflow(证明写作工作流):
- 原生 LaTeX 解析:模型能够直接读取原始的 LaTeX 数学公式,无需经过中间的自然语言转换,精准理解题目中的几何图形配置与代数约束。
- 跨领域多步推理:模型在代数、几何、组合数论和数论之间自由切换,构建复杂的逻辑链条。例如,在几何题中建立辅助线论证,在数论题中通过整除性质推导整数解。
- 自我检查闭环(Self-Checking Loop):这是本次升级的核心。模型在提交前,利用文本推理结合 Python 代码执行 进行自我验证。它不仅能检查中间步骤的合法性,还能通过代码计算验证数值结果,确保逻辑链的完整性。
技术亮点与行业意义
此次满分成绩并非偶然,它代表了 AI 推理能力的质的飞跃,具体体现在以下三个维度:
- 端到端的逻辑完整性:不同于以往仅关注最终输出的模型,dots-note-3.0 展现了从题目理解、路径规划到最终证明书写的端到端能力。它证明了 AI 可以像人类数学家一样,构建并维护一条长达数页的逻辑链条。
- 多模态与代码能力的深度融合:模型在处理包含复杂图形和抽象符号的数学问题时,展现了强大的视觉理解与符号计算能力,并通过 Python 验证将数学直觉转化为可执行的代码逻辑。
- 长上下文下的稳定性:IMO 题目往往包含大量前置条件,模型在长上下文窗口内保持了极高的注意力集中度,未出现常见的幻觉或逻辑断裂。
“这一结果的意义不仅在于分数,更在于它展示了 AI 证明写作的成熟度。dots-note-3.0 的工作流展示了如何通过自我检查机制,确保每一步推理的严谨性,这对于构建更可靠的 AI 系统至关重要。” —— 官方技术团队
对开发者与用户的启示
对于开发者而言,dots-note-3.0 的成功验证了 Agent(智能体) 架构在处理复杂逻辑任务时的巨大潜力。未来的应用将不再局限于简单的问答,而是可以扩展到需要多步骤规划、代码验证和逻辑自洽的专业领域,如法律合同审查、科学假设验证及复杂工程方案设计。
对于用户和教育者来说,这标志着 AI 助手在学术辅助领域的边界被重新定义。虽然 IMO 的数学问题相对结构化,但 dots-note-3.0 所展现的严谨推理能力,使其在处理非结构化、高难度的日常任务时,也能提供远超预期的深度分析与逻辑支持。
关键指标
| 指标 | 数值/描述 |
|---|---|
| IMO 2026 得分 | 42/42 (满分) |
| 参赛人数对比 | 666 名人类选手中仅 7 人获满分 |
| 推理领域 | 代数、几何、组合数论、数论 |
| 核心机制 | 自我检查循环 + Python 代码验证 |
| 历史地位 | 首个在 IMO 官方评分下获满分的 AI 模型 |
此次突破为 AI 产业树立了新的标杆,预示着通用人工智能(AGI)在逻辑推理与科学发现领域的实质性进展。