IMO 满分之后,推理模型的尺子该往哪画
2026 年 7 月 21 日,第 67 届国际数学奥林匹克(IMO)官方评卷结果揭晓。小红书 dots 团队的 dots-note 3.0 六道题全部答对,42/42 分,满分金牌。
全球仅 7 位人类选手拿到同样的成绩。这是大模型第一次在 IMO 拿到满分,也是第一次在不依赖形式化验证工具的情况下做到这一点。
一条技术路线的可行性被验证了,同时,我们评估 AI 推理能力时的盲区也暴露得更清楚。
递归自我批判:模型学会了"反悔"
dots-note 3.0 的核心技术特点是递归自我批判。模型在生成每一步推理后,会主动检查这一步是否正确、是否有漏洞、是否有更优雅的解法。如果发现问题,它会回退并尝试新路径。
这与传统大模型的"一条路走到黑"有本质区别。传统模型生成答案后基本不会自我修正,而 dots-note 3.0 在解题过程中持续进行"生成—批判—修正"的循环。
更关键的是,它不依赖 Lean、Coq 等形式化验证工具,而是直接读取人类写的 LaTeX 题目,用人类的数学语言进行推理。这让它比形式化路线更接近真实的数学思维:灵活、直觉驱动、能跳出既定框架。
第三题就是一个典型例子。这是一道组合博弈题,人类顶尖选手的主流解法是把问题转化为图论连通性。dots-note 3.0 完全没有走这条路,而是直接用数学归纳法完成了整道证明。双 CMO 金牌得主刘涵祚评价"结构紧凑、逻辑自然",另一位金牌得主汪千桐则感慨"人类选手很难想到能从这个角度切入"。
归纳法本身是竞赛生的基本功。难点在于:在没有任何提示的情况下,怎么知道该对什么对象做归纳?归纳命题怎么设计?递推路径怎么走?模型自己找到了答案。
IMO 满分不等于"AI 会数学了"
IMO 确实很难,但它是"已知有解"的问题。每道题评委都提前验证过答案存在,AI 做的是"找到已知的答案"。而真正的数学研究面对的是"不知道有没有解"的问题——你甚至不知道答案是否存在,不知道这条路是否走得通。
从"解题"到"发现",中间隔着一道巨大的鸿沟。人类数学家可以花几年甚至几十年研究一个猜想,但 AI 目前还不能做这种长期、开放式的探索。
另一个需要冷静看待的问题是评估标准。人类选手在考场上只有几个小时,不能查阅资料,不能重试。AI 的"考试环境"是否与人类完全一致?如果 AI 可以多次尝试、可以选择最优答案,那这个满分的含金量需要更透明的评估标准。
此外,dots-note 3.0 是 dots3 系列中最轻量级的模型。这固然说明"小模型也能有大能力",但也引出一个合理怀疑:IMO 题目是否可能被"过拟合"?如果模型在训练数据中见过类似题目结构,满分就不完全代表通用推理能力。
一个真信号
尽管如此,dots-note 3.0 的满分仍然是一个真信号。
过去 AI 在数学上的突破多依赖形式化验证——把数学问题翻译成机器可验证的形式语言,然后用定理证明器检查。这保证了可靠性,但翻译过程本身就需要大量人工工作,且不灵活。dots-note 3.0 证明了端到端的非形式化推理也能达到人类顶尖水平,这为 AI 辅助数学研究打开了一条更实用的路。
对产业界的影响可能更直接。dots-note 3.0 预期将开源,这意味着全世界的研究者和开发者都可以基于它进行进一步研究。在科研辅助、高端教育、算法设计等需要深度推理的场景,这种能力有明确的商业价值。
同时,这也给推理模型的竞赛定下了新标杆。2025 年谷歌 Gemini Deep Think 在 IMO 上答对 5 题,达到金牌线。一年后,dots-note 3.0 拿到了满分。这个进步速度说明,递归推理、自我批判、长程规划这些技术的组合,正在快速推高大模型在复杂认知任务上的天花板。
下一站在哪
IMO 被攻破后,衡量大模型推理能力的那把尺子该往哪儿画,已经成了一个行业问题。
一个方向是原创数学研究——让 AI 去面对真正未知的数学问题,而不是已验证有解的竞赛题。1994 年菲尔兹奖得主埃菲·杰曼诺夫在 2026 WAIC 上就直言:当前 AI"通晓互联网上出现过的一切",能串联已有知识解题,但"它不知道证明究竟是什么"。
另一个方向是真实世界任务闭环——从解题能力转向在真实业务场景中"把事办成"的能力。上海 AI 实验室主任周伯文提出了"Research is the next Coding"的判断,百度也已经用 DAA(日活跃智能体完成有效任务量)替代 Token 吞吐量作为核心评估指标。
我的判断是:未来 12-18 个月内,行业会先统一到"真实世界任务闭环完成率"这条主线上,同时保留 1-2 个原创数学研究类任务作为能力极限测试。后者门槛太高、成本太贵,短期内难以规模化,但可以作为理论天花板的验证。
dots-note 3.0 的满分是一个里程碑,但它的真正意义不在于"AI 比人类聪明",而在于 AI 终于开始理解"推理"这件事了。当 AI 不仅能算出答案,还能想出答案、批判自己的答案时,我们离真正可用的推理模型就近了一步。
但这条路,才刚刚开始。