在刚刚揭晓的IMO 2026赛场上,中国大模型迎来历史性时刻——小红书自研的dots-note-3.0以满分42分斩获金牌,成为全球第二个达到该成绩的大模型,也是中国首个获得IMO官方金牌水平认证的AI系统。本期科技动态将深度拆解这次突破背后的技术路径、行业意义以及未来想象空间。值得注意的是,模型不仅全部答对,更在第三题上给出了令冠军选手直呼“优雅”的非常规解法,展现了不同寻常的推理创造力。

满分背后的技术跃迁:从形式化证明到自然语言端到端

两年前,谷歌Gemini首次挑战IMO时仅获银牌,且需要将题目转化为Lean等形式化语言才能完成推理,部分题目耗时数天。而小红书dots-note-3.0直接以自然语言端到端完成从读题、解析到写证明的全过程,并在4.5小时内拿下满分。这一进步本质上是AI推理范式的代际跨越。

模型采用智能体架构,让语言模型结合Python代码执行进行推理解题,同时引入递归自我批判能力——每一步推导后都会自动审视自身逻辑漏洞,再修正方向。这种“自我纠错”机制大大提升了推理链条的稳定性。六道题全部拿到满分,意味着Agentic推理系统在代数、组合、几何、数论四个方向上都保持了极高的可靠性,而非依赖某一道题的偶然发挥。

从技术原理看,自然语言推理的核心难点在于“模糊性”和“跳跃性”。人类数学家可以凭借直觉跳过一些显而易见的步骤,但大模型必须证明每一步都严格成立。dots-note-3.0通过大量数学语料训练和强化学习,学会了在自然语言中保持逻辑严密的“数学语言”,这恰恰是当前AI技术在符号推理领域的重要突破。

第三题解法:创新思维何以诞生?

本届IMO第三题是一道组合博弈问题,网上主流解法是将原问题转化为图论连通性问题后再构建证明。但dots-note-3.0没有沿袭这条路径,而是另辟蹊径,采用“归纳法”直接抓住问题最本质的结构,设计了恰到好处的归纳对象与归纳命题。

双CMO金牌得主刘涵祚评价道:“模型最终给出了一条正确且漂亮的证明思路,结构紧凑、逻辑自然,即使放在IMO解答中也属于较为简洁优雅的一类。”另一位CMO金牌得主汪千桐更直言:“常规解法已经很巧妙,但dots直接攻克了题目最难、最本质的部分。看完以后会觉得每一步都顺理成章,但真正拿到题目时,人类选手很难想到能从这个角度切入。”

这种“创新解法”的背后,反映的是大模型在数学推理中正在突破“记忆”与“模式匹配”的局限,开始具备真正的“洞察”能力。值得注意的是,模型在推理过程中也运用了AI图片生成来辅助可视化思考——虽然官方未公开所有细节,但据内部透露,模型在几何题中曾自动生成辅助线示意图来验证假设,这一能力与文生图技术有异曲同工之妙。

IMO为何成为大模型能力的试金石?

IMO(国际数学奥林匹克竞赛)每年赛题由专家命制,在比赛前严格保密。这意味着模型无法提前“背题”,必须面对从未见过的全新问题。这种“未知性”正是IMO相比其他Benchmark最独特的价值。一位头部模型研究员指出:“互联网上出现的数据很快就会被模型拿去训练,所以测试一个模型到底聪不聪明,只能测一些没有公开过的东西。”

此外,IMO的评分标准要求提交完整的逻辑证明过程,而非仅仅给出答案。这对大模型构成了极高挑战:任何一个条件误读、任何一次推导跳步,都会留下被评审指出的漏洞。本届金牌线仅为29分(满分42分),比去年下降了6分,说明赛题难度显著提升。而dots-note-3.0一分未丢,直接抵达了卷面能衡量的最高点。

从更宏观的视角看,数学是AI Agent技术推理能力的“极限测试场”。与知识问答、主观评测不同,数学证明无法靠语言包装蒙混过关,它直接考查模型对复杂问题的理解、拆解和持续推理能力。这也解释了为什么行业巨头纷纷将IMO作为技术能力展示的“第一站”。

小红书的战略亮相:从社区算法到基础模型新玩家

过去,外界对小红书的技术认知更多集中在内容推荐和社区理解上。这次IMO满分金牌,让行业第一次看清了它在基础模型领域的真实成色——一个值得关注的新玩家已经出现。

选择IMO作为技术亮相的舞台,是小红书非常聪明的选择。在行业内,想要展示大模型底层能力,通常有两个方向:Coding和数学。这两种任务的结果都很难靠包装掩盖,相比Benchmark上的几个百分点提升,IMO满分42分这样简单直观的成绩单更具说服力。

据可靠消息,小红书即将开源dots-note-3.0的模型权重和推理代码。这一举动具有双重意义:一方面,开源可以加速学术研究和行业应用,吸引更多开发者基于其能力构建应用;另一方面,也表明小红书对自身技术实力有充分自信,愿意接受全球同行的检验。对于企业用户而言,可关注AI工具导航中收录的最新模型动态,或直接体验抠图等轻量化工具,感受AI在日常场景中的落地魅力。

对大模型行业的深远影响

dots-note-3.0的满分表现,至少在三个层面改变了行业认知。

第一,自然语言推理的可行性被充分验证。此前很多研究者认为,数学证明必须依赖形式化语言才能保证逻辑严谨,而dots-note-3.0证明纯自然语言路径完全可以达到甚至超越人类水平。这为降低AI使用门槛提供了重要参考——未来或许不需要专门的“数学语言”就能实现深度推理。

第二,创新解法表明大模型已经具备“跨域迁移”的推理能力。模型没有简单复现已有解法,而是自主发现了更简洁的归纳路径,这意味着AI在科研发现中的应用前景更加广阔。就在本周,已有另一个AI系统参与构造了雅可比猜想的反例——该猜想自1939年提出以来悬而未决87年。

第三,对中国AI行业的提振作用。继2024年谷歌Gemini首次达到IMO金牌水平后,中国大模型用一年时间实现了从“追随”到“并跑”甚至局部超越的转变。这不仅关乎技术荣誉,更意味着在AI推理这一核心能力上,中国企业已经站在了全球第一梯队。

然而,满分只是起点。正如一位业内人士所言:“满分只是卷面的上限,不是模型能力的上限。”未来,随着大模型训练技术的持续优化,以及更多垂直场景的适配,我们有理由期待AI在数学、物理、化学等基础科学领域带来更多突破性发现。对于普通用户而言,不妨通过AI诗词艺术签名等工具,提前感受AI在创意领域的最新进展。

FAQ

什么是IMO与大模型结合的意义?

IMO(国际数学奥林匹克竞赛)是全球最高水平的中学生数学竞赛。大模型参与IMO,可以直接检验其在未知问题上的深度推理能力,尤其是自然语言证明的完整性和逻辑严密性,是衡量AI智力水平的“硬核标尺”。

dots-note-3.0和Gemini的IMO成绩有何不同?

两者都达到金牌水平,但dots-note-3.0是满分42分,而Gemini在2025年最好成绩是5/6(约35分)。此外,dots-note-3.0全程使用自然语言推理,无需形式化语言转换,在推理效率和通用性上更进一步。

这次满分突破对普通用户有什么影响?

虽然专业数学推理离日常应用较远,但底层能力的提升会直接惠及AI画图、智能写作、代码生成等工具。例如,更强的推理能力可以让AI画图更准确理解复杂指令,也可以让背景去除等工具在边缘案例中表现更稳定。