2025年,北京协和医院神经外科博士后金山木因一则新闻再次走进公众视野——他利用OpenAI的GPT-5.6-Sol模型,在16小时内成功证明了自2004年以来悬而未决的Crouzeix猜想。这一消息不仅震动了数学界,更让人们对人工智能在纯数学领域的应用产生了全新思考。当一位没有正式数学背景的医生,借助AI工具完成顶尖数学家苦战十余年未能突破的难题,我们不禁要问:人工智能究竟在为科研带来怎样的变革?
从地质学到神经外科:一位跨界医生的AI冒险
金山木的学术履历堪称“非典型”。他本科就读于北京大学地质学专业,2016年通过自主招生进入这个与医学和数学都相去甚远的领域。2019年,他参与南阿尔卑斯山地质考察后,于2020年通过协和医学院“4+4试点班”转入临床医学,2024年成为神经外科博士后。在旁人看来,这样一条路径与数学研究毫无交集。然而,正是他在经颅超声研究中遇到的现实问题——如何用超声波穿透复杂的人体颅骨结构——促使他接触到了矩阵分析。在自学过程中,他偶然了解到Crouzeix猜想,一个看似简洁却极度困难的数学命题。
金山木在接受采访时表示,他正式接受的数学教育仅限于理工科本科生的基础课程,其余数学知识全凭自学。这种“非科班”背景反而让他没有受到传统数学思维的束缚。当他在尝试用传统方法推导失败后,开始思考能否借助AI Agent技术来辅助证明。他注意到OpenAI此前在攻克另一个数学难题Cycle Double Cover猜想时采用的提示词策略,决定借鉴这一思路。
这一选择在当时看来颇为大胆:一位医生,用AI挑战数学家们22年未能解决的难题。但正是这种跨界的勇气,让我们看到了最新科技在突破学科壁垒方面的潜力。金山木的故事也提醒我们,在人工智能时代,专业背景的边界正在模糊——只要掌握正确的工具和方法,任何人都有可能做出颠覆性的贡献。
16小时攻破22年数学难题:GPT-5.6的证明之旅
Crouzeix猜想由法国数学家Michel Crouzeix于2004年提出,其核心内容为:对于任意矩阵和任意多项式函数,矩阵经函数作用后的范数不超过该函数在矩阵数值域上最大值的两倍。这个猜想表述简洁,但证明难度极高。2007年,Crouzeix本人仅证明了常数在11.08时成立;2017年,全球顶尖专家在美国数学研究所专题研讨会上苦战一周,才将常数降至2.414。此后,该问题再无实质进展。
金山木的解题路径完全颠覆了传统数学研究的方式。他没有进行任何纸笔推导,而是借助GPT-5.6-Sol模型在ChatGPT Work平台上开启了一场“自主探索”。他借鉴了OpenAI攻克Cycle Double Cover猜想时的提示词策略:要求模型在物理断网环境下进行纯粹原创思考;启动大量AI智能体沿不同路径发散探索并防止过早收敛;对候选策略进行对抗性审计;指令模型在获得完整证明前不得放弃。
设定完成后,金山木便离开,全程未进行任何干预。GPT-5.6-Sol在约16小时的自主运行中,经历了数万次假设、推翻与重建。最终,它给出了一个完整的证明。值得注意的是,AI并未采用人类预想中的繁杂硬估计,而是通过巧妙的采样策略简化出简洁的正性条件。这一结果让审阅论文的数学家们感到“震惊”。
这一案例也展示了大模型训练的最新成果——GPT-5.6-Sol不仅具备强大的推理能力,还能在长时间、多路径的探索中保持逻辑一致性。它是目前最令人印象深刻的科技产品之一,对数学研究产生了立竿见影的影响。
数学界震惊:AI的“非人类”证明思路
当金山木将证明手稿发给美国康奈尔大学数学家Alex Townsend和华盛顿大学数学系教授Anne Greenbaum时,两位专家起初抱持怀疑态度。但经过详细审阅,他们发现证明不仅正确,而且思路“出人意料”。Townsend和Greenbaum在公开发表的文章中写道,AI没有采用人类数学家通常使用的“硬估计”方法,而是通过一种巧妙的采样策略,将复杂的矩阵问题转化为一个简洁的正性条件。这种“非人类”的思维方式,恰恰是AI独特优势的体现。
更令人惊讶的是,猜想提出者Michel Crouzeix本人也审阅了论文手稿,并确认证明正确无误。这意味着,一个由人工智能生成的证明,得到了数学界最高级别的认可。
这一事件引发了数学界对AI能力的广泛讨论。传统上,数学证明被视为人类智力活动的巅峰,需要严谨的逻辑和创造性的洞察。而AI的介入,正在重新定义“创造力”的含义。许多数学家开始思考:如果AI能够发现人类从未想到的证明路径,那么未来的数学研究是否应该更多地依赖AI工具导航来辅助探索?
实际上,在金山木的预印本发布仅8天后,数学家Emiel Lorist和Felix Schwenninger发布了一篇仅5页的独立证明,思路截然不同。他们坦言,在探索证明策略时同样使用了ChatGPT 5.6。这种“AI辅助证明”正在成为新常态。
开源与协作:AI时代的科研新范式
金山木并没有将这一成果私有化。他将全部研究资料开源,在GitHub仓库中公开了最终论文、提示词、历次迭代手稿、Lean 4形式化证明代码及公理审计报告。这种开放态度,恰恰体现了人工智能时代科研协作的新范式。
开源意味着任何人都可以复现和验证这一证明过程。数学家们可以仔细审查AI的每一步推理,甚至可以从中学习新的证明技巧。同时,Lean 4形式化证明代码的存在,使得证明可以被计算机自动验证,极大地降低了人为错误的可能性。这种“人机协作”的验证流程,比传统同行评审更加高效和可靠。
不过,这一模式也带来了一些挑战。例如,AI生成的证明可能包含人类难以理解的步骤,如何确保其可解释性?另外,当越来越多的研究依赖AI完成时,如何界定贡献者?这些伦理问题正在成为学术界的焦点。
值得注意的是,这一案例并非孤例。2026年5月,OpenAI称其内部通用推理模型自主解决了匈牙利数学家Paul Erdős于1946年提出的平面单位距离问题。2026年8月初,OpenAI披露下一代模型Astra的内部版本已在10项数学与理论计算机科学难题上取得突破。此外,Anthropic于2026年8月11日宣布,其未公开的研究版Claude模型在尝试攻克黎曼猜想过程中,将黎曼ζ函数临界线上零点比例的已知下界从41.6%提升至67.2%。这些进展表明,人工智能正在成为数学研究的重要工具。
人工智能冲击波:数学研究的未来走向
金山木的突破,只是人工智能在数学领域应用的一个缩影。随着大语言模型能力的不断提升,越来越多的数学问题正在被AI攻克。从Crouzeix猜想到黎曼猜想,从平面单位距离问题到其他理论计算机科学难题,人工智能正在逐渐改变数学研究的版图。
这种变化意味着什么?首先,数学研究效率将大幅提升。传统上,一个数学难题可能需要顶尖数学家数年甚至数十年的努力;而AI可以在数小时内完成探索,大大缩短发现周期。其次,AI能够发现人类思维盲区中的解决方案——正如Crouzeix猜想证明中展现的巧妙采样策略,这可能会启发人类数学家产生新的思考方式。
但另一方面,这也引发了担忧:如果AI能够解决所有已知的数学难题,那么人类数学家的角色将如何转变?或许,未来的数学研究将不再是“发现问题-证明问题”的线性过程,而是“提出猜想-让AI验证-人类解释并推广”的协作模式。人类数学家将更多地扮演“提出问题者”和“意义赋予者”的角色。
对于普通用户来说,这些前沿进展可能显得有些遥远。但事实上,类似的AI能力已经开始渗透到日常使用的科技产品中。例如,AI画图工具已经能够根据文字描述生成精美图像,文生图技术正在改变设计行业的工作流程。而像AI工具箱这样的平台,更是将各种AI能力集成在一起,让每个人都能轻松使用。
伦理与启示:我们该如何与AI共舞?
金山木的案例令人振奋,但也引发了一系列伦理问题。当AI能够独立完成数学证明时,我们如何确保其可靠性?虽然金山木的证明得到了多位数学家的确认,但未来如果AI生成的证明过于复杂,人类无法理解,我们该如何信任?
此外,学术成果的归属问题也值得探讨。金山木作为提示词设计者和实验发起者,无疑是这项研究的核心贡献者。但如果AI完全自主生成证明,那么“作者”是谁?OpenAI?还是AI本身?现行的学术评价体系尚未准备好应对这种变化。
另一个值得关注的点是,AI在数学领域的突破可能带来“技术鸿沟”。拥有强大AI资源的机构将更容易产出高水平成果,而资源匮乏的研究者可能被边缘化。如何确保AI工具的公平获取,是行业需要共同思考的问题。
不过,从积极的角度看,AI的普及也在降低科研门槛。金山木的例子表明,即使没有深厚的数学背景,借助适当的工具也能做出重要贡献。这为更多跨界创新提供了可能。
最后,这一事件也提醒我们,人工智能并非“万能钥匙”。金山木的提示词策略、对问题的精准理解,以及他主动离场让AI自主探索的“放手”心态,都是成功的关键因素。AI只是工具,真正决定成果价值的,还是人的智慧与判断。
在AI网名、艺术签名等日常应用之外,人工智能正在深刻改变人类知识生产的底层逻辑。作为科技媒体,我们应当持续关注这一趋势,并引导公众理性看待AI的能力与局限。