Claude没解开黎曼猜想,却把37年未动的数学纪录推进一大步
一、发生了什么
8月10日,Anthropic发布研究博客,披露一个未发布的研究版Claude挑战黎曼猜想的结果。模型没有解决猜想本身,却把黎曼ζ函数满足黎曼猜想的零点比例下界从41.6%推进到67.2%。
黎曼猜想由德国数学家黎曼于1859年提出,是克莱数学研究所2000年公布的千禧年难题之一,悬赏100万美元,至今无人证明或证伪。41.6%的下界长期未被超越,多家媒体称这次推进刷新了保持37年的数学纪录。
新智元以“突发,Claude首破黎曼猜想新纪录”为题报道,阅读量超过10万,机器之心、量子位等账号跟进。媒体标题差异提醒读者先校准口径,Claude没有证明黎曼猜想,它改变的是一个相关问题的纪录。
二、信息增量在哪里
信息增量不在“AI接近证明黎曼猜想”,而在两个层面。
第一层是研究过程。Anthropic员工贾里德·萨姆纳(Jarred Sumner)并非数学家,他要求Claude挑战黎曼猜想,并把数学选择完全交给模型。Claude最初生成并尝试了650个想法,全部失败。随后它协调约60个子智能体协作研究了一天半,运行2400条shell命令,编写数百个Python脚本,两次测试共消耗3100万输出Token。子智能体对已知ζ零点做了数千次数值检验,相互审查证明,从arXiv下载54篇论文查重,并独立重新证明了结果。
第二层是结果验证。Anthropic的两位数学家Levent Alpöge和Ralph Furman研究并验证了论文。Claude与员工Eric Easley合作完成Lean形式化证明,并通过验证工具。数论专家Brian Conrey和Dan Goldston短期审查了论文。这比一次无法复现的模型演示更接近学术流程。
三、对程序员和AI用户的直接意义
对程序员,这次实验把Claude Code从编码助手推成研究执行环境。多智能体分工、数值检验、文献查重和形式化证明可以在一次任务里串联,提示词的作用从下指令变成定方向和持续鼓励。
对AI用户,需要区分能力与兑现。模型能推进一个保持37年的数学下界,不代表它能解决同类难题,更不能据此推断通用推理能力全面超过人类。牛津大学数学家詹姆斯·梅纳德(James Maynard)认为,新结果提供了真正的新想法,是AI做出的有趣数学贡献。麻省理工学院数学家安德鲁·萨瑟兰(Andrew Sutherland)评价,这进一步证明AI能做有趣的数学研究,而不只是解决喂给它的具体问题。
四、暂时不能推出的结论
有四条结论暂时不能推出。
不能推出AI即将证明黎曼猜想。梅纳德表示,即使非常乐观,现有方法也没有通向解决猜想本身的路径。不能把下界纪录等同于破解难题,即使把比例推到100%也拿不到百万美元奖金,因为那仍不排除少量零点偏离临界线。不能把单一供应商的一次实验结果推成行业能力。不能把结果失败但副产品成功当成可控流程,650个失败想法说明发现带有运气成分。
五、后续观察什么
后续观察四个点。论文的同行评议和Lean形式化验证结论能否公开。67.2%之后是否有数学家或后续模型在此基础上继续推进。多智能体研究方式能否在代数几何、数论之外复现。未公开研究版模型的数学能力与正式发布版本之间的差距有多大。
参考资料
- Anthropic:Learning more about Claude's mathematical capabilities
- 科学网转引澎湃新闻:Anthropic挑战黎曼猜想失败,但意外刷新一项数学纪录
- Scientific American:No, Anthropic's AI didn't just solve math's hardest problem
- IT之家:未公开的新模型“立功”,Anthropic宣布Claude攻克黎曼猜想取得重大突破
- 网易:Claude挑战黎曼猜想失败,却刷新了沉寂数十年的数学下界
- 36氪英文版:Claude Fails Riemann Hypothesis Challenge But Unexpectedly Sets New 37-Year Mathematical Record