今天openai宣称解决了千禧年七大数学难题之一。这让我想起了上个月,北大的刘济豪,利用他们自己编写的Danus系统(实际上是一个极其复杂的提示词集合,skill),结合市面上的人工智能,譬如chatgpt,claude,给一个十分著名的猜想,丘成桐-田刚-唐纳森猜想,构造了一个反例。这个反例不是有限的例子,依然涉及无穷情况,所以需要详细的论证过程。令人震撼的是他们这个提示词系统,Danus。这是一大堆数学家合作构造的。
它能啃下这种涉及无穷情况的硬骨头,关键在于完美解决了“幻觉”的老问题:通用大语言模型推导步骤一长,就容易前言不搭后语、凭空臆造。
Danus没有让单个模型去硬猜答案,而是把整个推理流程拆成了一个由数学逻辑主导的工作流,核心是一套严密的“事实图谱”记忆与分工机制。
全局调度:主智能体不参与具体运算,只负责把庞大的命题拆解为互不干扰的推演分支,规划探索路径。并行探索:多个工作智能体在不同路线上同时推进,负责具体的代数推演、反向推导与候选对象构造。独立严审:中间步骤不会直接被采信,必须经过无状态验证模块的逐行核查;只有逻辑上无懈可击的引理,才会被写入事实图谱作为后续推导的基石。
三方面密切配合协作。
这个提示词系统极其复杂,叹为观止。
最有意思的是,他们同时也让其他市面上的大模型证明这个问题。但是无一成功。而Danus一击即中。
最近Claude成功将费马大定理的证明全盘机器验证,也是借助了一个关键的Prove2Me系统,这个系统跟Danus很类似。也是一群数学家和计算机学家编写的。
实际上人工智能,包括openai,解决猜想,也不是一键生成。后面也往往是专业的数学家在操作、引导。而他们出于宣传的好处,往往对这些方面避而不谈。
对比openai之前解决一些数学猜想时公布的提示词,就能看出数学家的专业性和优势。这种优势有时候能弥补甚至超越算力的不足。绝大部分数学家对人工智能还没有回过味来,随着时间的推移,我相信,数学家会更加拥抱AI,更能充分发挥它的优势。
当然了,数学家只要是还使用这些公开的人工智能系统。这些东西,也会被AI公司吸收。所以本地部署和隐私问题,也许会更值得引起数学家的重视。
OpenAI今天又宣传解决了千禧年数学难题NS方程解的存在性。他们还没有公布详细论文。目前只是公布了Lean的机器验证和一篇欧拉简化情况的论文。
这个事情本身注定是个大新闻。openai这个打法,把数学家打得有点措手不及。因为它连传统的审稿阶段都省了,直接机器验证就公开宣布了。之前claude 也传言已经解决这个猜想。据说是已经完全写出了论文,正在让数学家审核。他们这个打法还是更传统更讲武德一些。
无论如何,这件事会给数学的悠久传统与荣誉归属都带来很大的冲击。
几百年前的数学家,譬如牛顿、高斯,往往会对自己的idea,守口若瓶。藏得很深,在思考完善之前都拒绝发表。也因此引起过无数纷争。
AI的发展,让我们有可能重温一段老路。
后续情况,让我们紧密跟踪,拭目以待。