爱因斯坦测试:AI能够复刻伟大的科学突破吗?科学家正在探究,基于历史数据训练的语言模型,能否复刻具有创造性的科学突破。
1915年,Albert Einstein提出广义相对论,彻底改变人类对物质世界时空构造的认知。该理论将引力解释为质量引发的时空形变,是现代物理学的一座巅峰。它构成宇宙学的理论根基,支撑着从黑洞研究到引力波探测的各类工作,也常态化用于航天任务与GNSS的导航计算。
这一理论如今也成为人工智能领域从业者的评判标尺:他们想知道,人工智能能否做出同等量级的科学突破。今年2月,在新德里举办的印度人工智能峰会上,伦敦Google DeepMind联合创始人Demis Hassabis提出设想:用截止到某一时间点(他提议以1911年为界)之前的全部已知知识训练大语言模型(Large language model, LLM),看它能否推导出广义相对论。“这会是对通用人工智能(Artificial general intelligence, AGI)的一次很好的测试。”Demis Hassabis说道。这里所说的通用人工智能概念尚没有清晰定义,却是很多AI从业者的奋斗目标。
不少科研团队已经开展这类“复古模型”实验,只用特定年代之前的历史文本训练模型,尝试复现量子力学、相对论等成果。但实验结果表明,当前大语言模型距离实现真正的创造性科学飞跃仍有很大差距。部分模型虽偶尔闪现出接近正确物理概念的片段,但大多只是复述文本中的词句,并没有真正理解背后的物理逻辑,还容易出现知识泄露问题,很难彻底隔绝时间节点之后的信息干扰。
从思维逻辑上看,现代AI擅长归纳推理,从海量数据里寻找统计相关性,完成整理资料、验算推导这类重复性科研工作。但做出相对论级别的突破,依靠的是溯因推理(abductive reasoning)——也就是依靠少量异常现象,产生全新的创造性猜想,也就是Thomas Kuhn所说的范式转换(paradigm shifts)。人类科学家可以抓住少数和现有理论不符的反常现象,长期执着地钻研异常线索,从稀疏信息中搭建解释世界的世界模型(world model)。而大语言模型倾向对数据做统计平均,很容易直接忽略掉宝贵的异常信号。
相关模拟实验也印证了这一点:给AI输入多套行星运行的合成数据,模型并不会总结出普适的万有引力定律,反而会为每一套行星系统生成各不相同的错误规律。即便是AI取得成功的数学突破,也大多是整合已有文献内的思想,并非无中生有的全新洞见。同时AI还难以评判哪些猜想值得深入钻研,经常生成大量五花八门的假说,却无力筛选甄别真正具备科学价值的理论。
当然研究者并不全盘否定AI的科学潜力。AI在辅助实验、数据处理、模拟演算上已经展现强大实力。要想让AI真正实现颠覆性科学发现,不能只靠文本语料训练,还需要让模型学习真实物理世界与数学逻辑;评价体系也不能只追求预测准确率,还要奖励理论的简洁性、解释广度等科学特质。
不过,AI复刻人类天才式的思想跃迁,还面临巨大障碍。很多科学革命不来源于新数据,而是源于研究者认知视角的转变。这类难以言说的直觉顿悟,恰恰是现阶段人工智能的短板。正如研究者Jacob Andreas所说,如今的AI更适合在已知问题框架内做拓展,很难诞生像相对论那样,让世人不禁发问“这一想法究竟从何而来”的革命性成果。
AI会成为科研得力助手,但人类独有的洞察力、对反常现象的执着,依旧是催生重大科学突破不可替代的力量。
基于发表于《Nature》657,338‑340(2026)文章整理改写。DOI:网页链接‑026‑02804‑2
