如果把AI送回1911年,只让它掌握爱因斯坦当时所能了解的知识,它能否在4年后提出相对论?这个测验来自诺奖得主、Google DeepMind联合创始人哈萨比斯。他真正想考的是,AI能否仅凭1911年的知识水平,直面当时的物理难题,自己提出一套新的解释框架,完成超出训练材料的推理,而不是照着答案复读。若能实现,这将成为检验AGI的一项有力测试。

今年3月,独立研究者Michael Hla把知识截止时间进一步提前到1900年,从零训练了一个33亿参数的Transformer语言模型GPT-1900。其预训练材料来自1900年以前的书籍和报纸,总计约220亿token,另收集2600多部历史物理书籍、期刊和科学著作形成约2.9亿token的物理语料。Hla还专门清理了可能泄漏答案的数据,凡出现“爱因斯坦”“量子力学”“相对论”等现代概念的文献整份删除。

在光电效应测试中,GPT-1900竟吐出一段与爱因斯坦1905年论文高度相似的论述:光可能不是连续的,而是由许多彼此分离、频率不同的部分组成。Hla将其形容为“直觉的闪现”。但他坦言,GPT-1900距离“重新发现光量子”还有很远,它在大多数物理任务上都失败,亮眼回答高度依赖人类整理好的问题和提示,可能只是模型在拼接合理词句,谈不上形成可靠的物理理解。

Nature在最新研究中梳理了这些尝试,并指向一个比“AI有没有答对”更难的问题:AI究竟能不能创造真正的新idea,以及它距离成为一名科学家还差什么。这场实验最终没有诞生“AI爱因斯坦”,那个号称封闭在1900年的知识世界,也没有完全挡住现代AI的影响。