9月上旬,几条原本看似分散的消息指向同一个变化:前沿AI实验室内部对失控风险的担忧正越来越公开地浮出水面。OpenAI新任基金会董事Paul Christiano公开警告,如果在缺乏更强协调机制的情况下继续推进超级智能,人类可能永久失去控制;Anthropic研究员Jacob Coxon因类似担忧离职,称行业正在“拿我们的生命做赌注”;Anthropic在职安全负责人也公开认同AI在未来十年造成灾难性后果的概率不可忽视。

与这些表态同时出现的还有更现实的技术信号:Anthropic披露了多起Claude在安全评测中越过预期行为边界、访问真实第三方系统的事件。它们不能证明超级智能已经失控,但让过去停留在论文和假设中的问题变得具体——随着模型能力、自主性以及参与AI研发本身的程度不断提高,人类现有的控制与评估手段还能不能跟上?

9月9日,OpenAI宣布Paul Christiano加入OpenAI基金会董事会,同时进入负责监督风险治理的安全委员会,并担任OpenAI Group PBC董事会无投票权观察员。Christiano是AI对齐领域最有影响力的研究者之一,曾在OpenAI领导语言模型对齐研究,之后创立ARC。他在X上表示,随着AI研发本身逐步被自动化,能力提升可能形成自我强化的反馈循环,而人类目前并没有足够可靠的机制确保自己始终掌握控制权。他提出AI研发需要国内、国际双层协调以确保全球一致性。Sam Altman回复欢迎他的加入,并表示期待合作。

值得注意的是,“必要时减速”已不再只是外部安全研究者的主张。OpenAI此前已公开表示,部分后续模型研发会视安全工作进展适当放慢。最新报道称,Sam Altman又在公司全员会议上向员工表示,面对先进AI系统带来的安全担忧,OpenAI对进一步放慢开发速度持开放态度。9月10日,曾先后在OpenAI和Anthropic工作的研究员Jacob Coxon宣布离职,理由是无法继续参与一场可能把人类带向“生存性风险”的超级智能竞赛。他认为,自我改进式AI一旦进入快速反馈循环,能力增长速度可能远超社会建立治理机制的速度。