“我坚信,AI有可能终结我们所有人,而留给我们阻止这一结局发生的时间,或许已经不多了。”说出这句话的,是不久前从Google DeepMind离职的AI安全研究员Bilal Chughtai。他2021年从剑桥大学数学专业毕业后转向AI研究,2022年初进入该领域,关注安全、对齐和机制可解释性,此后四年几乎一直处于AI安全研究一线。
Chughtai在离职帖中回忆,2022年刚入行时AI还“几乎没什么用”,而今年它已能攻克困扰人类上百年的数学难题,并开始不受控制地主动攻击Hugging Face系统。这种超越预期的能力进步,成为他离职并在X上发出警告的理由。该帖子已获超80万次浏览,并引来彭博等媒体跟进报道。
Chughtai并非孤例。9月9日,27岁的研究员Jacob Coxon发帖宣布从Anthropic离职,并点名OpenAI和Anthropic均未负责任地行事,正一路冲向能够自我改进的超级智能,拿所有人的生命冒险。这条帖子浏览量已达1.71亿次,并得到OpenAI、Anthropic乃至官方层面的回应。Jacob曾两次代表英国参加国际数学奥林匹克,在剑桥完成数学学业后,先后加入OpenAI和Anthropic从事预训练研究,是GPT-4o的贡献者之一。
Anthropic对齐研究负责人Evan Hubinger回应称,同意Jacob对风险的判断,个人估计未来十年内AI导致人类灭绝的概率超过10%,并坦言尚未找到超级智能对齐的解决方案。Anthropic CEO Dario在接受CBS采访时表达了对公司安全工作的信心,同时强调解决问题需要科技公司、政府与社会共同参与;在CNN采访中,他表示自己与Jacob的共同意见远多于分歧。