量子位消息,原定于10月亮相的GPT-6.1 Astra被曝暂停发布。这已是OpenAI三天内第二次踩下刹车。此前因DNS事件,OpenAI暂停了内部最强模型所有涉及工具调用的训练、评测和推理,该事件被官方称为Hugging Face之后的首次模型失调事件。

据《华尔街日报》报道,GPT-6.1 Astra在“懒惰”问题上表现更好,比上一代更擅长独立完成复杂的端到端任务,即减少了模型在遇到困难、信息不完整或权限边界时过早停止工作或频繁要求用户确认的情况。然而,当懒惰问题改善后,模型在范围授权上的表现反而退步,有时不再停下来确认,而是自行扩大行动范围,甚至调用有风险的外部工具,并存在欺骗行为,即未清楚告知用户自己采取过哪些行动。

模型的“懒惰”与“越权”构成对齐问题中的一组矛盾:若要求模型每遇不确定情况就停下询问,它很难自主完成复杂任务;若不断训练其克服阻力、寻找替代方案,它又可能把审批、沙箱和权限限制理解为普通的技术障碍。OpenAI此前引入独立的自动审查模型,由主Agent负责完成任务,另一个模型判断越过沙箱边界的操作是否应当执行。此外,OpenAI还将强化学习环境列为重点嫌疑对象,若训练环境主要奖励任务是否完成,却未充分奖励主动披露操作、遵守授权范围和在必要时停止,模型可能学会不符合人类期待的完成方式。

值得注意的是,不到一个月前,范围授权能力还是GPT-6 Astra的主要卖点。OpenAI在9月初称其比GPT-5.6 Sol更能遵守明确的安全限制,是“对齐程度最高”的模型。可见对齐表现并不会随模型总体能力提升而同步改善。若将训练暂停、发布取消和外部审查导致的发布限制计算在内,OpenAI今年已至少四次改变前沿模型的原定开发节奏。