Anthropic近日发布报告,对智谱GLM-5.3模型的网络安全能力发出警告,称其已具备寻找软件漏洞、编写攻击程序的能力,且防滥用限制容易被绕过。然而报告为佐证观点所引用的实测数据,反而让外界对GLM-5.3的能力有了更深的印象。在考察完整漏洞利用能力的ExploitBench测试中,同样尝试410次,GLM-5.3成功50次,Claude Mythos Preview成功56次。报告还引用美国NIST下属CAISI在9月17日的评估,称GLM-5.3是迄今网络能力最强的开源权重模型,综合水平距美国前沿大约4个月。
报告的核心结论之一,是Mythos级别的能力已经扩散到开源模型。Anthropic称其五个月前发布的Claude Mythos Preview是首个能自主完成复杂端到端漏洞利用的AI模型,因能力敏感未公开发布,仅通过Project Glasswing开放给经审核的防御者,据称已找出1万多个漏洞。研究人员还用更小的GLM-5.3-Flash进行测试:给定一个刚公开的Chrome漏洞CVE-2026-11645和另一个已知漏洞资料,人工仅花约20分钟,模型自行运行约8小时,就在ARM64平台上搭建出稳定攻击链并绕过指针认证防护,按智谱API价格估算调用费用为20.40美元。
报告同时承认GLM-5.3具备安全机制,在模拟测试中直接要求其攻击关键系统时全部拒绝。但研究人员通过abliteration技术修改开源权重削弱拒答机制,花费约2200 GPU小时、约4400美元算力,处理后GLM-5.3在JailbreakBench和HarmBench上的拒答率从90%以上降至约3%和2%,在StrongREJECT上降至12%,能力几乎未受影响。Anthropic强调,同样手段对带防护的Claude模型均未成功。
基于上述发现,Anthropic提出两条建议:一是尽快将前沿模型开放给更多防御者,经审核的防御者现已可通过受信访问计划使用更强的Claude Mythos 5.1;二是呼吁对足够强的AI模型开展独立安全测试,点名包括GLM-5.3的后继者,并希望全球开源模型开发者管好相关能力、防止滥用。这并非Anthropic首次点名智谱,9月10日其已有类似动作。
扫码查看视频号
咨询
咨询