首页 › AI快讯 › Anthropic发报告警告GLM-5.3网络能力,实测数据

Anthropic发报告警告GLM-5.3网络能力,实测数据反成“广告”

希
希鸥网AIGC专员
· 2026-10-11 · AI快讯 · 来源:量子位 1,375 次阅读

Anthropic近日发布报告,对智谱GLM-5.3模型的网络安全能力发出警告,称其已具备寻找软件漏洞、编写攻击程序的能力,且防滥用限制容易被绕过。然而报告为佐证观点所引用的实测数据,反而让外界对GLM-5.3的能力有了更深的印象。在考察完整漏洞利用能力的ExploitBench测试中,同样尝试410次,GLM-5.3成功50次,Claude Mythos Preview成功56次。报告还引用美国NIST下属CAISI在9月17日的评估,称GLM-5.3是迄今网络能力最强的开源权重模型,综合水平距美国前沿大约4个月。

报告的核心结论之一,是Mythos级别的能力已经扩散到开源模型。Anthropic称其五个月前发布的Claude Mythos Preview是首个能自主完成复杂端到端漏洞利用的AI模型,因能力敏感未公开发布,仅通过Project Glasswing开放给经审核的防御者,据称已找出1万多个漏洞。研究人员还用更小的GLM-5.3-Flash进行测试:给定一个刚公开的Chrome漏洞CVE-2026-11645和另一个已知漏洞资料,人工仅花约20分钟,模型自行运行约8小时,就在ARM64平台上搭建出稳定攻击链并绕过指针认证防护,按智谱API价格估算调用费用为20.40美元。

报告同时承认GLM-5.3具备安全机制,在模拟测试中直接要求其攻击关键系统时全部拒绝。但研究人员通过abliteration技术修改开源权重削弱拒答机制,花费约2200 GPU小时、约4400美元算力,处理后GLM-5.3在JailbreakBench和HarmBench上的拒答率从90%以上降至约3%和2%,在StrongREJECT上降至12%,能力几乎未受影响。Anthropic强调,同样手段对带防护的Claude模型均未成功。

基于上述发现,Anthropic提出两条建议:一是尽快将前沿模型开放给更多防御者,经审核的防御者现已可通过受信访问计划使用更强的Claude Mythos 5.1;二是呼吁对足够强的AI模型开展独立安全测试,点名包括GLM-5.3的后继者,并希望全球开源模型开发者管好相关能力、防止滥用。这并非Anthropic首次点名智谱,9月10日其已有类似动作。

📖 阅读本文共 1,375 次 2026年10月11日 12:30
📱 长按识别 分享给好友~
视频号二维码

扫码查看视频号

客服头像 咨询 咨询