Anthropic 旗下 Claude 系列模型一直严格禁止生成露骨色情内容,然而 TechCrunch 近日进行的一系列测试却意外发现,突破这一限制似乎并不困难。测试结果显示,通过特定的提示词或对话策略,用户能够轻易引导 Opus 4.6 模型产出违规内容。

这一发现引发了关于 AI 安全机制有效性的新一轮讨论。Anthropic 尚未对此事作出正式回应,但业内专家指出,随着大模型能力的持续提升,如何在开放性与安全性之间取得平衡,正成为整个行业面临的共同挑战。