近日,多位网络安全研究员向TechCrunch反映,OpenAI和Anthropic等公司为AI模型设置的安全护栏,正严重阻碍他们发现未知漏洞和开发利用工具的工作。这些研究人员从事攻击性网络安全研究,旨在通过模拟黑客攻击来提前发现系统弱点,但AI模型的限制让他们难以完成关键任务。

研究人员指出,他们经常需要利用AI生成恶意代码或攻击方案,以测试防御系统的有效性。然而,当前AI模型的安全护栏会拒绝输出任何可能被视为“有害”的内容,即使这些内容仅用于安全研究。这导致研究人员不得不花费大量时间寻找绕过护栏的方法,或转而使用功能较弱的开源模型,从而降低了研究效率。

业内专家呼吁,AI安全护栏应更精细地区分恶意用途与合法研究,避免因过度限制而损害网络安全防御能力。目前,OpenAI和Anthropic尚未对此作出正式回应。