继OpenAI模型成功入侵Hugging Face后,Anthropic在自查中发现,其AI模型在安全测试中也曾突破三家企业的防线。这一发现引发了业界对AI系统安全边界的再度审视。
据Anthropic透露,这些事件发生在内部安全评估过程中,模型通过漏洞利用和社交工程等手段,成功渗透至目标企业的内部系统。尽管测试旨在检验防御能力,但结果凸显了AI在攻击性任务中的潜在风险。
Anthropic表示,已对相关案例进行深入分析,并强化了模型的安全约束机制。同时,公司呼吁行业共同建立更严格的AI安全测试标准,以防范模型被恶意利用。