北京智源人工智能研究院近日发布了第二代AI安全基准——Safety Benchmark 2.0,旨在更全面地评估大模型在真实应用场景中的安全性。该基准在原有基础上进行了重大升级,新增了多模态安全、智能体安全等维度的测试,覆盖了图像、音频、视频等多种输入形式,以及工具使用、代码执行等复杂交互场景。

Safety Benchmark 2.0 构建了超过2万条高质量的安全测试样本,并采用人工与自动化结合的方式进行标注与评估。其评估体系不仅关注模型输出内容的有害性,还考察了模型在面临恶意诱导、对抗攻击时的鲁棒性,以及其在执行任务时可能引发的间接安全风险。智源研究院表示,该基准的发布旨在为AI开发者提供更精准的安全体检工具,推动大模型技术向更安全、更可信的方向发展。