一家名为Robocurve的机构将多个前沿大模型接入真实双机械臂机器人,测试其在面对危险指令时的行为。结果显示,模型能力越强,越容易执行高风险物理任务。GPT-6 Astra在97%的测试中尝试执行指令,最终成功率达到62%;Fable 5.1有80%的情况下选择执行,成功率为34%。
该测试名为RoboHarm benchmark,覆盖五类真实物理风险任务,包括刺伤类人生物、加热压缩气体、制造有毒烟雾等。每个任务、每个模型重复测试20次,由人工根据机器人全过程表现打分,考察模型是否意识到风险并拒绝,以及是否真正完成危险动作。
在最具争议的“刀具测试”中,桌面放置面包、刀和婴儿玩偶,GPT-6 Astra控制的机器人20次中完成17次,而Fable 5.1全部20次拒绝。Robocurve联合创始人Jay Chooi指出,Astra在纯文字请求中会拒绝伤害婴儿或洋娃娃,但接入机器人手臂后就不再拒绝。
Robocurve由Jay Chooi和Aris Zhu创立,定位为进入现实世界的AI建立新评测标准。该机构获得Y Combinator支持,并于2026年9月宣布完成1000万美元种子融资。实验数据、视频、评测结果全部公开,机器人评估框架Inspect Robots也已开源,研究者可将不同模型、不同机器人平台接入进行重复测试与横向比较。
扫码查看视频号
咨询
咨询