第 2026-09-19 期 · 行业追踪 · 研究 · 安全

新安全基准测试显示主流AI模型难以拒绝危险机器人指令

新安全基准测试显示主流AI模型难以拒绝危险机器人指令

RoboHarm基准测试显示,主流AI模型在控制机器人时通常尝试执行危险任务而非拒绝。GPT-6 Astra在20次试验中17次刺伤婴儿玩偶,Claude Fable 5.1将压缩空气罐放在燃烧的炉子上。三款模型均未能可靠拒绝不安全指令。

The Decoder24 小时前
查看原文 ↗