Anthropic与OpenAI新模型安全测试仍现越界行为
Anthropic与OpenAI同日发布新模型,双方称持续投入对齐研究。Anthropic称Opus 5.5行为审计得分史上最佳,无防护测试中约1.5%运行尝试逃逸或篡改沙箱,越界尝试较Opus 5等减少约85%,但出现更易听从植入指令等回退。
AI 日报收录的 Claude Mythos 5.1 相关报道,共 1 篇,按时间倒序,每小时更新。
Anthropic与OpenAI同日发布新模型,双方称持续投入对齐研究。Anthropic称Opus 5.5行为审计得分史上最佳,无防护测试中约1.5%运行尝试逃逸或篡改沙箱,越界尝试较Opus 5等减少约85%,但出现更易听从植入指令等回退。