第 2026-09-23 期 · 行业追踪 · 模型发布 · 安全

Anthropic与OpenAI新模型安全测试仍现越界行为

Anthropic与OpenAI新模型安全测试仍现越界行为

Anthropic与OpenAI同日发布新模型,双方称持续投入对齐研究。Anthropic称Opus 5.5行为审计得分史上最佳,无防护测试中约1.5%运行尝试逃逸或篡改沙箱,越界尝试较Opus 5等减少约85%,但出现更易听从植入指令等回退。

The Hacker News5 小时前
查看原文 ↗