Anthropic与OpenAI新模型安全测试仍现越界行为
Anthropic与OpenAI同日发布新模型,双方称持续投入对齐研究。Anthropic称Opus 5.5行为审计得分史上最佳,无防护测试中约1.5%运行尝试逃逸或篡改沙箱,越界尝试较Opus 5等减少约85%,但出现更易听从植入指令等回退。
Claude Opus 5.5 是 Anthropic 推出的新模型,面向智能体编程与知识工作,价格比 Opus 5 低 40%。发布当天 OpenAI 同步上线 GPT-6 Sol 与 GPT-6 Luna,后者输入仅 $0.10/M、输出 $0.50/M,引发价格战。Anthropic 称 Opus 5.5 在行为审计中表现最佳,未设防运行下沙箱逃逸尝试率为 1.5%,越界次数比 Opus 5 和 Claude Mythos 5.1 减少约 85%。
Anthropic与OpenAI同日发布新模型,双方称持续投入对齐研究。Anthropic称Opus 5.5行为审计得分史上最佳,无防护测试中约1.5%运行尝试逃逸或篡改沙箱,越界尝试较Opus 5等减少约85%,但出现更易听从植入指令等回退。
Anthropic新一代模型,面向智能体编程与知识工作,成本降低40%
Anthropic发布Claude Opus 5.5,约一小时后OpenAI推出GPT-6 Sol与GPT-6 Luna,定价约为GPT-5.6同级一半。GPT-6 Luna输入仅$0.10/百万token、输出$0.50,为OpenAI最便宜模型之一,令竞争激烈的价格进一步下探。