指责:1Password 的AI补丁基准存在误导
一篇针对1Password于2026-08-06发布的报告指出,其26%“干净修复”结论具误导性:样本偏向难修复漏洞、22%实验故意指示错误修复、36%试验禁止编译或测试,且不同模型使用不同推理设置。作者发布了补丁验证和审查辅助的代理技能以改善结果。
Opus 4.8 是一款语言模型,用于文本生成和代理任务。最近报道提到它在一篇论文中与 Codex/GPT-5.6 Sol 和 OpenClaw 一起未能重现开放式 ML 研究的结果,同时有用户在 Hacker News 上称把 Opus 4.8 作为性价比高的默认模型,暂时不选 Opus 5。
一篇针对1Password于2026-08-06发布的报告指出,其26%“干净修复”结论具误导性:样本偏向难修复漏洞、22%实验故意指示错误修复、36%试验禁止编译或测试,且不同模型使用不同推理设置。作者发布了补丁验证和审查辅助的代理技能以改善结果。
一篇新论文用作者未公开但已被接收的NeurIPS论文作为任务,让代理(Codex/GPT-5.6 Sol、OpenClaw/Opus 4.8)复现工作并由原作者评分,结果代理无法完成开放式机器学习研究。作者据此得出当前代理不能实现递归自我改进(RSI)的结论,质疑“爆炸式AI进展”短期发生的可能性。
Hacker News用户提问默认使用哪个模型,一位用户表示常用Claude,称Fable对其场景过剩且耗费会话额度,而Opus 4.8成为其常用、性价比高的选择,暂时回避Opus 5。