为 Artificial Analysis 基准辩护的社区帖子
r/LocalLLaMA 上的帖子为 Artificial Analysis 的聚合基准辩护,指出其方法与开销,并举例 Deepseek 与 Qwen、GPT-6 在不同子评测上的差异。
Fable 5.1 是 Claude 系列的一个模型版本,用于生成与推理任务。近期报道讨论它在 Artificial Analysis 聚合基准中的表现(与 Deepseek、Qwen、GPT‑6 在子基准上的差异)、与 Cognition 的 SWE‑2 在 FrontierCode 1.1 Main 上分数接近(相差不到 1 分、SWE‑2 宣称成本低 64%),以及 Arena.ai 指出相较 Fable 5 更直白但更冗长。
r/LocalLLaMA 上的帖子为 Artificial Analysis 的聚合基准辩护,指出其方法与开销,并举例 Deepseek 与 Qwen、GPT-6 在不同子评测上的差异。
Cognition发布SWE-2,称在FrontierCode 1.1 Main取得50.0分,接近Fable 5.1但成本低64%;基于2.8T参数的Kimi K3进行后训练,采用单次RL训练多级推理以提升性价比。
Arena.ai对比Fable 5与Fable 5.1的数万条基准回复发现,Claude Fable 5.1在用语上更务实但也更冗长,反映模型风格的细微调整。