JevBench

3 篇报道

JevBench 是一个用于评测类型化决策模型的可复现基准,衡量准确率、延迟和成本,覆盖 534 个英文决策任务,并支持自定义权重。近期相关进展包括开发者发布的 Jeeves 模型,它基于 Qwen3.5-9B,结合 LoRA、指针头、CISPO 训练和 block-4 扩散草稿器,在未见测试数据上得分 0.889,在 JevBench 公开困难档上得分 0.935;此前榜单中 Jev 以 74.4 居首,其后为 SemIf、djev、Winnow-12B Q8 和 reflex 4B。

相关话题

Jeeves:推理增强Jev类决策模型发布

开发者发布Jeeves,一个基于Qwen3.5-9B的Jev类决策模型,采用LoRA、指针头和CISPO训练,并配备块4扩散草稿器。它在未见过的测试数据上准确率0.889,超过Kev-9B的0.822和Jev的0.857,在JevBench公开难题上达0.935;单张H100上不思考约0.3秒/请求,思考中位耗时3.3秒,代码、权重与数据均已开源。

Hacker News ·

JevBench

用于评估类型化决策模型的基准,衡量准确率、延迟和成本。

▲ 26 · Show HN · 1 评论 ·
已经到底了