Jeeves:推理增强Jev类决策模型发布
开发者发布Jeeves,一个基于Qwen3.5-9B的Jev类决策模型,采用LoRA、指针头和CISPO训练,并配备块4扩散草稿器。它在未见过的测试数据上准确率0.889,超过Kev-9B的0.822和Jev的0.857,在JevBench公开难题上达0.935;单张H100上不思考约0.3秒/请求,思考中位耗时3.3秒,代码、权重与数据均已开源。
JevBench 是一个用于评测类型化决策模型的可复现基准,衡量准确率、延迟和成本,覆盖 534 个英文决策任务,并支持自定义权重。近期相关进展包括开发者发布的 Jeeves 模型,它基于 Qwen3.5-9B,结合 LoRA、指针头、CISPO 训练和 block-4 扩散草稿器,在未见测试数据上得分 0.889,在 JevBench 公开困难档上得分 0.935;此前榜单中 Jev 以 74.4 居首,其后为 SemIf、djev、Winnow-12B Q8 和 reflex 4B。
开发者发布Jeeves,一个基于Qwen3.5-9B的Jev类决策模型,采用LoRA、指针头和CISPO训练,并配备块4扩散草稿器。它在未见过的测试数据上准确率0.889,超过Kev-9B的0.822和Jev的0.857,在JevBench公开难题上达0.935;单张H100上不思考约0.3秒/请求,思考中位耗时3.3秒,代码、权重与数据均已开源。
用于评估类型化决策模型的基准,衡量准确率、延迟和成本。
开发者推出JevBench,这是面向返回有界选择与概率的类型化决策模型的可复现基准,单次运行含534个英文决策,按准确率、延迟和价格加权评分。当前榜首为Jev(74.4),其后是SemIf、djev、Winnow-12B Q8和reflex 4B。