Qwen3.8-Flash-Next

3 篇报道

Qwen3.8-Flash-Next 是一个用于推理的开源大型语言模型变体,强调长上下文支持与本地部署优化。近期报道集中在把 KV cache 卸载到 RAM(3×3090 实现 1M 上下文、短上下文 ~80 tok/s、长上下文 ~60 tok/s、248k 预填充时 3,701 tok/s)、在 12GB RTX 4070+64GB RAM 上通过量化、n-gram SSD 卸载和 MTP 补丁将生成速度从 ~6 tok/s 提升到近 20 tok/s,以及在 MLX-serve 上用 M5 Max、8-bit KV cache 宣称支持 1M 上下文并需约 117GB 峰值内存。

相关话题
已经到底了