可将Qwen3.8-Flash-Next大部分KV缓存外置至RAM
一位vLLM用户在r/LocalLLaMA分享可把Qwen3.8-Flash-Next的大部分KV缓存放到系统内存、仅在显存中保留少量量化权重的做法,称在3×3090上实现1M上下文并在短上下文下约80 tok/s,长上下文稳定在约60 tok/s,预填充248k时达3701 tok/s并提供了补丁与模型链接。
Qwen3.8-Flash-Next 是一个用于推理的开源大型语言模型变体,强调长上下文支持与本地部署优化。近期报道集中在把 KV cache 卸载到 RAM(3×3090 实现 1M 上下文、短上下文 ~80 tok/s、长上下文 ~60 tok/s、248k 预填充时 3,701 tok/s)、在 12GB RTX 4070+64GB RAM 上通过量化、n-gram SSD 卸载和 MTP 补丁将生成速度从 ~6 tok/s 提升到近 20 tok/s,以及在 MLX-serve 上用 M5 Max、8-bit KV cache 宣称支持 1M 上下文并需约 117GB 峰值内存。
一位vLLM用户在r/LocalLLaMA分享可把Qwen3.8-Flash-Next的大部分KV缓存放到系统内存、仅在显存中保留少量量化权重的做法,称在3×3090上实现1M上下文并在短上下文下约80 tok/s,长上下文稳定在约60 tok/s,预填充248k时达3701 tok/s并提供了补丁与模型链接。
作者在RTX 4070(12GB VRAM)+64GB内存环境下,通过量化、ngram SSD卸载、--fit 参数和MTP补丁等优化,将Qwen3.8-Flash-Next的生成速度从6 tok/s 提升接近20 tok/s,PP约300–350 tok/s。文中列出具体补丁与权衡细节。
Qwen3.8-Flash-Next 在 MLX-serve 上实现百万级上下文支持,作者用 M5 Max 与 8-bit kv 缓存演示约760k上下文并称可维持1M上下文、生成速率约40–75 tok/s。