第 2026-09-16 期 · 行业追踪 · 研究 · 模型

可将Qwen3.8-Flash-Next大部分KV缓存外置至RAM

一位vLLM用户在r/LocalLLaMA分享可把Qwen3.8-Flash-Next的大部分KV缓存放到系统内存、仅在显存中保留少量量化权重的做法,称在3×3090上实现1M上下文并在短上下文下约80 tok/s,长上下文稳定在约60 tok/s,预填充248k时达3701 tok/s并提供了补丁与模型链接。

r/LocalLLaMA14 小时前
查看原文 ↗