可将Qwen3.8-Flash-Next大部分KV缓存外置至RAM
一位vLLM用户在r/LocalLLaMA分享可把Qwen3.8-Flash-Next的大部分KV缓存放到系统内存、仅在显存中保留少量量化权重的做法,称在3×3090上实现1M上下文并在短上下文下约80 tok/s,长上下文稳定在约60 tok/s,预填充248k时达3701 tok/s并提供了补丁与模型链接。
AI 日报收录的 qwen4_exp 相关报道,共 1 篇,按时间倒序,每小时更新。
一位vLLM用户在r/LocalLLaMA分享可把Qwen3.8-Flash-Next的大部分KV缓存放到系统内存、仅在显存中保留少量量化权重的做法,称在3×3090上实现1M上下文并在短上下文下约80 tok/s,长上下文稳定在约60 tok/s,预填充248k时达3701 tok/s并提供了补丁与模型链接。