可将Qwen3.8-Flash-Next大部分KV缓存外置至RAM
一位vLLM用户在r/LocalLLaMA分享可把Qwen3.8-Flash-Next的大部分KV缓存放到系统内存、仅在显存中保留少量量化权重的做法,称在3×3090上实现1M上下文并在短上下文下约80 tok/s,长上下文稳定在约60 tok/s,预填充248k时达3701 tok/s并提供了补丁与模型链接。
vLLM 是一个用于在本地运行大语言模型并管理推理资源的软件框架,负责显存/内存调度与 KV cache 管理。近期报道聚焦于用 vLLM 将 Qwen3.8-Flash-Next 的大部分 KV cache 卸载到系统内存以在 3×3090 上实现 1M 上下文(短/长上下文约 80/60 tok/s,248k 预填达 3,701 tok/s)、对 Deepseek V4.1 Flash 的 safetensors 检验(约 748B 总量/552B base)以及劝诫爱好者别被 FOMO 驱动高价本地部署。
一位vLLM用户在r/LocalLLaMA分享可把Qwen3.8-Flash-Next的大部分KV缓存放到系统内存、仅在显存中保留少量量化权重的做法,称在3×3090上实现1M上下文并在短上下文下约80 tok/s,长上下文稳定在约60 tok/s,预填充248k时达3701 tok/s并提供了补丁与模型链接。
社区核查safetensors后指出,Deepseek V4.1 Flash主模型约551.566B参数(40层),FFN专家约543.582B,其他约7.984B;另有约196.929B的engram、14.225B的MTP/DSpark和0.485B的视觉编码器,总计约748B。常见的485B、522B等说法因不同计数方法或误读而不准。
劝诫本地LLM爱好者别被FOMO推动过度花费:通过API或小模型也能学很多,建议以经济与学习友好的节奏入门,切勿盲目购置高端硬件。