vLLM

3 篇报道

vLLM 是一个用于在本地运行大语言模型并管理推理资源的软件框架,负责显存/内存调度与 KV cache 管理。近期报道聚焦于用 vLLM 将 Qwen3.8-Flash-Next 的大部分 KV cache 卸载到系统内存以在 3×3090 上实现 1M 上下文(短/长上下文约 80/60 tok/s,248k 预填达 3,701 tok/s)、对 Deepseek V4.1 Flash 的 safetensors 检验(约 748B 总量/552B base)以及劝诫爱好者别被 FOMO 驱动高价本地部署。

相关话题
已经到底了