第 2026-09-15 期 · 行业追踪 · 模型 · 开源 · 应用
在12GB显存上运行Qwen3.8-Flash-Next实测
作者在RTX 4070(12GB VRAM)+64GB内存环境下,通过量化、ngram SSD卸载、--fit 参数和MTP补丁等优化,将Qwen3.8-Flash-Next的生成速度从6 tok/s 提升接近20 tok/s,PP约300–350 tok/s。文中列出具体补丁与权衡细节。
查看原文 ↗作者在RTX 4070(12GB VRAM)+64GB内存环境下,通过量化、ngram SSD卸载、--fit 参数和MTP补丁等优化,将Qwen3.8-Flash-Next的生成速度从6 tok/s 提升接近20 tok/s,PP约300–350 tok/s。文中列出具体补丁与权衡细节。
查看原文 ↗