第 2026-10-10 期 · 行业追踪 · 开源 · 研究
Qwen 3.8 Flash在RTX 3060上约21 tok/s运行
一位开发者分享,通过预测MoE专家路由加速CPU/GPU卸载,在RTX 3060 12GB加16GB内存上以约21 tok/s运行68GB的Qwen 3.8 Flash Next量化模型,且未做门控剪枝、保持比特精确。热缓存下可达24 tok/s以上,相比原版约1.4-2.1 tok/s大幅提升。
查看原文 ↗一位开发者分享,通过预测MoE专家路由加速CPU/GPU卸载,在RTX 3060 12GB加16GB内存上以约21 tok/s运行68GB的Qwen 3.8 Flash Next量化模型,且未做门控剪枝、保持比特精确。热缓存下可达24 tok/s以上,相比原版约1.4-2.1 tok/s大幅提升。
查看原文 ↗