第 2026-10-04 期 · 行业追踪 · 开源 · 研究 · 应用

176B MoE模型在16GB笔记本GPU上运行

开发者用自研引擎TensorSharp在RTX 3080笔记本(16GB显存)、32GB内存和SSD上运行了Qwen3.8 Flash Next 176B。测试显示解码速度11.09 tok/s,略高于Strata的10.24 tok/s;整程时间16.54秒,远快于Strata的62.15秒。这表明通过量化与跨显存、内存、SSD的MoE调度,消费级硬件也能跑超大稀疏模型。

r/LocalLLaMA3 天前
查看原文 ↗