第 2026-09-30 期 · 行业追踪 · 模型发布 · 开源
12GB显存笔记本本地跑Qwen3.8模型达51t/s
用户测试显示,Strata推理引擎搭配ISTA-DASLab的Qwen3.8-Flash-Next量化版,在12GB显存、64GB内存笔记本上实现51 t/s生成和1500 t/s提示处理,远超原版llama.cpp。该引擎目前仅支持Nvidia及特定GGUF模型。
查看原文 ↗用户测试显示,Strata推理引擎搭配ISTA-DASLab的Qwen3.8-Flash-Next量化版,在12GB显存、64GB内存笔记本上实现51 t/s生成和1500 t/s提示处理,远超原版llama.cpp。该引擎目前仅支持Nvidia及特定GGUF模型。
查看原文 ↗