第 2026-09-24 期 · 行业追踪 · 开源 · 模型发布 · 应用

Qwen3.8-Flash-Next 在12GB显存实现65 tokens/秒

开发者自建推理引擎Strata,在12GB RTX 5070等消费级硬件上运行Qwen3.8-Flash-Next,输出速度约65 tok/s,提示处理约430 tok/s,较此前llama.cpp方案大幅提升。引擎目前仅针对CUDA优化,已开源并支持一键安装。

r/LocalLLaMA46 小时前
查看原文 ↗