第 2026-10-04 期 · 行业追踪 · 开源 · 产品

开发者发布Ninfer 4080,16GB显卡实现100k上下文

开发者推出Ninfer 4080推理方案,可在RTX 4080 16GB显卡上以100k上下文运行Qwen-3.8-27B-GSQ模型,峰值预填充2720 tok/s、生成262 tok/s。项目已开源,旨在让16GB级显卡获得比通用推理引擎更好的性能。

r/LocalLLaMA4 天前
查看原文 ↗