第 2026-09-27 期 · 行业追踪 · 开源 · 研究
四张3060Ti组多GPU本地推理,达120t/s并支持262K上下文
一名用户用四张功耗限制在110W的8GB 3060Ti搭建多GPU推理平台,借助Tensor Parallel、Exl3和HyperQwen方案,在bf16下实现约120t/s、150K上下文,量化KV缓存后可扩展到262K上下文,且并发几乎无性能衰减。
查看原文 ↗一名用户用四张功耗限制在110W的8GB 3060Ti搭建多GPU推理平台,借助Tensor Parallel、Exl3和HyperQwen方案,在bf16下实现约120t/s、150K上下文,量化KV缓存后可扩展到262K上下文,且并发几乎无性能衰减。
查看原文 ↗