四张3060Ti组多GPU本地推理,达120t/s并支持262K上下文
一名用户用四张功耗限制在110W的8GB 3060Ti搭建多GPU推理平台,借助Tensor Parallel、Exl3和HyperQwen方案,在bf16下实现约120t/s、150K上下文,量化KV缓存后可扩展到262K上下文,且并发几乎无性能衰减。
AI 日报收录的 HyperQwen 相关报道,共 1 篇,按时间倒序,每小时更新。
一名用户用四张功耗限制在110W的8GB 3060Ti搭建多GPU推理平台,借助Tensor Parallel、Exl3和HyperQwen方案,在bf16下实现约120t/s、150K上下文,量化KV缓存后可扩展到262K上下文,且并发几乎无性能衰减。