第 2026-09-14 期 · 行业追踪 · 模型 · 研究
期待更优的KVCache与Engram:DeepSeek-V4.1-Flash设想
Reddit用户呼吁将DeepSeek-V4.1-Flash的KVCache与Engram设计推广到中大规模模型,以在GPU上用Q8或Q4运行30B级模型。帖文列出多款模型的近似显存与Engram占用估算,提出Engram约占模型体积1/3–1/2(30B约10–15GB),并认为32GB显存可满足多数经优化模型。
查看原文 ↗Reddit用户呼吁将DeepSeek-V4.1-Flash的KVCache与Engram设计推广到中大规模模型,以在GPU上用Q8或Q4运行30B级模型。帖文列出多款模型的近似显存与Engram占用估算,提出Engram约占模型体积1/3–1/2(30B约10–15GB),并认为32GB显存可满足多数经优化模型。
查看原文 ↗