期待更优的KVCache与Engram:DeepSeek-V4.1-Flash设想
Reddit用户呼吁将DeepSeek-V4.1-Flash的KVCache与Engram设计推广到中大规模模型,以在GPU上用Q8或Q4运行30B级模型。帖文列出多款模型的近似显存与Engram占用估算,提出Engram约占模型体积1/3–1/2(30B约10–15GB),并认为32GB显存可满足多数经优化模型。
AI 日报收录的 Gemma 相关报道,共 1 篇,按时间倒序,每小时更新。
Reddit用户呼吁将DeepSeek-V4.1-Flash的KVCache与Engram设计推广到中大规模模型,以在GPU上用Q8或Q4运行30B级模型。帖文列出多款模型的近似显存与Engram占用估算,提出Engram约占模型体积1/3–1/2(30B约10–15GB),并认为32GB显存可满足多数经优化模型。