DeepSeek V4.1 Flash 在 AA 新基准上超越 Astra
Artificial Analysis 在 Intelligence Index v4.3 中新增私有评测替换 τ³,原本 Astra 得分高企并追平 Fable,但社区报告显示 DeepSeek V4.1 Flash 夺得该评测第一名,榜单在三天内被修改两次以调整排名。
DeepSeek-V4.1-Flash 是一个大规模混合架构的语言模型,其主模型约551.566B参数、总体约748B(含约196.929B的engram、14.225B的DSpark/MTP和约0.485B的视觉编码器)。近期报道聚焦对 safetensors 的检测、Artificial Analysis 基准中与 Qwen 和 GPT‑6 的性能差异,以及社区建议将其 KVCache 和 Engram 思路用于中大型模型以便在 32GB VRAM 上以 Q8/Q4 运行(估计 30B 的 engram 约占1/3–1/2,约10–15GB)。
Artificial Analysis 在 Intelligence Index v4.3 中新增私有评测替换 τ³,原本 Astra 得分高企并追平 Fable,但社区报告显示 DeepSeek V4.1 Flash 夺得该评测第一名,榜单在三天内被修改两次以调整排名。
Reddit用户呼吁将DeepSeek-V4.1-Flash的KVCache与Engram设计推广到中大规模模型,以在GPU上用Q8或Q4运行30B级模型。帖文列出多款模型的近似显存与Engram占用估算,提出Engram约占模型体积1/3–1/2(30B约10–15GB),并认为32GB显存可满足多数经优化模型。
r/LocalLLaMA 上的帖子为 Artificial Analysis 的聚合基准辩护,指出其方法与开销,并举例 Deepseek 与 Qwen、GPT-6 在不同子评测上的差异。
社区核查safetensors后指出,Deepseek V4.1 Flash主模型约551.566B参数(40层),FFN专家约543.582B,其他约7.984B;另有约196.929B的engram、14.225B的MTP/DSpark和0.485B的视觉编码器,总计约748B。常见的485B、522B等说法因不同计数方法或误读而不准。