第 2026-10-07 期 · 行业追踪 · 开源llama.cpp 为MoE专家增加GPU缓存开发者am17an向llama.cpp提交PR #29887,为存放在主机内存中的MoE专家层增加GPU缓存,有望显著加速无法完全装入显存的混合专家模型推理。r/LocalLLaMA32 小时前查看原文 ↗话题:llama.cppam17an相关文章llama.cpp合并Qwen4Exp的MTP支持2026-10-01RTX 4090实测四款开源决策模型速度与准确率2026-10-08用户用8张Radeon Pro V620自建大显存推理机2026-10-08llama.cpp新增GLM 5 Flash MTP本地支持2026-10-08llama.cpp 登上演讲舞台2026-10-07