第 2026-10-07 期 · 行业追踪 · 开源

llama.cpp 为MoE专家增加GPU缓存

开发者am17an向llama.cpp提交PR #29887,为存放在主机内存中的MoE专家层增加GPU缓存,有望显著加速无法完全装入显存的混合专家模型推理。

r/LocalLLaMA32 小时前
查看原文 ↗