llama.cpp 添入 Maple 20B-A1B 三值 MoE(CPU)
ggml-org/llama.cpp 的 PR 添加了由 AlexGabbia 引入的 Maple 20B-A1B 三值 MoE 架构,可在 CPU 上运行并已在 Hugging Face 的 deepgrove/maple-preview 页面出现。这对显存受限用户有吸引力,属于开源模型扩展。
AI 日报收录的 ggml-org/llama.cpp 相关报道,共 2 篇,按时间倒序,每小时更新。
ggml-org/llama.cpp 的 PR 添加了由 AlexGabbia 引入的 Maple 20B-A1B 三值 MoE 架构,可在 CPU 上运行并已在 Hugging Face 的 deepgrove/maple-preview 页面出现。这对显存受限用户有吸引力,属于开源模型扩展。
ggml-org/llama.cpp 的一项PR由pwilkin提交,针对gfx1201(RDNA4)和部分RDNA3 GPU(RX 9060 XT、8060S)做了Flash Attention调优,PR包含详细基准数据并带来大上下文性能提升。