第 2026-09-11 期 · 行业追踪 · 开源 · 芯片

ggml/llama.cpp推送RDNA4 Flash Attention调优PR

ggml-org/llama.cpp 的一项PR由pwilkin提交,针对gfx1201(RDNA4)和部分RDNA3 GPU(RX 9060 XT、8060S)做了Flash Attention调优,PR包含详细基准数据并带来大上下文性能提升。

r/LocalLLaMA6 天前
查看原文 ↗