Issue 2026-09-11 · Industry · 开源 · 芯片
Flash Attention tuning PR for RDNA4 in llama.cpp
A ggml-org/llama.cpp PR by pwilkin adds Flash Attention tuning for gfx1201 (RDNA4) and some RDNA3 GPUs (e.g., RX 9060 XT, 8060S), with detailed benchmarks showing improved large-context performance.
Read original ↗