Issue 2026-09-11 · Industry · 开源 · 芯片

Flash Attention tuning PR for RDNA4 in llama.cpp

A ggml-org/llama.cpp PR by pwilkin adds Flash Attention tuning for gfx1201 (RDNA4) and some RDNA3 GPUs (e.g., RX 9060 XT, 8060S), with detailed benchmarks showing improved large-context performance.

r/LocalLLaMA6 d ago
Read original ↗