第 2026-10-03 期 · 行业追踪 · 开源 · 研究llama.cpp PR优化Qwen Flash Next显存占用llama.cpp的拉取请求#29825通过将索引器分数内存减半,降低了Qwen Flash Next的显存占用。r/LocalLLaMA8 天前查看原文 ↗话题:llama.cppQwen Flash Nextggml-orgServeurpersoCom相关文章开源Mac应用DigUp本地运行EmbeddingGemma 2实现文件搜索2026-10-10llama.cpp合并Qwen4Exp的MTP支持2026-10-01Qwen 3.8 Flash在RTX 3060上约21 tok/s运行2026-10-10RTX 4090实测四款开源决策模型速度与准确率2026-10-08用户用8张Radeon Pro V620自建大显存推理机2026-10-08