Voodoo动态量化方案开源(MIT许可)
开发者在GitHub开源名为Voodoo Dynamic Quant的动态量化方法,利用梯度下降为每个张量优化量化布局,支持GGUF等格式,适用于减小模型体积并保持精度。
llama.cpp 是一个用 C++ 实现的开源工具,用于在本地运行与优化大型语言模型。近期报道聚焦于社区分支(forks)在资源受限时的低级优化:如把 Qwen 3.8 Flash Next 提升到约 52 tok/s decode 和 1300 tok/s prefill;同时提到 OpenUI 的 OUI‑1 与 DiffusionGemma 不受 llama.cpp 支持,以及在 Galaxy Note 8 上用 llama.cpp 运行 Qwen3-0.6B 驱动真实桌面 Chrome 并在页面感知测试中得 10/10。
开发者在GitHub开源名为Voodoo Dynamic Quant的动态量化方法,利用梯度下降为每个张量优化量化布局,支持GGUF等格式,适用于减小模型体积并保持精度。
Reddit 用户指出,硬件短缺促使本地化 LLM 社区回到底层优化:通过 llama.cpp 分支和 Strix Halo 的 halogen-flash-server 对 Qwen 3.8 Flash Next(Q38FN)实现显著加速,解码达 52 tok/s、prefill 达 1300 tok/s。作者认为资源受限反而推动学习与技术积累。
OpenUI 发布了基于 DiffusionGemma 微调的 OUI-1,训练数据使用自有 DSL OpenUI‑Lang 而非 HTML/Markdown/React。作者指出通过系统提示让通用大模型输出 OpenUI‑Lang 可行但占用大量上下文,微调能节省空间;同时担心模型会倾向默认输出 DSL。DiffusionGemma 目前不被 llama.cpp 支持,Ollama 无法运行,但权重已上传到 Hugging Face,用户在 RTX 5090 等消费级 GPU 本地部署上存在不确定性。
开发者在 Galaxy Note 8(2017,6GB)上用 llama.cpp 运行 Qwen3-0.6B(Q4_K_M),通过中继驱动真实桌面 Chrome 并在三项任务中进行结构化页面感知与选择。Qwen3-0.6B 在多个测试上均取得 10/10 成绩;测试强调结构化感知比直接 HTML 更有效率。