llama.cpp

4 篇报道

llama.cpp 是一个用 C++ 实现的开源工具,用于在本地运行与优化大型语言模型。近期报道聚焦于社区分支(forks)在资源受限时的低级优化:如把 Qwen 3.8 Flash Next 提升到约 52 tok/s decode 和 1300 tok/s prefill;同时提到 OpenUI 的 OUI‑1 与 DiffusionGemma 不受 llama.cpp 支持,以及在 Galaxy Note 8 上用 llama.cpp 运行 Qwen3-0.6B 驱动真实桌面 Chrome 并在页面感知测试中得 10/10。

相关话题

OpenUI 发布定制界面模型 OUI-1

OpenUI 发布了基于 DiffusionGemma 微调的 OUI-1,训练数据使用自有 DSL OpenUI‑Lang 而非 HTML/Markdown/React。作者指出通过系统提示让通用大模型输出 OpenUI‑Lang 可行但占用大量上下文,微调能节省空间;同时担心模型会倾向默认输出 DSL。DiffusionGemma 目前不被 llama.cpp 支持,Ollama 无法运行,但权重已上传到 Hugging Face,用户在 RTX 5090 等消费级 GPU 本地部署上存在不确定性。

r/LocalLLaMA · · 详情
已经到底了