第 2026-09-22 期 · 行业追踪 · 开源 · 产品 · 应用

Transformers 现已支持 llama.cpp 的 GGUF 量化模型

Transformers 现已支持 llama.cpp 的 GGUF 量化模型

Hugging Face 在 transformers 中新增 GGUF 模型支持,用户可通过 from_pretrained 加载 Hub 上针对本机内存优化的量化检查点。为接近 llama.cpp 性能,团队复用 ggml 内核并降低 generate 开销,初期聚焦 Apple Silicon 与 Qwen3.5 架构,Ollama、LM Studio、Jan 等本地工具均基于 llama.cpp。

Hugging Face Blog5 天前
查看原文 ↗