Muse Glimmer在本地模型社区受到好评
在LocalLLaMA社区用户称Muse Glimmer表现出色,聊天自然、少有模板化回复,适合作为本地化对话模型的选择;用户同时在测试Qwen 3.8 27B用于编码。
Qwen 3.8 27B 是一款可本地部署的多模态大模型,常以 q4xl 格式运行并支持视觉与 MTP 能力。近期报道关注它作为 Perplexity Portable 随机本地模型被带到 Windows(配合 NVIDIA GPU),以及社区用 Zima Board 2 + RTX 2000 ADA 或本地 PI agent 在游戏设计任务中处理百万级 token 的实践与性能对比。
在LocalLLaMA社区用户称Muse Glimmer表现出色,聊天自然、少有模板化回复,适合作为本地化对话模型的选择;用户同时在测试Qwen 3.8 27B用于编码。
UkisAI 在 Qwen 3.8 27B 基础上进行后训练,识别并惩罚导致“过度思考”的 token,结合 On‑Policy Distillation 将推理令牌减少 58%、速度提升 1.95 倍、准确率损失 <1%。模型开源于 Hugging Face,并提供由 NVIDIA 资助的免费 OpenAI 兼容 API(限速 5 RPM)。
Perplexity在Windows版应用中推出Portable Computer,本地代理借助NVIDIA GeForce/RTX PRO与RTX服务器加速,支持本地模型(如Qwen 3.8 27B),可在设备上处理敏感数据并按需调用云模型。
Reddit 用户讨论将 Zima Board 2(约$411)插入 RTX 2000 ADA(约$700)以运行 Qwen-3.8 27b 的可行性,提到在 Luke’s Dev Lab 的演示中能用 Ollama 达到不错的 token 速度并用 Zima 电源供电。作者比较该组合与 Mac Mini M5 24GB 的优劣,并询问是否有更便宜的全新自托管替代方案。
一位用户用 Qwen 3.8 27B(q4xl)在本地 PI agent 环境下处理大型游戏设计文件,使用约120k 上下文并启用视觉与 MTP,读取约1100万 token 并写出320万 token,运行约12小时。作者表示这是将本地模型用于复杂游戏设计的示例。