可将Qwen3.8-Flash-Next大部分KV缓存外置至RAM
一位vLLM用户在r/LocalLLaMA分享可把Qwen3.8-Flash-Next的大部分KV缓存放到系统内存、仅在显存中保留少量量化权重的做法,称在3×3090上实现1M上下文并在短上下文下约80 tok/s,长上下文稳定在约60 tok/s,预填充248k时达3701 tok/s并提供了补丁与模型链接。
Qwen3.8-27B 是一款 27B 参数的大型通用语言模型。近期报道关注到有开发者用 125,217 条经混淆的人类对话微调并发布了使回复更简短、更会话化的 LoRA 到 Hugging Face;在 Terminal Bench v4 排名中它是唯一在较小规模里有显著表现的模型,但在创意写作基准上被 Muse-glimmer-30b 比较时落后。
一位vLLM用户在r/LocalLLaMA分享可把Qwen3.8-Flash-Next的大部分KV缓存放到系统内存、仅在显存中保留少量量化权重的做法,称在3×3090上实现1M上下文并在短上下文下约80 tok/s,长上下文稳定在约60 tok/s,预填充248k时达3701 tok/s并提供了补丁与模型链接。
LocalLLaMA帖子介绍UkisAI的Swift‑Qwen3.8‑27B细调版,通过惩罚触发过度推理的标记并借鉴BottleCap AI方法,实现约30–50%更少的推理令牌而保持输出质量。
开发者基于Qwen3.8-27B对话数据训练LoRA,使模型回复更短、更随意、更像人类日常对话。训练用数据为125,217条消息,作者在Hugging Face发布模型与演示。
Reddit用户公布的Terminal Bench v4榜单显示,GLM-5.3以41.9%领先,GLM-5.3-Flash和DSV4.1-Flash分列二三,Qwen3.8-27B是少数在该基准上有表现的小模型。榜单反映社区对开源与闭源模型的主观感受差异。
Reddit用户称Muse-glimmer-30b在EQ-Bench与Hemingway-bench等创作写作评测中胜于更大模型,示例显示其能较好模仿David Sedaris风格,作者对比了qwen3.8-27b的输出。