第 2026-09-09 期 · 行业追踪 · 模型发布 · 产品

Qwen3.8-Flash-Next 在 MLX-serve 上支持 1M 上下文发布

Qwen3.8-Flash-Next 在 MLX-serve 上实现百万级上下文支持,作者用 M5 Max 与 8-bit kv 缓存演示约760k上下文并称可维持1M上下文、生成速率约40–75 tok/s。

r/LocalLLaMA8 天前
查看原文 ↗