第 2026-09-09 期 · 行业追踪 · 模型发布 · 产品
Qwen3.8-Flash-Next 在 MLX-serve 上支持 1M 上下文发布
Qwen3.8-Flash-Next 在 MLX-serve 上实现百万级上下文支持,作者用 M5 Max 与 8-bit kv 缓存演示约760k上下文并称可维持1M上下文、生成速率约40–75 tok/s。
查看原文 ↗Qwen3.8-Flash-Next 在 MLX-serve 上实现百万级上下文支持,作者用 M5 Max 与 8-bit kv 缓存演示约760k上下文并称可维持1M上下文、生成速率约40–75 tok/s。
查看原文 ↗