Qwen3.8-Flash-Next 在 MLX-serve 上支持 1M 上下文发布
Qwen3.8-Flash-Next 在 MLX-serve 上实现百万级上下文支持,作者用 M5 Max 与 8-bit kv 缓存演示约760k上下文并称可维持1M上下文、生成速率约40–75 tok/s。
AI 日报收录的 ddalcu 相关报道,共 1 篇,按时间倒序,每小时更新。
Qwen3.8-Flash-Next 在 MLX-serve 上实现百万级上下文支持,作者用 M5 Max 与 8-bit kv 缓存演示约760k上下文并称可维持1M上下文、生成速率约40–75 tok/s。