Qwen3.8-Flash-Next 在12GB显存实现65 tokens/秒
开发者自建推理引擎Strata,在12GB RTX 5070等消费级硬件上运行Qwen3.8-Flash-Next,输出速度约65 tok/s,提示处理约430 tok/s,较此前llama.cpp方案大幅提升。引擎目前仅针对CUDA优化,已开源并支持一键安装。
AI 日报收录的 RTX 5070 相关报道,共 1 篇,按时间倒序,每小时更新。
开发者自建推理引擎Strata,在12GB RTX 5070等消费级硬件上运行Qwen3.8-Flash-Next,输出速度约65 tok/s,提示处理约430 tok/s,较此前llama.cpp方案大幅提升。引擎目前仅针对CUDA优化,已开源并支持一键安装。