第 2026-09-21 期 · 行业追踪 · 研究 · 开源
Qwen 27B在单张3090上自主运行三周
一位用户用单张RTX 3090本地运行Qwen 27B量化模型约21天,目标是让智能体自行编写CUDA推理引擎。期间共运行约2.3亿token、699次压缩耗时约83小时,最终预填充速度约为llama.cpp的一半,但产出了可用的kernel和测试。
查看原文 ↗一位用户用单张RTX 3090本地运行Qwen 27B量化模型约21天,目标是让智能体自行编写CUDA推理引擎。期间共运行约2.3亿token、699次压缩耗时约83小时,最终预填充速度约为llama.cpp的一半,但产出了可用的kernel和测试。
查看原文 ↗