用户用8张Radeon Pro V620自建大显存推理机
一名用户用8张二手Radeon Pro V620(共256GB显存)搭建约2800美元的推理主机,并通过定制vLLM分支运行Qwen3.8-Flash-Next,解码速度达每秒60至100个token,预填充超过每秒3000个token,比llama.cpp快约8倍。
AI 日报收录的 Radeon Pro V620 相关报道,共 1 篇,按时间倒序,每小时更新。
一名用户用8张二手Radeon Pro V620(共256GB显存)搭建约2800美元的推理主机,并通过定制vLLM分支运行Qwen3.8-Flash-Next,解码速度达每秒60至100个token,预填充超过每秒3000个token,比llama.cpp快约8倍。