第 2026-09-11 期 · 行业追踪 · 研究 · 开源
单GPU训练210M文本到图像DiT的实测结果
作者在一张RTX PRO 6000上用约4.2M张256²图像训练了210M参数的DiT(3.5天),得出三个可复现测量:学习到的空槽吸收大部分交叉注意力、流匹配损失是训练健康信号而非质量指标、训练时步长偏移能显著改善采样质量。
查看原文 ↗作者在一张RTX PRO 6000上用约4.2M张256²图像训练了210M参数的DiT(3.5天),得出三个可复现测量:学习到的空槽吸收大部分交叉注意力、流匹配损失是训练健康信号而非质量指标、训练时步长偏移能显著改善采样质量。
查看原文 ↗