单GPU训练210M文本到图像DiT的实测结果
作者在一张RTX PRO 6000上用约4.2M张256²图像训练了210M参数的DiT(3.5天),得出三个可复现测量:学习到的空槽吸收大部分交叉注意力、流匹配损失是训练健康信号而非质量指标、训练时步长偏移能显著改善采样质量。
AI 日报收录的 Flan-T5-base 相关报道,共 1 篇,按时间倒序,每小时更新。
作者在一张RTX PRO 6000上用约4.2M张256²图像训练了210M参数的DiT(3.5天),得出三个可复现测量:学习到的空槽吸收大部分交叉注意力、流匹配损失是训练健康信号而非质量指标、训练时步长偏移能显著改善采样质量。