Aurora1.0-150M 模型发布
Aurora1.0-150M 首个版本在 Huggingface 上发布,使用 7B tokens 训练、RTX Pro 6000。性能接近 GPT2‑Small,给出一系列基准分数(如 PIQA 62.24%、Hellaswag 32.20%)。仓库包含示例推理脚本。
AI 日报收录的 RTX PRO 6000 相关报道,共 2 篇,按时间倒序,每小时更新。
Aurora1.0-150M 首个版本在 Huggingface 上发布,使用 7B tokens 训练、RTX Pro 6000。性能接近 GPT2‑Small,给出一系列基准分数(如 PIQA 62.24%、Hellaswag 32.20%)。仓库包含示例推理脚本。
作者在一张RTX PRO 6000上用约4.2M张256²图像训练了210M参数的DiT(3.5天),得出三个可复现测量:学习到的空槽吸收大部分交叉注意力、流匹配损失是训练健康信号而非质量指标、训练时步长偏移能显著改善采样质量。