实验:超曲面约束的动态权重更新
研究者分享了一个小型语言模型架构实验,通过可学习超曲面生成权重增量,循环复用单个解码器块并动态更新其权重,以减少训练参数量和显存占用。在FineWeb-Edu的100亿token样本上预训练,使用冻结的GPT-2嵌入层、NoPE和1024序列长度。
AI 日报收录的 FineWeb-Edu 相关报道,共 1 篇,按时间倒序,每小时更新。
研究者分享了一个小型语言模型架构实验,通过可学习超曲面生成权重增量,循环复用单个解码器块并动态更新其权重,以减少训练参数量和显存占用。在FineWeb-Edu的100亿token样本上预训练,使用冻结的GPT-2嵌入层、NoPE和1024序列长度。