第 2026-09-19 期 · 行业追踪 · 研究 · 开源
实验:超曲面约束的动态权重更新
研究者分享了一个小型语言模型架构实验,通过可学习超曲面生成权重增量,循环复用单个解码器块并动态更新其权重,以减少训练参数量和显存占用。在FineWeb-Edu的100亿token样本上预训练,使用冻结的GPT-2嵌入层、NoPE和1024序列长度。
查看原文 ↗研究者分享了一个小型语言模型架构实验,通过可学习超曲面生成权重增量,循环复用单个解码器块并动态更新其权重,以减少训练参数量和显存占用。在FineWeb-Edu的100亿token样本上预训练,使用冻结的GPT-2嵌入层、NoPE和1024序列长度。
查看原文 ↗