第 2026-09-25 期 · 行业追踪 · 研究 · 开源 · 模型发布
Qwengram-0.8B:转移n-gram记忆降低5.05%困惑度
开发者将Qwen3.8 Flash-Next的预训练PLE n-gram记忆迁移到Qwen3.5-0.8B,在冻结骨干和约51B参数记忆的情况下训练R=1读取器,验证困惑度从18.2759降至17.3534,降低5.05%。这是语言模型验证结果,不代表基准准确率提升5%。
查看原文 ↗开发者将Qwen3.8 Flash-Next的预训练PLE n-gram记忆迁移到Qwen3.5-0.8B,在冻结骨干和约51B参数记忆的情况下训练R=1读取器,验证困惑度从18.2759降至17.3534,降低5.05%。这是语言模型验证结果,不代表基准准确率提升5%。
查看原文 ↗