Qwengram-0.8B:转移n-gram记忆降低5.05%困惑度
开发者将Qwen3.8 Flash-Next的预训练PLE n-gram记忆迁移到Qwen3.5-0.8B,在冻结骨干和约51B参数记忆的情况下训练R=1读取器,验证困惑度从18.2759降至17.3534,降低5.05%。这是语言模型验证结果,不代表基准准确率提升5%。
AI 日报收录的 Qwen3.5-0.8B 相关报道,共 1 篇,按时间倒序,每小时更新。
开发者将Qwen3.8 Flash-Next的预训练PLE n-gram记忆迁移到Qwen3.5-0.8B,在冻结骨干和约51B参数记忆的情况下训练R=1读取器,验证困惑度从18.2759降至17.3534,降低5.05%。这是语言模型验证结果,不代表基准准确率提升5%。