第 2026-09-10 期 · 行业追踪 · 模型发布 · 研究

348M 小模型用22.7B训练数据实现高精度算术

一位研究者自训练出参数量348M、训练语料22.7B token的语言模型并微调为“显示步骤”的算术模型,在九项GPT‑3算术子任务上平均99.4%准确率(n=300,贪心、精确匹配),能干净地处理最长14位加法;作者指出词汇表限制曾阻碍更长位数的表示。

r/MachineLearning7 天前
查看原文 ↗