GPT-3

3 篇报道

GPT-3 是一款基于大规模变换器架构的语言模型。最近报道关注推理负载上升与推理专用硬件(如 Tensordyne 的 Napier、Nvidia 在 GTC 2026 的论述)、变换器可解释性数学框架(起始于 2021 年的注意力模型研究),以及一项用 22.7B 训练令牌并训练出 348M 参数模型在算术子任务上达成 99.4% 的实验。

相关话题

2026:推理驱动的算力与硬件转向

到2026年,AI焦点从训练转向推理,推理负载因链式思路和代理式AI大幅上升,推动硬件厂商(如Tensordyne)推出面向推理的芯片(Napier),Nvidia在GTC 2026称这是“推理的拐点”。这意味着数据中心和厂商正为持续、频繁的推理请求调整产品与投资。

Hacker News · · 详情

Transformer 回路的数学框架(2021)

论文提出面向可解释性的数学框架,尝试逆向工程 Transformer 的内部计算,起步于仅含两层注意力模块的最简模型,以发现可推广的算法模式,旨在帮助识别与预测大型语言模型的行为与风险。

Hacker News · · 详情

348M 小模型用22.7B训练数据实现高精度算术

一位研究者自训练出参数量348M、训练语料22.7B token的语言模型并微调为“显示步骤”的算术模型,在九项GPT‑3算术子任务上平均99.4%准确率(n=300,贪心、精确匹配),能干净地处理最长14位加法;作者指出词汇表限制曾阻碍更长位数的表示。

r/MachineLearning · · 详情
已经到底了