OpenArch:面向学习的PyTorch LLM架构实现库
OpenArch 是一个手写的 PyTorch 仓库,逐个实现现代开源大模型架构,侧重可读性与教学用途,覆盖多种注意力、归一化与位置编码等设计细节,部分实现可用于前向推理。
Sebastian Raschka 是一位机器学习从业者与教育者,因发布教程和开源训练代码(如“Build a Large Language Model (from Scratch)”)而被广泛引用。近期报道涉及手写 PyTorch 的 OpenArch 对现代 LLM 架构的实现、DeepSeek V4.1 的编码器—解码器更新,以及一篇将 rasbt 的 GPT‑2 风格代码扩展为在单 GPU 上训练的 6‑expert(2 活跃)MoE 的展示。
OpenArch 是一个手写的 PyTorch 仓库,逐个实现现代开源大模型架构,侧重可读性与教学用途,覆盖多种注意力、归一化与位置编码等设计细节,部分实现可用于前向推理。
DeepSeek V4.1 大改,用了 encoder-decoder 结构。 老实说他们本该叫它 DeepSeek V5! 真是太酷、很有新意! https://t.co/r00s3Cl29m [引用 @deepseek_ai]: 🚀 介绍 DeepSeek-V4.1-Flash:更聪明、更快、更高效。 🔹 在我们新架构家族中引入了最小的模型,具有原生视觉理解能力。 🔹 设计用于更强的能力、更快的推理、更高的吞吐量,并可扩展到更大的模型。 1/6
很好的示例,表明有趣的 LLM 工作可以在单个 GPU 上完成! [引用 @gpjt]: 我把 @rasbt 的 "Build a Large Language Model (from Scratch)" 中的 GPT-2 风格代码扩展成一个 6-expert(2 active)的专家混合模型,并从头训练了 8 天。效果很好!完整的数学和代码说明见 https://t.co/7YsQifjWDk