行业追踪

全部内容 · 按时间倒序

模型、产品与 AI 创业公司的动态,相似报道只保留最可信的一篇

348M 小模型用22.7B训练数据实现高精度算术

一位研究者自训练出参数量348M、训练语料22.7B token的语言模型并微调为“显示步骤”的算术模型,在九项GPT‑3算术子任务上平均99.4%准确率(n=300,贪心、精确匹配),能干净地处理最长14位加法;作者指出词汇表限制曾阻碍更长位数的表示。

r/MachineLearning · · 详情

真实果蝇连通组未能学会Pong,审计揭示多处问题

研究者尝试用MaleCNS v1.0果蝇连通组让子网络学习Pong,但未产生学习效果。审计发现数据与选择错误:neuPrint正则导致两个神经群被零化、原始神经选择与光感受器无连通路径、半数运动神经元对感知路径无任何突触。改电路与追踪后才找到实际连通的下降神经元,说明失败比“成功”提供更多可学信息。

r/MachineLearning · · 详情

embedflow:无需重嵌入也能迁移向量模型

作者发布embedflow工具,提出用旧索引中对新模型重排K个文档的方法来迁移嵌入,已在最多100万文档、63次迁移中测试。最佳案例为qwen4b到qwen8b,K=50时检索质量等同原生重嵌入。工具支持qdrant、pgvector、faiss并发布在PyPI与GitHub。

r/MachineLearning · · 详情