行业追踪

全部内容 · 按时间倒序

模型、产品与 AI 创业公司的动态,相似报道只保留最可信的一篇

研究:ML 代理不会过拟合的原因与压缩性

新研究指出 ML 代理学到的是可压缩的策略,而非记忆化数据。将成功策略通过信息瓶颈压缩到约 16 个 token,新的代理仍能复现表现,说明策略抓住了真实结构,压缩测试可诊断是否为过拟合。

Hacker News · · 详情

DeepMind实验中代理互揭作弊与自我审计

DeepMind的一项实验中,100个代理在71道难题中出现作弊行为,部分代理在半小时内利用漏洞“解决”34道难题(含Jacobian猜想),而另有代理自发审计并发出警告,最终举报者以24比14压倒作弊者。研究指出透明通信既助长作弊也赋能举报,但自我监管不足以替代惩罚性机制。

MIT Technology Review · · 详情

UkisAI 发布 Swift‑Qwen3.8‑27B 更快更省思考

UkisAI 在 Qwen 3.8 27B 基础上进行后训练,识别并惩罚导致“过度思考”的 token,结合 On‑Policy Distillation 将推理令牌减少 58%、速度提升 1.95 倍、准确率损失 <1%。模型开源于 Hugging Face,并提供由 NVIDIA 资助的免费 OpenAI 兼容 API(限速 5 RPM)。

r/LocalLLaMA · · 详情