Percy Liang@percyliang
很高兴看到又一次在线训练运行!这是 Marin 535B-A23B 今天的情况: https://t.co/Bc3CcV4FOm 还有谁想分享吗? https://t.co/S71nmJ4fS3 [引用 @_LuoFuli]: 半年的沉默。我们用这段时间研究一个问题:RL(强化学习)能扩展到多远。 MiMo-V2.6 目前正处于其 RL 运行的中期。我们扩展了三件事:计算(~每步 20 亿 token,1568 个 prompts × 16 次 rollouts,完全异步)、环境和测试套件(多任务代理式 RL,在…