John Schulman@johnschulman2
作为补充,极不可能对前沿模型在像数学这样的领域的提升有大量贡献的是基于用户数据的训练——这些提升来自于扩大规模的预训练和 RLVR。用户数据更可能用于发现失效模式或用雇佣的注释员难以重现的情形。 话虽如此,各模型公司在多大程度上用用户数据训练存在差异(上传代码库并非假设)。我希望能有更强的规范,要求披露公司如何用用户数据训练——用什么方法,以及为提升什么能力。 [引用 @johnschulman2]: 这并不是今天新闻中最显著的方面,但关于用户数据问题,存在不同种类的“用用户数据训练”,它们在隐私/知识产权方面的…