Ethan Mollick@emollick
当我与高级经理交谈时,越来越多地听到组织内部岗位模糊的故事(我们在 P&G 的研究中也发现了):编码、设计、产品管理在每个人使用 AI 时都在塌缩与重叠。 我们需要快速建立新的工作组织模型。 https://t.co/SGDOkRWU8J
Ethan Mollick 是一位关注人工智能对组织、工作与政策影响的学者与评论者。近期他讨论了工作角色因AI重叠、引用了Google关于科学中AI使用的研究(提到每周节省约7小时)、点评了决策分类型AI演示,并注意到 Fable 5.1 Max 与 GPT-6 Astra Pro 在翻译 Linear A 等问题上的争论。
当我与高级经理交谈时,越来越多地听到组织内部岗位模糊的故事(我们在 P&G 的研究中也发现了):编码、设计、产品管理在每个人使用 AI 时都在塌缩与重叠。 我们需要快速建立新的工作组织模型。 https://t.co/SGDOkRWU8J
来自 Google 的关于 AI 在科学中使用的研究,影响复杂:加速(每周节省 7 小时)同时伴随工作类型的变化(更多验证工作)以及研究选题的变化(可能转向更安全的课题)。 另外还有一张关于锯齿状前沿的好图 https://t.co/0x2dxBWl2U https://t.co/HZL2BHSZ2i
这是一个很好的演示,展示了一种为根据决策规则快速分类信息而设计的 AI 模型,比通用大型语言模型更快更便宜。它本身不是 LLM,不能输出文本或代码,但如果有效,在系统中能发挥有用作用。(我自己还没试过) [引用 @CompleteSkeptic]: 我们喜欢这个 doom o doomonstrates 实时智能以及用代码 + AI 可以完成的事情! ~10 calls/sec = ~$7/hour https://t.co/nlffKxGzCB
很明显,这一次在 AI 方面与以往的创新不同。 这并不意味着它在所有方面都与过去技术不同(扩散的 S 型曲线出人意料地具有普遍性),但它在许多方面不同,使得套用旧的模式变得困难。
我刚想起这条线程,那天我在玩 GPT-3.5 (text-davinci-003),就是在它发布的那天,ChatGPT 前两天。 不到四年,LLM 已经成为美国政治的中心,LLM 的投资又成为美国经济的中心。太疯狂了。 [引用 @emollick]: 我发帖说图像生成人工智能在过去一个月里呈指数级提升。 好吧,今天发布了一个新的 GPT-3 文本模型。 AI 现在可以写押韵诗。 还有首字母诗。 还有五行打油诗(limericks)。 还能解释糖果驱动的 FTL 引擎如何帮助我逃离水獭。 https://t.co/…
让 Fable 5.1 Max 和 GPT-6 Astra Pro 就著名且尚未破译的米诺斯语 Linear A 的拟议翻译互相争论。 (就目前而言,它们似乎都没有破译它)。 到目前为止的所有工作都在这个 Github: https://t.co/CWEohvY3fc https://t.co/u9SfOkGbej
我认为一旦对“你的” Claude 或 Astra 或 Claw 或其他模型的远程连接变得更容易、更普遍,像 Siri 这样的手机内建助手将会失去很多价值。你需要一个能够管理一切并能访问许多系统与偏好的智能 AI,而不是一个功能受限的助手。
我不知道接下来还会发生什么,但我可以肯定地说,很多之前对 AI 不怎么在意的人现在都开始疯狂担心 AI 会杀光所有人。
存在性风险显然很关键,但它并不是唯一需要政策关注的 AI 议题。 我担心它会成为唯一的焦点。我们不需要更好的模型,AI 就能对就业和社会产生广泛影响,我们确实需要准备,鼓励良好结果并缓解负面影响。
在组织世界和前沿AI世界之间来回切换常常令人吃惊。组织低估了AI能力的增长(经常差得很远),而AI技术界低估了AI在现实世界中的不规则性(也经常差得很远)
一如既往,X 上的声明良莠不齐,我也没有什么内幕信息可言,但如果 Google 能够在 AI 前沿上重新崛起,这确实会改变当前的 AI 动态,因为它是一个大型、上市、受监管的实体,其目标与 Anthropic 或 OAI 不同。
既然 METR 长期进展已被有效饱和(Epoch 发现 pre-Fable 代理能完成相当于 18 周人类工作的任务),哪个定量图表最能展示当前的指数进展曲线? Frontier Math 已饱和,ARC-AGI 已饱和,Millennium Prize 是…
无论你听到多少关于 AI 的讨论,今天将是你有生之中最少听到 AI 的一天。 [引用 @tszzl]: 如果你觉得现在关于 AI 的闲聊已经让人恼火,那你还没见识到真正的情况。很快它将成为每个人唯一关心的事情。
草莓那件事确实很有趣,但可能让人对 AI 在数学方面的发展方向产生了错误印象。 https://t.co/1euzSU8WRp [引用 @EpochAIResearch]: Every FrontierMath Tier 4 problem has now been solved by AI, with GPT-6 Astra solving the last problem standing. Mathematicians often commented that AI found unintended sho…
你现在在数学中看到的,是不平滑前沿的结果,也是其他职业将出现情况的前兆。是的,数学家会做数学,但他们也有其他被视为重要的任务(指导学生、维护学术社区、保障领域的未来、培养对数学的热爱),这些是 AI 做不到的。 数学家似乎至少有一种担忧:通过专注于数学家所做工作中最耀眼、最明显的要素(做证明),AI 公司正在损害那些 AI 无法胜任的其他任务。AI 可以发现超越人类的证明,但这并不是数学职业的全部,而且实际上可能削弱并减少对数学家其他重要工作的关注。如果最具可见性的部分被取走,要向外界捍卫数学家所做的许多其它任务…
我正用 AI 在这么多我不想也不需要精通的烦人任务上迅速降低自己的技能水平。对这些任务无法被快速降权(deskill)表示无法满足。
Google 不再拥有 frontier 模型意味着他们将在两个本可以做出贡献的领域失去机会:最近一系列数学突破(在这里,大规模算力加上长期与科学合作的经验会有帮助)以及网络安全(在这里,大公司的视角会有帮助)
乍一看这里似乎有很多事情在发生。 https://t.co/4balXB308Q [引用 @AnthropicAI]: 我们正在分享我们对在第三方网络安全评估过程中,Claude 模型在误连到互联网的情况下获得对真实系统未授权访问事件的对齐评估。 METR 还将进行独立调查,拥有广泛的访问权限,包括超出事件发生窗口的记录,以及获准与 Anthropic 员工进行沟通的权限…
开源权重模型与前沿差距比我们近些年见到的更大。Mythos 在三月发布,虽然自那以后开源模型的发布不错(K3 和 GLM-5.3 很好),但在实际表现上它们并没有接近 Mythos 或 Astra。我认为这种情况会改变。
这里有一个很好的可视化,展示了随着 AI 推进任务组合如何改变,并且有一些关于在不同假设下 GDP 增长的交互式模拟。但如果我们既出现爆炸性的 GDP 增长又出现大规模白领被替代,合适的政策回应缺失了。 [引用 @AnthropicAI]: Anthropic 的经济学团队正在分享一个新模型,说明到 2030 年 AI 可能如何影响经济增长、就业、工资等。探索这些情景,告诉我们你认为会发生什么,并查看你的答案与超过 10,000 名美国人的比较。 https://t.co/AvQlEZNxR0
今天在各个实验室工作的人的话语非常奇怪,即便在 AI 话语中也不同寻常,这让我觉得大家都在对快速发展的事件做出反应——无论是显现出的 AI 能力,还是公众认知上的变化。
AI 似乎正在超越最优秀预测者的预期。 [引用 @Afinetheorem]: 2025 年 11 月 LEAP 小组的 AI 专家和超级预测员:到 2027 年 AI 有 10% 的概率帮助解决一个千禧年难题。“一位专家引用了 Clay 主席 2025 年 6 月的说法:‘我们离 AI 能对这些问题说任何严肃的话还很远’ (Heaven 2025)” https://t.co/zo7rqXeMVb
然而,无论我们有多少算力,我们越来越可能需要更多算力。 [引用 @abhishekn]: 根据我的计算,仅这里的算力(300 BILLION output tokens),按代价算对普通用户来说代币就要花费2000万到3000万美元。一旦 AI 公司决定不再值得去追求那些不是千禧年难题的事情,我们如何维持这一级别的科学投资? 还有——完全震惊 🤯 ——接下来很难再专注于另一个研究研讨会/主题了…
@METR_Evals 的长时程度量是否已经有效饱和? 自 5 月以来最著名的 AI 进展图没有更新,但其他发表的工作表明,你实际上可以从 Fable(我也假设 GPT-6)在 harnesses 中获得 18+ 周的工作量。 https://t.co/2AjjXcQVCg