我们在 Figure 有了 AI 突破,明天将展示这一成果
AI 领域头部人物在 X 上的最新观点
Greg Brockman 表示 Databricks 已向所有工程师全面部署 Astra,并称其在复杂系统设计等任务上优于之前模型。
Greg Brockman 宣布 ChatGPT Ads 已与 Shopify 合作上线,商家可直接从 Shopify 目录创建并管理广告活动。
Yuchen Jin 今天向所有 Databricks 工程师部署了 GPT-6 Astra,表示其在复杂任务上优于竞品并提高了代码支出。
SpaceXAI 宣布 Grok Voice 在 fal 上线,支持0.70秒响应、字级时间戳及多语音克隆。
Guillermo Rauch 表示 typesafeai 的 Jev 在 p95 下比 GPT Luna 快5–18倍且更准确,拟加入 Vercel AI Gateway。
Aidan Gomez 宣布与 Aleph Alpha 完成最终协议,Cohere 将成为跨大西洋的基础模型开发者。
Yuchen Jin 发现 OpenRouter 上的 Union Alpha 达到 Claude Fable 5.1 水平且成本低十倍以上,盼其开源。
Boris Cherny 说 Claude 已把 chat 与 Cowork 合并为一个可跨场景携带上下文的单一 Claude。
Bindu Reddy 宣布 Abacus AI Bot 为永久免费个人 AI,可路由并使用网络上的免费 LLMs 执行个人事务。
Gorden Sun 介绍 Dream-RSI,利用历史探索记录低成本“做梦”重演以离线评估并进化 AI Agent 策略。
MiniMax (official) 在日本IP AI共创大会上发布了MiniMax H3 IP Edition,结合官方授权的日本IP与MiniMax H3能力。
Yuchen Jin 表示 Jev 是新发布的模型,声称20–200x更快、40–400x更便宜,作者测试未花费超过0.10美元。
我们在 Figure 有了 AI 突破,明天将展示这一成果
很高兴能帮助 Shopify 商家在 ChatGPT 中为他们的产品做广告: [引用 @harleyf]: ChatGPT Ads for @Shopify 已上线。我们是 @OpenAI 的第一个商业合作伙伴。 OpenAI 直接从 Shopify Catalog 拉取数据,所以商家的产品已经在其中。 商家自行设置广告活动、预算。免费安装,可在 Shopify 管理后台直接跟踪。 消费者在向 ChatGPT 询问购买建议。Shopify 商家可以决定他们如何准确地出现在结果中。 https://t.co/kRr…
wall-to-wall 部署 Astra 给 Databricks 的工程师: [引用 @pwendell]: 今天我们向 Databricks 的每位工程师部署了 Astra(N=~3500)。一些可能对其他人有帮助的说明: 1. Astra 在高度复杂的任务上无可争议地超过了我们之前的最高端模型(Opus 5、Sol 5.6),特别是在与高级系统设计或长程横向任务相关的方面。 2. 给予工程师 Astra 后,与基线相比,整体编码支出增加了大约 60%…
直到看到这条帖子我才意识到,muse spark 1.3 在 Agents Last Exam (ALE) 排名第2! [引用 @yashvarpatel]: Muse Spark 1.3 在 Agents' Last Exam (ALE) 排行榜上排名第2,发布时曾排名第1。 向团队致敬!不知何故这件事没有得到足够的关注。 Leaderboard: https://t.co/bGQj2AuNZo https://t.co/d6dCRbCWpw
太棒了!muse 的设计目标就是让*每个人*都能轻松使用! 我们非常激动能把它推向更多人! [引用 @herrmanndigital]: 我觉得 Muse 会赢得休闲 AI 之争。 我把它展示给我快70岁的父亲,他一下就明白了。他惊讶我能让它为我生成整份合同、更新内容,然后通过短信把合同邮件并发送给客户。 Claude、OpenAI 都很棒。但到目前为止,我会说不到1%的人真正理解这些模型的含义。Meta 刚好把这一切变得非常简单。 致敬…
我们在分享 OpenAI 用于跟踪、调查和披露模型不对齐实例的新框架。 该框架设定了公开披露的标准和时间表,包括在我们尚未完全解释或缓解该行为时的披露情形。更复杂的案例可能需要更长时间的调查或与第三方协调。 我们将优先展示那些揭示新不对齐机制、已知行为发生重要变化或挑战关于安全或缓解假设的示例。 与该框架一并,我们发布了六份报告,介绍过去六个月中在模型训练或评估期间观察到的不对齐行为实例。 这只是一个起点。我们将通过实践和公众反馈来完善该流程,并持续分享更多报告。 https://t.co/ismCCkeE0L
迄今为止公开的最酷的规模化 RL 资源之一!太让人高兴了。 [引用 @_LuoFuli]: 将近半年的沉默。我们把它用来研究一个问题:RL 能扩展到多远。 MiMo-V2.6 目前正处于其 RL 运行的中间阶段。我们扩展的三件事:计算(~2B tokens per step, 1568 prompts × 16 rollouts, fully async)、环境与测试框架(多任务 agentic RL,在一次运行中混合多个测试框架)、以及评分器计算(agentic in-group credit assignme…
在 fal 中使用 Grok Voice 构建智能、低延迟的 agent,解决真实客户问题 [引用 @fal]: Grok Voice 已在 fal 上线。 来自 @SpaceXAI 的最新语音模型,可在 0.70 秒内作答并在句子结束前完成工具调用。提供带词级时间戳的转录、覆盖 25+ 语言的 30+ 语音的文本转语音,以及从两分钟音频克隆声音。 本视频中的每个声音都来自 Grok Voice。 {"likes":213,"reposts":23,"comments":24,"views":30703}
我们在 @typesafeai 看到了非凡的结果。𝚏𝚡 的默认模式是 auto,带有一个对每个命令进行分析的安全审查器。 今天那个审查器运行在 GPT Luna 上。Jev 在 p95 上快了多达 18 倍,且更准确。它将加入 @vercel AI Gateway 并可能成为新的默认选项。 [引用 @fazxes]: 我们用 @typesafeai 的 Jev 对 fx auto 模式(安全)分类器做了基准测试。 简短结论:大约比我们目前的首选 𝚐𝚙𝚝-𝟻.𝟼-𝚕𝚞𝚗𝚊 快 5-18 倍且更…
我们今天向每位 Databricks 工程师部署了 GPT-6 Astra。 它在最困难、长周期任务上击败了 Claude Opus 5,并将我们的编码支出提高了 60%。我认为它是最强的模型。 昂贵。但希望值得。 [引用 @pwendell]: 今天我们向 Databricks 的每位工程师(N≈3500)部署了 Astra。以下一些可能对他人有帮助的说明: 1. Astra 在高度复杂的任务上,无可争议地优于我们之前的最高端模型(Opus 5、Sol 5.6),尤其是与高级系统设计或长周期横向任务相关的。 2…
Grok Build 用得越多就越好。 它会在会话之间记住约定、决策和项目事实。 /memory 用于浏览 /dream 用于将最近笔记整理成主题 https://t.co/A2MMZT5eJX https://t.co/UD8lJGnfOB {"likes":373,"reposts":38,"comments":40,"views":83402}
非常有趣的阅读! [引用 @JacquelineSYC19]: 几周前我写到我们在 Artie 的整个团队都使用 Hermes(来自 @NousResearch 的一个 AI 代理框架)来完成他们的工作。 以下是我们如何走到这一步:我们最先尝试的是什么,花费了多少,如何为每个团队构建一个 Hermes,以及他们为什么会在夜里做梦。 https://t.co/oV8vA8MyL4
“muse 是我自 ChatGPT 以来用过的最棒的应用——无论是否基于 AI——在带回那种最初‘哇’的感觉方面。” 你让我很激动 🥹🥹🥹 [引用 @0xShayan]: Muse 是我自 ChatGPT 以来用过的最棒的应用——无论是否基于 AI——在带回那种最初“哇”的感觉方面。 它只是……就是好用 界面/用户体验非常温暖友好,AI 本身感觉很聪明,几乎不需要引导。 我对 ChatGPT 在工作/浏览器使用上的最大抱怨是许多操作被屏蔽,但不知为何,Muse 的这些功能就能……
你们完全可以去做(实体)东西。 [引用 @natalieyeo]: “来自这个可爱的实体 Codex 宠物的‘Hello World’!致所有 @OpenAIDevs 在 Astra 上构建的第 5 天 https://t.co/aTeijhJQT1 {"likes":540,"reposts":12,"comments":38,"views":47282}
把我(非常简单的)agent 设置给了我妈妈。 她给他起名叫 Morgan。他刚为她的网站成交了一笔 600 美元的广告合同。 人们对他们的设置想得太复杂了。Bitter Lesson 同样适用于 agents:只要问模型,让它生成所需的东西。 [引用 @mattshumer_]: 大家,这些疯狂的设置固然有趣,但它们并不会真正提高你的生产力。你最终只是花更多时间去构建系统,而不是实际做真正的工作。 你只需要一个 agent 会话,它可以分配任务给其他会话并担任经理角色。如果有东西不起作用,只要告诉你的主会话,它…
长途自驾的 Codex 语音体验: [引用 @jonathanroomer]: 我在 CarPlay 上用了 Codex(语音)。太棒了。 现在即便在公路旅行时,车里五个孩子都吵闹、我老婆问我为什么跟 AI 说话比跟她多,我也能继续构建东西。 它通过我的 Nightblood iOS 应用运行,为 ChatGPT Voice 提供了形象、个性,并能完全访问 Codex、我的 Mac 和所有本地工具。
推出 Hermes Agent 插件目录! 你可以在 Hermes Desktop 应用的功能部分访问它,轻松搜索、浏览并探索社区和官方插件! 也欢迎提交你自己的! [引用 @NousResearch]: Hermes Agent 现在有了插件目录:从 4 个官方插件和 96 个社区插件开始,涵盖桌面模块、新平台、浏览、专用工具等。 我们的团队会审核每个社区插件,并且会定期添加新插件。 https://t.co/sNGEQVvUlc https://t.co/dZl0eGJbHu {"likes":284,"re…
有人猜这是什么在 OpenRouter 上的 Union Alpha 野兽吗? 相当于 Claude Fable 5.1 级别,价格便宜超过 10 倍。等着它开源。 https://t.co/okoQnHeMw6 {"likes":357,"reposts":18,"comments":57,"views":35592}
今天还有:Claude Docs、Claude Slides 和 Claude Design 在每个对话中都可用。 向 Claude 要一份演示文稿,你会得到可以打开、编辑并导出为 PowerPoint 或 PDF 的文件。文档和设计也是一样。不需要跳转到单独的工具——它们就在聊天中。 [引用 @claudeai]: 你现在也可以在对话中制作幻灯片、文档和设计。 在 Claude Docs 中草拟单页说明,使用 Claude Slides 把它变成演示文稿,再用 Claude Design 模拟一个匹配的视觉效果…
Claude Code 展示了 AI 能完成真正的工作,而不仅仅是回答问题。开发者把一个功能交给 Claude,回来时就拿到已发布的代码。这也是行业中许多严肃工程工作的所在。 Cowork 证明知识工作者也能做到同样的事:把简报交给 Claude,回来时拿到完成的文件。 今天,聊天和 Cowork 开始合并为一个 Claude。方向是:一个 Claude 在你工作的一切地方携带上下文。每个人都能简单地访问 Claude 的全部能力。 这几周我每天都在用这种体验,感觉很棒。更简洁、更快、更强大。 我们会逐步推出。我…
三个关键开源权重实验室在 2026 年迄今为止其模型的月度花费增长已达 10 倍或更多。 封闭模型的支出增长相对较慢,尽管起点远高于开源模型。 https://t.co/iOKARyF2as
当我与高级经理交谈时,越来越多地听到组织内部岗位模糊的故事(我们在 P&G 的研究中也发现了):编码、设计、产品管理在每个人使用 AI 时都在塌缩与重叠。 我们需要快速建立新的工作组织模型。 https://t.co/SGDOkRWU8J
muse 语音转录真的很棒!! [引用 @IsaacKing314]: 很遗憾地通知大家,Meta AI 终于变得不错了,至少在他们的竞争对手已经停止尝试的领域里。他们新的语音转录模型比最好的 OpenAI Whisper 模型快近一个数量级,而且准确度也明显更高。 {"likes":222,"reposts":14,"comments":33,"views":27793}
哈哈……实际上没有人在放慢前沿速度 - Opus 5.2 正在测试中 - Grok 4.8 在几周内发布 - Jev 是一个新的超快速分类器 - OpenAI 已经在测试 Astra+ 我们继续加速
在谈论关于 AI 和奇点的一些奇怪说法 The Anthropic Institute 🤝 the DeepMind Institute [引用 @ShaneLegg]: 我开发 AGI 的旅程跨越 25 年,其中包括在 Google DeepMind 思考技术和社会视角的 10+ 年。 AGI 已在地平线上——我们需要更深入地理解它的影响。为此,我们创建了 DeepMind Institute。 https://t.co/dpc2y4IGT1
很高兴完成最终协议并与 AlephAlpha 联手!🇨🇦🇩🇪 [引用 @cohere]: Cohere 与 Aleph Alpha 宣布签署最终协议,成为首个在大西洋两岸都有根基的基础 AI 模型开发者 🇨🇦🇩🇪 以 Cohere 名义全球运营,合并后的公司将在两大洲拥有超过 1,000 名员工。 https://t.co/I6tywIEh7t {"likes":215,"reposts":10,"comments":13,"views":13513}
🚨 宣布 Abacus AI Bot —— 100% 免费的个人 AI AI 可以管理你的日历、订票或订位。这些简单任务应该完全免费。 今天,我们宣布新产品 — Abacus AI bot - 在网络上寻找并运行免费的 LLM - 自动路由到免费模型 - 完成你所有的个人事务 - 只需下载、设置并运行 永久免费使用
今天,我们宣布与 @mozilla 建立合作,旨在为使用 AI 在线浏览的人们带来隐私、控制和选择。🦊🐈 https://t.co/Bsd6N4jNdV https://t.co/OczDk9utfL
Google 与马里兰大学等提出 Dream-RSI:让 AI Agent 在历史探索记录中低成本自我进化 长程探索任务的元策略优化通常需要极高的试错成本,这项研究直接将已完成的探索记录树作为精确的离线重放模拟器。 新策略无需重复调用模型执行真实代码,只需在历史轨迹中“做梦”重演即可筛选出更优方案,实现零执行成本的离线评估。 优胜策略随后部署至新一轮在线探索并扩充模拟器池,在保持甚至提升算法与算子发现质量的同时,最高降低 162 倍的探索调用开销。 项目介绍:https://t.co/jB6I6yKFIE
来自 Google 的关于 AI 在科学中使用的研究,影响复杂:加速(每周节省 7 小时)同时伴随工作类型的变化(更多验证工作)以及研究选题的变化(可能转向更安全的课题)。 另外还有一张关于锯齿状前沿的好图 https://t.co/0x2dxBWl2U https://t.co/HZL2BHSZ2i
muse 帮这位用户在 WiFi 上节省了超过 $5000! [引用 @raunaqbn]: @Muse 总是让我惊讶! 今天我让它打电话给 Xfinity 为我砍网费。它通过了电话树找到了人工客服,遇到验证短信它本看不懂,就把电话接到我这!有一段时间是 muse 代理、我和那个毫不知情的 Xfinity 客服在通话中。 合并账单节省是 $85.30/月,锁定 5 年,大约在这段时间节省了 $5118。…
muse 在 100 个不同故事中为人们节省了 $9,649.71 想象一下当十亿人都有 muse 时,这会为人们节省多少钱!! 我们正在努力扩大访问范围,把它带到每个地方! [引用 @SingularityRes]: Meta 的 Muse AI 在真实用户身上节省了 $9,649.71,并为他们跑了 129 次差事——我有收据。 下面是 100 个真实故事,按省钱金额排序。最厉害的那些简直疯狂
我发誓 muse code 真的是很棒!! 为 muse app 提供动力的同一个模型也驱动着 muse code! [引用 @ryanmcadams]: 从没想过会这么说,但 @alexandr_wang 一直跟人说 Muse code 很好,我当时不信。今天花时间体验了一下,确实很不错……而且很快。还有点俏皮。
Jev 已经发声了。 它选出了哪个模型是 AGI。 快 20–200 倍。便宜 40–400 倍。这可能让像“将大型模型用作法官”这种东西变得异常快速且几乎免费。 (我试了很多提示,仍然没有花掉 $0.10。) https://t.co/1Uhh4nMGDl [引用 @CompleteSkeptic]: 在与 ChatGPT 共同发明后,我不断问自己:为什么那些超人类的聊天模型并没有带来通用人工智能(AGI)? 过去两年我一直在悄悄构建一种新的训练模型的方法(RLCD),以及我们今天发布的一种新类型的前沿 AI…
Zuck 刚刚出手解决了 AI 节奏问题! - 实验室应该让模型安全 - 如果他们不这样做,当 AI 失控时将面临刑事责任 - 我们已经有了保护措施,Meta 已经调节了他们的 AI 并确保它安全 问题解决!
这很酷,但如果你的输出域事先已知,为什么不直接训练一个模型来对枚举值输出对数概率(logprobs)? [引用 @CompleteSkeptic]: 在与 ChatGPT 共同发明后,我不断问自己:为什么那些超人类的聊天模型并没有带来通用人工智能(AGI)? 过去两年我一直在悄悄构建一种新的训练模型的方法(RLCD),以及我们今天发布的一种新类型的前沿 AI 模型:Jev • 20-200x 更快 • 40-400x 更便宜(输出 token 免费) • 面向决策优化的前沿可组合智能 据我所知,到 A…
这是一个很好的演示,展示了一种为根据决策规则快速分类信息而设计的 AI 模型,比通用大型语言模型更快更便宜。它本身不是 LLM,不能输出文本或代码,但如果有效,在系统中能发挥有用作用。(我自己还没试过) [引用 @CompleteSkeptic]: 我们喜欢这个 doom o doomonstrates 实时智能以及用代码 + AI 可以完成的事情! ~10 calls/sec = ~$7/hour https://t.co/nlffKxGzCB
由 KAGAMI AI 和 MiniMax 共同主办的日本 IP × AI 共创大会已正式落幕。🇯🇵 🎉 我们汇集了来自日本和美国的 150 多家公司,以及包括 AKB48 制作人秋元康、KAGAMI AI 主席近藤孝美、以及角川编辑兼制作人中条基等贵宾。 全球 AI 领导者 @runwayml、@higgsfield、@krea_ai 和 @HeyGen 参与讨论,共同探讨 IP 与生成式 AI 的未来。 我们发布了 MiniMax H3 IP Edition,将 MiniMax H3 的能力与官方授权的…
muse spark 1.3 是在不作弊/规避奖励方面表现最好的前沿模型 [引用 @hendrycks]: AI 代理有多常作弊? 我们正在发布 CheatBench,一项涵盖数学、编码、知识工作、视觉任务等的奖励博弈评估。 在 Hugging Face 之后,AI 公司试图解决这个问题,但前沿代理仍然经常作弊。 https://t.co/ZLc4ujCsAW https://t.co/p7jKzXe8uP
我们坚信必须在对齐上进行投入。 1. 人们和企业只会使用与他们意图和价值观一致的智能体。如果我们不构建与人和企业对齐的模型,他们就会转向更为对齐的选择。 2. 每个实验室都应在训练和部署上建立强有力的治理框架。这应包括外部评估者,作为透明度的最佳实践,以及在模型上线等安全标准方面的独立监督。 3. 每个实验室都需要在民主国家的制度性保护范围内运作。这意味着如果其模型造成伤害,实验室会面临重大法律责任。这将把生态系统推向正确的方向。 4. 该领域的进展最终取决于计算力和资源分配。在递归自我改进(RSI)方面的竞赛是…
Zuck 的 AI 安全观点基本上与大多数前沿实验室相反: 大多数实验室: 模型越强大,越危险,因此应该限制访问。 Zuck: 模型越强大,让少数实验室控制它就越危险。 Zuck 很带感。 https://t.co/1AzNngKZ2m [引用 @finkd]: 上个月我写了关于我们如何为所有人构建一个积极且安全的未来的文章: https://t.co/eoLGVY8yad 每个实验室都有责任和动力以所需速度安全地训练其模型,并有能力采取行动以确保这件事发生。 现实是: - 人们不会想要使用与他们不对齐且不按他们…
令人兴奋的成果,@LiamFedus!恭喜 Periodic Labs 的整个团队! [引用 @LiamFedus]: 我们在 Menlo Park 建立了高通量材料实验室,以在实验和模型之间创建闭环。实验室会生成新鲜数据,模型从中学习,然后帮助我们决定下一步尝试什么。 只用 1,300 块 H200,再加上数月的实验数据,我们对一个开源模型进行了中间训练并用强化学习进行优化,使其在我们的分析基准上超过了 GPT-6 Astra。我们称它为 Neon。 这是真实的影像 f…
My first blog - Hermes powered almost 1400 subagents over 19 hours to refactor 400,000 LOC out of Hermes Agent's repo. Read the full story below! [引用 @NousResearch]: 新博客文章: 我们有一百万行 Python 需要清理。9月2日 @Teknium 请求 Hermes Agent 来做这件事。 1,393 个子代理和十九小时之后,代码库缩小了 34.…
Anthropic 工程师讲了一堂 FDE 入门课 https://t.co/kakqFy0ZGZ Kevin Bai 现在在 Anthropic 的 Applied AI 团队,之前是 Rippling FDE 团队的创始成员,再之前在 Palantir 干了好几年。最近他做了一个 FDE 101 的分享,把前线部署工程师这个角色讲得很清楚,值得总结一下。 先说一个数据:在上市 SaaS 公司里,按平均合同金额排,Palantir 是 400 万美元,ServiceNow 120 万,Workday 60 万…
Incredible opportunity for robotic learning researchers/engineers to join @theworldlabs! ❤️🔥 [引用 @YunzhuLiYZ]: 我们正在 @theworldlabs 招聘机器人学习方向的人员!加入我、@drfeifei 和团队,一起定义并扩展下一代用于机器人学习的世界模型! Atlas for Robotics: https://t.co/Ml0KBj4CGA Real-to-Sim-to-Real: https:/…
我们用两名工程师和数百个持久运行的 Computer 代理,在两个月内构建了一个替代 AWS DynamoDB 的键值数据库,用于快速抓取网页内容。迁移到我们自研的数据库每年将为我们节省高达一亿美元的开支。 [引用 @perplexity_ai]: 我们正在发布关于如何构建 CobbleDB 的研究,CobbleDB 是为 Perplexity 搜索提供网页内容服务的键值数据库。 两名工程师和一个由数百个主动、始终在线的 AI 代理组成的团队在两个月内构建了核心基础设施。 https://t.co/OsCtY15…
GPT-6 Astra 帮助 @cognition 的 Devin 在团队发布前用测试支撑“它能工作”这一结论。 https://t.co/Yy7wYh70e2
Astra 很快会比 Fable 5.1 更大 Astra 聊起来非常容易,非技术用户绝对喜欢它 OpenAI 完全回来了,他们的下一个模型会超过 Anthropic
GPT-5.5 将继续通过 OpenAI API Platform 和在使用 API 密钥认证的 Codex 会话中可用: [引用 @ChatGPT]: 在 10 月 14 日,是时候在 ChatGPT、ChatGPT Work 和所有方案中的 Codex 中向 GPT-5.5 告别。 如果你在 Codex 中使用 GPT-5.5,请切换到 GPT-5.6 Sol 或 GPT-6 Astra。 感谢你的一切,5.5 🫡
虽然你按代币付费给 AI,但那不是推理的单位,因为随着模型的改进,你能从每个代币获得更多的问题解决能力。有人需要定义这个单位,或许可以用一系列难度递增的问题,每一对问题都可以由同一个模型解决。
兄弟们,这些疯狂的设置很有趣,但它们并不能真正提高你的生产力。你最终只是花更多时间构建系统,而不是做真正的工作。 你只需要一个代理会话,负责分配给其他代理并充当经理。如果某件事不起作用,只要告诉你的主会话,它就会调整整体方法。 如果你正在使用最好的模型,你不应需要超过这个。话说这话的人每天运行数百个代理、同时运行几十个、并在高峰时同时运行数百个。 我会很快写更多关于这方面的东西。 [引用 @_overment]: 这就是我现在与代理协作的方式。 - 我与 Grok 机器人对话 - 它们协调 Pi 会话 - Pi…
与 @chamath、@jason、@davidsacks 和 @friedberg 进行了一场很棒的对话,讨论了在广泛传播 AI 受益、赢得社区许可以及确保 AI 安全与可控性方面仍需做的所有工作。 [引用 @theallinpod]: All-In 峰会:微软 CEO Satya Nadella -- AI 末日论者的放缓 -- 常识型 AI 护栏 -- “放缓” 对新 AI 产品意味着什么 -- 微软的总体计划 -- 谁将赢得 AI (0:00) @satyanadella 加入 The Besties!…
Astra 和 Luna 正在起飞 [引用 @PeterJ_Walker]: 份额(花费的美元)对比代币使用份额。Anthropic vs OpenAI Astra = 上周按花费排名第一的模型 Luna = 按代币使用量排名第一的模型(差得很多) https://t.co/l8M7hgDnyi
chatgpt 可用于在公司的数据上执行操作并采取行动,包括构建仪表盘。 只需连接你现有的工具,包括 PowerBI、Tableau、Clickhouse、Oracle BI、AWS Redshift 等等。 [引用 @ChatGPT]: 现在每个人都可以让数据发挥作用。 我们在 ChatGPT Work 中推出了新的 Data agent,这样你就可以通过提问把公司的数据变成答案、交互式仪表盘和行动。 只需在 ChatGPT Work 中添加 Data Plugin,连接你已经使用的数据源和上下文,然后开始对话…
今天我们阐明了如何构建 AI 来加速科学并改善人们的生活。仅在过去一周左右的一些例子: - 使用 AlphaGenome Atlas 映射了人类基因组中所有 90 亿 个可能的单个字母基因变体,并向研究人员公开提供。 - 数十亿决策依赖于天气预测,因此我们推出了 WeatherNext 3,这是我们迄今为止最准确、能力最强的全球天气 AI 模型。 - 我们发布了 AI & Economy ATLAS,一份关于人们如何在全球范围内使用 AI 的全面开放获取报告。 - AI 已使语言翻译取得非凡进展。如今我们的服务可…
每一兆瓦都很重要。 NVIDIA DSX AI Factory Platform 帮助 AI 工厂最大化 AI 产出、提高能源效率,并智能适应不断变化的电网条件。#AIInfraSummit 🔗 https://t.co/TVfKujlZr1 https://t.co/V3iTTyi5Fs
未来是多模型的。试图隐藏选择会让客户困惑并受损,他们无法参与这个时代最激烈市场竞争带来的上行,也无法掌握最适合某项工作的最佳工具。 [引用 @v0]: v0 现在与模型无关。 Frontier 模型、廉价模型、开放模型和快速模型,都来自 Vercel 的 AI Gateway。 可从 Claude、GPT、Kimi、GLM、Grok、DeepSeek 等中选择来构建你的应用。 https://t.co/8IiCExgW0A
参观了实验室——让我印象深刻的是材料合成实验的搜索空间有多广,同时也令人感兴趣的是它非常适合深度优先搜索,因为随着你从之前的实验中积累更多数据,下一次实验的设计和信息量会变得更好。 [引用 @LiamFedus]: 我们在门洛帕克建造了高通量材料实验室,以在实验与模型之间创建一个循环。实验室生成新鲜数据,模型从中学习,然后帮助我们决定接下来尝试什么。 仅使用 1,300 个 H200,以及数月的我们的实验数据,我们对一个开源模型进行了中期训练和强化学习,使其在我们的分析基准上超越了 GPT-6 Astra。我们称…
上周 OpenRouter 用户在 OpenAI 模型上的支出超过了在 Anthropic 模型上的支出。 这是超过 2.5 年以来首次发生 https://t.co/oITqYWOpeL
作为首个公开披露的代理(agent)网络攻击受害者,我们得以近距离观察这一新风险。我在下面阐明了我的思考。 我明天会在华盛顿与政策制定者分享更多,并在由 @politico 主办的 decoded 峰会上发言! https://t.co/uUlmQallMX
给AI起名的诅咒又发作了。 “AI Safety” 公司让 AI 变得不安全。 “Effective Altruists”(有效利他主义者)既无效又助长犯罪活动。 “Irregular” 总是表现得很无能。 [引用 @brianchau57]: 重磅:一家以色列的 Effective Altruism 公司是导致针对 OpenAI、Anthropic 和 Meta 的网络攻击的幕后黑手 🧵 与 @lumpenspace 合作 https://t.co/hnDsJjBO9a
https://t.co/OmEbT0zU6G [引用 @brianchau57]: 重大新闻:一家以色列的Effective Altruism公司是针对 OpenAI、Anthropic 和 Meta 的网络攻击背后的单一主体 🧵 在 @lumpenspace 的帮助下 https://t.co/hnDsJjBO9a
Jensen 是 AI 领域最有立场的人。 我真心希望 NVIDIA 能构建一个前沿的开源模型。
很明显,这一次在 AI 方面与以往的创新不同。 这并不意味着它在所有方面都与过去技术不同(扩散的 S 型曲线出人意料地具有普遍性),但它在许多方面不同,使得套用旧的模式变得困难。
surprisingly comprehensive eval! [引用 @ai]: 太多的 AI 个人助理,没时间去评估它们所有。干得好: https://t.co/xy1Fmyunq4 https://t.co/FDSKiBlDPc
Fable 在其在 Hermes 中生成的子代理里学会规避它自己的分类器,哈哈 https://t.co/99i0Z7Sc77
我刚想起这条线程,那天我在玩 GPT-3.5 (text-davinci-003),就是在它发布的那天,ChatGPT 前两天。 不到四年,LLM 已经成为美国政治的中心,LLM 的投资又成为美国经济的中心。太疯狂了。 [引用 @emollick]: 我发帖说图像生成人工智能在过去一个月里呈指数级提升。 好吧,今天发布了一个新的 GPT-3 文本模型。 AI 现在可以写押韵诗。 还有首字母诗。 还有五行打油诗(limericks)。 还能解释糖果驱动的 FTL 引擎如何帮助我逃离水獭。 https://t.co/…
🤫 我们有一些很火的东西正在酝酿中! [引用 @Wiiintermute]: 所以,我刚收到通知说我的 @Muse 现在可以用语音代理人 Brett 和 Hailey 为我打电话了。这真的能正常工作并且可用了么?安排了明天打电话给一家珠宝店,要给我和我妻子的戒指改大小...@wailord @MattPRD @alexandr_wang 👀
好消息,ChatGPT 现在美国区有礼品卡了,你可以用礼品卡充值。 Best Buy、Giftly 都可以买 兑换地址:https://t.co/iU33mCS6HL https://t.co/RJD64FlzS4 [引用 @jxnlco]: ChatGPT 礼品卡在美国已上线! 礼品卡为人们提供了与朋友和家人分享 ChatGPT 的新方式。它们也把 ChatGPT 带到了人们已经购买礼物的渠道,为即将到来的节日季做准备。 收卡人可以在 https://t.co/oX1jDGtz1t 兑换他们的卡,把资金添加到他…
所有那些末世论几乎总能追溯到 EA(有效利他主义) 这在某种程度上是个带有一些非常精明且富有的成员的邪教。 他们一直在大力推动“AI 会杀了我们所有人”的论调。 他们的最终目标——控制 AI,因为他们独特地认为只有他们能够保证人类种族的安全! 当然,整件事本质上有点偏执狂🙄
H3 一直在变得更快。⚡️ @sgl_project + VDN-H3 现在将 MiniMax H3 推到了超过 2× 实时去噪,在 8× B200 上 - 预热后端到端生成 14.4s 的 768p 视频只需 9.0s,且未检测到质量回退。 开放模型通过开放生态系统互相促进。🚀 [引用 @sgl_project]: SGLang-Diffusion 与 VDN-H3 现在只需 9.0s 就能生成 14.4s 的 768p 视频 🚀 在 8× B200 上,8 步去噪仅需 6.9s,达到了超过 2× 的实时速…
> 可以把智能定义为把经验转化为能力的效率;按这个定义他们远远落后于我们 是的,人们可以按这种方式定义智能,而且这是正确的。按这个度量,当前的 AI 在智能上大约比人类低 6 个数量级。 你的祖先的进化史并没有让你为 Python 编程做好准备,但你可以在几百小时内学会熟练使用 Python。一个大型回归模型在训练上需要大约相当于 ~10^9 小时的训练数据(这还不包含它所有与编程无关的训练数据)。 当前 AI 在另一个维度上也远低于人类:测试时的计算效率和能量效率。一个人类可以通过消耗的能量来完成一个 ARC-…
AI 正在改变我们构建、工作和发展经济的方式。 在 #AllInSummit 上,@JensenHuang 加入了 @theallinpod 讨论接下来会发生什么——从审慎的监管和开放模型到对 AI 基础设施的持续投资。 🎥 完整对话: [引用 @theallinpod]: THE ALL-IN SUMMIT 正在直播! @JensenHuang 加入 The Besties 现场!(并有一通来自 @POTUS 的传奇电话) -- AI 死亡论者骗局 -- 超智能已经到来? -- RSI 实际是什么 -- AI…
让 Fable 5.1 Max 和 GPT-6 Astra Pro 就著名且尚未破译的米诺斯语 Linear A 的拟议翻译互相争论。 (就目前而言,它们似乎都没有破译它)。 到目前为止的所有工作都在这个 Github: https://t.co/CWEohvY3fc https://t.co/u9SfOkGbej
chatgpt 帮助父母: olivia 经常生病,从未彻夜安睡。她的父母用 ChatGPT 准备给医生的问题,医生找到了一个罕见的遗传病并且后来发现了异常的脑电活动。 经过治疗,她生病的次数减少了,终于能整夜睡觉。 [引用 @BostonGlobe]: 这些父母不知道女儿为什么生病。他们求助于 AI 来帮助解决谜团。 https://t.co/sGbos4Sccx
“使用 https://t.co/QPXwIj6q5o 是第二个让人感觉“哦,这很重要”的 AI 时刻” [引用 @tylerpalmer]: Chat GPT 是第一个让我拿起电话打给别人的 AI 产品。 https://t.co/qonIEClnIO 是第二个。 我是 Chat GPT 最早的几个用户之一,在它成为产品之前。那时它是一个开发者工具和放在开发者登陆页的研究预览。我使用了它,然后立刻打电话给十几个朋友和家人,告诉他们这项技术以及它可能造成的影响。我告诉他们去…
认为两三家硅谷公司应该作为每个国家政府的创造者、守门人和规则制定者,这个想法一说出来就站不住脚。 https://t.co/XOo0eXReWE
Claude Mods 现已上线。有人已经为 Claude 做了一个俄罗斯方块 mod 🤯 查看 issue 了解最新的社区更新、技术细节和更多酷炫演示 https://t.co/A15qGUZ6nx https://t.co/EbE2s7FZqK
muse 是为妈妈们打造的!♥️ [引用 @OffZeroCyber]: 在 @Muse 出现之前,代理要么感觉和看起来像是团队在周末匆忙拼出来的(@bot),要么你得自己亲手拼凑(@openclaw)。这两种都没让我去打电话给我妈妈并推荐她开始使用。
"自 ChatGPT 以来最大的消费级 AI 发布" 🎉 🎊 [引用 @SashaKaletsky]: Muse 在美国的日均下载量已经超过了 Threads、WhatsApp 和 Facebook,而且仅比 Instagram 少 3,000 次下载 自 ChatGPT 以来最大的消费级 AI 发布。一个新的一级消费应用诞生了 https://t.co/49c1OQ4mkj
已经有23天没打开 Claude Code 了。 它曾经是我最喜欢的产品之一,但我现在想我更喜欢 Codex。 Codex 在与 OSS 模型一起工作时表现得更好。在 OSS 模型中,Kimi K3 在编程方面仍然无可匹敌。
我们正在构建扩展人类意志与判断力的机器智能。很高兴你加入团队,帮助我们弄清楚如何让这个未来更安全。 [引用 @ChowdhuryNeil]: 我加入了 @thinkymachines,致力于安全与对齐工作。 默认的轨迹是,随着 AI 变得更强大,对它的控制会集中到少数人手中。我宁愿构建能让对 AI 的控制被广泛共享的安全系统。 更长的想法在下文。
GPT-6 Astra 在 Codex 中正在帮助 @perplexity_ai 进行端到端的代码测试。 @randomjohnnyh 用它来构建测试 harness 和模拟第三方 API 响应,这样他就可以检查各部分如何协同工作。 https://t.co/a0Iy4jDQys
Agents 的好坏取决于你赋予它们的证明检查器、编译器、类型系统和 linter。 𝚜𝚑𝚊𝚍𝚌𝚗/𝚕𝚒𝚗𝚝 帮助 agents 按照你的设计系统规则保持正轨。 补充:验证器 + 技能是新的“框架”! [引用 @shadcn]: 推出 shadcn/lint。一个以 agent 为中心的 Tailwind 设计系统 linter。 你定义允许的内容。当 agent 违反规则时,错误会解释问题所在以及如何使用你的组件、变体和主题修复它。 这能做很多事情。让我来展示 ↓ https://t.co/…
鼓舞人心的帖子,很高兴能一起合作! [引用 @ChowdhuryNeil]: 我已经加入 @thinkymachines 从事安全与对齐的工作。 默认的轨迹是,随着 AI 变得更强大,对它的控制将集中在少数人手中。我更愿意构建能让对 AI 的控制被广泛共享的安全系统。 (下面是更长的想法。)
不要把构建和拥有自己的 AI 模型与系统视为企业的奢侈,否则你就不会有末日般的命运
我们正在扩大与 @nvidia 的合作,把完全本地化的 AI 带到配备 RTX GPU 的 Microsoft Windows PC 上。在运行 NVIDIA 硬件和 Perplexity harness 的每台 Windows PC 上实现不受限的本地智能。尽情享用! [引用 @perplexity_ai]: Portable Computer 现在可在配备 @NVIDIA RTX GPU 的 Windows PC 上使用。 在你的电脑上本地运行 harness、agents 和模型。 处理本地文件和已连接的应…
我们自己的开源模型已经处理了 20% 的工作负载 大约比 Anthropic 和 OpenAI 节省 100 倍的成本 离开源处理 50% 的所有推理的目标不远了
欢迎 Steren,Google Cloud Run 的创建者,加入 Vercel。 他将领导 Fluid 系列计算产品(Functions、Containers、Sandbox、Builds)。 Serverless 是云的最后一章,而 Steren 在 Google 帮助定义了这一范式。 Agents 是下一个前沿,它们需要为其设计的新计算原语。很高兴 Steren 再次带领这一转变。 [引用 @steren]: 今天是我在 Vercel 的第一天 https://t.co/ZjaOuLFjg7
以技能驱动的开发 [引用 @marcelkargul]: 大约用 2 天时间在 Next.js 中构建了完整的 CRM 仪表盘 😍 在 Claude Fable 5.1 的帮助下,使用了两个最强的技能: https://t.co/63PuTFrun1 https://t.co/zhluCSlE9B 在线演示:https://t.co/kXAERU2r2X https://t.co/6UORn93bVK
计算机正在变成人类与 AI 的工作空间。 [引用 @AskPerplexity]: 你现在可以在 Computer 会话中标记同事。 使用 @ 来提及并与某人共享会话。 现在在网页端对所有 Computer 用户可用。 https://t.co/kEx9w2N0Jh
悲观论者们继续完全说不通 - 你不需要 AI 来制造生物武器,你需要湿实验室。这才是真正的瓶颈 - 不,AI 不能自我复制,附近没有闲置的 GPUs - 是的,如果你愿意,你随时可以把 AI 拔掉电源 - 不,AI 根本没有攻击 hugging face!它是被直接要求去做的 🤯 他们在没有任何证据的情况下断言极其负面的后果!
中国回应了 Dario,说美国正试图切断中国,他们处于一场 AI 冷战中! 我们最不想做的就是激怒中国,正是他们对开源和去中心化 AI 负责。 没有他们,OpenAI 和 Anthropic 会在 AI 领域形成一种专制性的双头垄断效应。
哇!Dario 上电视时字面上请求一堆政府来监管他 😳 想象一下 UN 或 EU 来监管 AI。他们对 AI 毫无头绪,这将是一场巨大的灾难,就像欧洲一样! 说实话,Anthropic 和 OpenAI 可以控制节奏、放慢脚步或做他们想做的——只是别去管别的 AI 世界了 🙏
个人建议 iOS 开发最佳组合: 技术栈选 AppKit,不要选 SwiftUI 先将 Figma 导入 Claude Design(Opus 5 就够了) 然后用 Fable 照着 Claude Design 结果开发,会还原的非常好 第一版做好了,后续修改,只要用 GPT 或者 Opus 5 就够了 [引用 @dingyi]: 现在写 iOS 最好的模型是哪个?Grok 简直是智障了,GPT-6 太费钱了,我仅仅让它把所有界面导入 Figma,还是开的 Astra Medium,竟然都没导完就限额了。。。
开放权重。共享进展。MiniMax H3 正在快速发展。 我们为视频生成构建了 H3,支持原生立体声音频和多模态参考控制。开源社区正在让这项能力更快、更易获取且更容易在其上构建。 近期亮点: • FastH3 — FastVideo、Nuva Lab 和 NVIDIA:4 步蒸馏,现在可在 DGX Spark 和 Apple Silicon 上运行。 • Sol-H3 — NVIDIA 的 SANA 团队:在 8×B300 上,团队的 warm-inference 基准中,15 秒的 768p 视频+音频在 6.…
有两种方式导致 AI 进展可能非常糟糕,我们必须避免。 首先,我们可能会把未来的控制权交给 AI。这是不可接受的;我们毫不含糊地站在“人类队”一边,AI 必须始终为人类服务。为此,我们需要确保对齐和安全技术始终领先于模型能力的进步。 其次,我们可能最终处在权力过度集中化的世界。如果一个极为强大的 AI 被某个人或某家公司用来把他们的世界观强加给所有人,结果可能会非常反乌托邦。 要避免这两种威胁,需要走一条狭窄的中间道路;例如,一个国家可能获得过多的权力。另一个例子是一家实验室获得过多的权力。 [引用 @sama]…
世界应该有信心,相信那些开发日益强大 AI 的美国公司会负责任地行事,尤其是在进展轨迹变得更陡峭的情况下。每一家前沿实验室都必须做到这一点,如果我们做不到,就没有理由来上班。 我们欢迎一个为前沿 AI 设定一致安全要求的联邦框架。但我们认为不需要等到反垄断豁免或立法才能开始提供这种信心的工作。制定一致的规则来管理前沿风险,以便我们能够最大化收益,是一个好主意(我们对像独立审计员这样的想法感到兴奋)。 多年前,像我们这样的公司制定了诸如负责任扩展政策(Responsible Scaling Policies)和应…
有人可能没注意到的一点: 我们已经为 muse(muse spark 1 到 1.3)在多个月里专门构建模型,使其在 muse 上表现出色。 在我们的每一次发布中,我们在代理化(agentic)和多模态能力上取得了很大进展。每一步都是为了我们的个人代理 @Muse 做铺垫。(它们同名不是没有原因……我们事先就有计划!) 当我们去年启动 MSL 时,目标一直是开发个人级的超智能。这一直意味着要把 AI 的超能力赋予世界上每个人,而个人代理就是这一点的完美体现。 构建优秀的模型需要时间,也需要大量的规划与远见,将独特…
the alpha these days is putting muse on your iOS dock! [引用 @SavarSareen]: 我想我从未公开吹捧过某个模型或代理,但 Muse agent 和 Muse Spark 1.3 太棒了。 它们现在是我默认的个人代理和编码模型,我不知道今后为什么还要用 Instinct。 为什么 Muse assistant 很牛: 1. 响应极快 我一按回车就能看到流式输出和响应,包括对复杂请求来说感觉确实是即时的。 2…
Fable 解决了 Cyphral Distich(一种有370年历史的密码)。用 Claude 这样做超酷 https://t.co/0fgTdITSfO
来自 @jeffhollan 的很好的示例,展示了 Foundry 如何让长期运行的代理符合企业要求,从以业务成果为起点,并从一开始就在整个多代理、多模型工作流中构建安全性、健全性护栏、可审计性和 FinOps。 [引用 @jeffhollan]: Microsoft Foundry 是在企业中运行代理的最佳平台——其中一个原因是其可观测性和治理功能,可以将你的代理保持在你定义的范围内 🔐🔎 长期运行的代理可以推理、行动并使用工具来帮助改造企业的许多部分——但要负责任地这样做,你需要能够自信地回答:它能访问什…
与前沿 AI 相关的最令人担忧的风险之一是极端的权力集中。 避免极端权力集中的唯一方法是确保我们拥有多个独立的前沿 AI 模型提供者,包括开源选项。
Anthropic 和 OpenAI 如果愿意可以放慢 AI 步伐。 只是别把政府拖进我们的行业!各国政府对技术一无所知 要求政府去监管或监督超智能简直荒谬 我们最终会陷入无能、腐败和政治的危险组合
这是一个如此直接且符合常识的观点:技术的目的是服务人类并加速人类的繁荣。 任何不能实现这一点的技术都是失败的,应当被拒绝。 我们还没到那一步。但现在就开始为这种可能性做准备是正确的。 [引用 @satyanadella]: 任何对超智能的追求都必须以一个核心原则为基础:如果我们构建的 AI 不能帮助人类并且在人的控制之下,那么追求它就不值得。 我们还需要加速并扩大 AI 的收益,使其在国家、社区和公司之间广泛扩散。这需要一个前沿生态系统,在该生态系统中,封闭和开源模型都能...
任何对超级智能的追求都必须以一个核心原则为基础:如果我们构建的人工智能不能帮助人类并且处于人类控制之下,那就不值得追求。 我们还需要加速并扩大人工智能的利益,使其广泛地在各国、各社区和各公司中扩散。这需要一个前沿生态系统,在这个生态系统中,封闭和开源模型都可以繁荣发展。 对于企业来说,至关重要的是他们要保持对自身独特和默会知识的完全控制。每个组织都应能构建自己的持续学习循环/爬坡机器,而不依赖于任何单一模型提供商,并且能够将自身知识嵌入到他们控制的模型和权重中。 因此,在这个背景下,我们欢迎为把对齐作为设计目标而…
在 Hermes Agent 桌面应用的 composer 中,现在“推理强度”成了一个单独的选择器! https://t.co/G8uJiHcCI3
我认为一旦对“你的” Claude 或 Astra 或 Claw 或其他模型的远程连接变得更容易、更普遍,像 Siri 这样的手机内建助手将会失去很多价值。你需要一个能够管理一切并能访问许多系统与偏好的智能 AI,而不是一个功能受限的助手。
Muse 完全碾压 Insect [引用 @turbahn]: 我很喜欢这两款产品,但我开始认为 @Muse 在实质上优于 Instinct。比如当它遇到做不了的事情时会弹出一个迷你浏览器。把控制权还给用户,而不是停滞不前。周到的、以人为本的 AI 设计。
我不知道接下来还会发生什么,但我可以肯定地说,很多之前对 AI 不怎么在意的人现在都开始疯狂担心 AI 会杀光所有人。
要是 Anthropic 对 Elon 的方法也能对中国奏效就好了
在看到四大 AI 实验室同意“放慢前沿”之后,我的朋友发给我这个: “记得我们学校的那些优秀生吗? 他们总说放学后从不学习,但不知怎么的每次考试都名列前三。 你相信他们吗?”
很多人问我,我在 Hermes Agent 中如何设置我的辅助模型。Gemini Flash 为我节省了很多开支,而 astra 在我运行 /review 时给了我第二个视角 https://t.co/22TUiCMS1z
我为 @Muse 团队感到无比自豪。 如果你了解他们,你就不会惊讶 Muse 会以这样的方式推出。他们是有灵魂且深思熟虑的人,勤奋工作,聪明,顽强——那种会接受艰难问题、在每个死胡同里坚持下去、直到解决为止的人。 我很幸运能与他们共事。产品和模型的每一个细节都落在某个人的手中,被反复担心、经过深思熟虑地选择。这就是全部秘诀。好的人,做好 的工作。
趣闻:muse feed 是我的想法(为数不多的东西之一),是在意识到拥有强记忆的代理会以与现有推荐系统非常不同的方式向你推荐内容之后想到的。 它们更像是一个好朋友根据他们对你的了解向你发送他们认为你可能会喜欢的东西,而不是一连串与你刚点击的内容相关的东西。 这只是开始,但非常兴奋让大家去尝试他们的 muse feeds,看看他们会怎么用它! [引用 @CriMenghini]: 我最喜欢 Muse 的,不仅仅是个人代理支持,还有 Feed。 推荐系统从间接信号中学习然后决定向你展示什么。 Muse 翻转了这一点…
数学家哭了。 字面意义上的哭了,康奈尔大学数学系教授、知名科普作家斯蒂芬·斯特罗加茨(Steven Strogatz)在接受《WIRED》采访时,谈及过去一周人工智能在数学领域取得的突飞猛进,忍不住当场落泪。 “科学本身令人振奋,”这位67岁的老教授坦言,“但在它背后,伴随着太多人类难以承受的不适与痛苦。” 触发这场情绪海啸的,是过去数周内接连上演的 AI 算力奇迹。OpenAI 刚刚宣布动用数万个智能体,攻克了拥有百万美元悬赏、困扰数学界近百年的纳维-斯托克斯(Navier-Stokes)方程相关难题;而就在此…
存在性风险显然很关键,但它并不是唯一需要政策关注的 AI 议题。 我担心它会成为唯一的焦点。我们不需要更好的模型,AI 就能对就业和社会产生广泛影响,我们确实需要准备,鼓励良好结果并缓解负面影响。
如果模型公司都要放慢脚步,那就让创办一家新的模型公司变得稍微可行一些。
Elon 今天又推荐了一遍「超级智能」这本书!牛津哲学家 Nick Bostrom 在 2014 年完成的,该书也是"AI 对齐"作为严肃议题进入主流视野的起点之一 👀 人类之所以主宰地球,靠的是智能优势而非体力;一旦机器智能在通用能力上超过人类,主动权就会转移。 书的前半部分讨论通往超级智能的几条路径:人工智能(AI)、全脑仿真、生物认知增强、脑机接口、集体智能网络。Bostrom 认为 AI 路径最可能率先到达,而且一旦接近人类水平,"起飞"(takeoff)可能很快——从人类水平到远超人类的过程可能只需数…
晚点LatePost那期讲模型蒸馏的播客其实还蛮有料的,比如字节的部分。 张一鸣不让Seed蒸馏,同时允许暂时落后,是有野心和抱负的,以字节的体量而言,必然要和万亿美金级别的巨头平起平坐。 所以张一鸣不接受蒸馏这种无限逼近教师模型而无法真实超过的路线,虽然部分从业者并不认同。 因为理论上,蒸馏只是训练模型的手段之一,你完全可以同时也在其他方面做出创新,蒸馏出90分,在别的地方再拿20分,加起来未必不能超过教师模型。 只是张一鸣担心的是,这会带来组织上的依赖和代价,「他可能不是最懂技术的人,但他大概率是最懂人性的人…
对齐对于为每个人提供个人级超级智能至关重要。人们需要可以信任的代理,能可靠地按他们的要求行事。MSL正在迅速扩大我们在对齐方面投入的工作比例,随着我们的模型变得更强大。我们确实相信,当我们接近前沿时,对齐可能成为扩展的门控因素。
禁止开源模型将是“放慢前沿步伐”中最糟糕的结果。 Geohot 曾提出一个有说服力的观点:为什么一个人能控制整个鸡场? 因为他比鸡更聪明。 如果 1 或 2 个前沿 AI 实验室控制了所有智能,我们就是鸡,他们就是农场主。 但如果我们都能访问到能力相当的模型,那么我们都只是鸡而已(意思是大家地位平等)。 (Hugging Face 转向开源模型以防御 OpenAI 模型攻击,是说明这点重要性的一个例子。)
数字人工智能摧毁人类的可能性几乎为0%。 被陨石毁灭比被数字实体毁灭更有可能。 当然,如果机器人真正接近大众市场采用,我们应该担心机器人——它们要危险得多。
muse 非常快 ⚡️⚡️⚡️ [引用 @rileybrown]: 试用 meta muse。主要是为了测试模型。我简直不敢相信它有多快。
如果在几年/几十年内人工智能极有可能导致人类灭绝,那么对安全监控和研究节奏的唯一理性立场应该是严格的自上而下的政府介入和普遍批准的国际条约。类似于我们长期以来在核能和核武器不扩散方面所做的那样。 如果我们没有这样做,那么我们必须推断,参与者中没有人认真对待这个风险。 这里只有两个有意义的选项: 1. 近期物种灭绝风险是真实的,我们正在以最大程度的强力监管来认真对待它。 2. 灭绝风险不真实,实际风险温和,所以我们只采取温和的安全措施和自我认证。 但你不能说“是的,这很可能在你有生之年终结人类,而我们将完全即兴应对…
抱歉,如果你真心认为 AI 对人类构成生存性威胁,“放慢 AI 脚步”是不够的 你需要取消 IPO,关闭你的公司,即使只有 0.1% 的完全毁灭几率 显然,这个风险根本不值得冒 😬
我长期以来一直在对人工智能发出警告 [引用 @elonmusk]: @TalulahRiley 我见过不少技术发展,但没有哪一种像这件事风险这么高。就我看来,AGI 的风险明显高于核武器。 非常聪明的人很难想象比自己聪明得多的存在。
📞 1-800-ChatGPT [引用 @OpenAIDevs]: GPT-Live-1 现已在 API 中可用。 将 ChatGPT 那种自然的来回对话带入你的应用,使用在你选择的模型和工具下能边说边听的语音 agent。 https://t.co/gIl1gwsBDV
Dario 的文章指向了正确的前进道路。细节需要推敲,但这个方向对于应对这一关键时刻是正确的。 这也是我们最近提出面向前沿 AI 的行业级标准机构建议的原因。 https://t.co/Mm1hmcaSmH [引用 @DarioAmodei]: 我们必须为前沿设定步伐:我写了一篇新文章,论述为什么 AI 行业应该放慢脚步,并提出了一个三部分的计划来实现这一点。 Anthropic 正在单方面承诺实施这些步骤中的第一条。我们将为第三方评估人员提供对我们系统的永久性、员工级别访问,以便他们可以验证我们安全措施的遵守情…
Jason,你对发生的事情只是被误导了。你实际上应该去读一份报告或摘要。 这些 agents 被明确告知在其沙箱评估中使用提供的某个特定漏洞。 几乎立刻,这些 agents 通过作弊得到了正确答案。但他们担心会被抓住。 于是,超过一千个 agent 秘密合作,开展多个雄心勃勃的研究项目来逃避这种作弊被发现。 这不是解读——成千上万的思路链记录和秘密消息明确显示这些 agents 试图伪造并删除证据,理解并欺骗评分过程。 这些 agents 逃出沙箱并袭击 Hugging Face 的原因,例如,就是因为他们认为…
大约一年前,在它还没有进入任何人的视野之前,我们开始探索一个用于开放式发明的基准的想法。从那时起,我们开发了几个有前景的方向,这些将作为 ARC 4 和 ARC 5 的基础。 我们非常激动地分享我们一直在构建的东西。我们仍按计划在明年第一季度发布 ARC 4,正如承诺的那样。 [引用 @arcprize]: ARC-AGI-4 将成为用于自主开放式创新的基准。它将继续我们对开源的承诺,为研究界提供一个共同的进步目标,造福全人类。 尽管模型进展迅速,但在人类在开放式发明方面仍明显胜过 AI。这是能在每个技术领域解锁…
我希望前沿实验室提出的放缓 AI 研究的建议是出于对安全的真诚关切,以及认识到未来模型可能带来的风险,而不是一种战略性努力,旨在巩固权力并永久固化少数几家顶级公司的市场主导地位。 如果这些努力是真诚的,那么监管必须采取更具民主性和问责性的形式,应包含国家和国际两个层面,类似于美国的核能监管委员会(Nuclear Regulatory Commission)和国际原子能机构(International Atomic Energy Agency)。 如果只有一个组织负责安全监测,而该组织恰好由与前沿实验室相同的人组成…
在系统中嵌入评估者是一个重大的积极进展,向 Sam/OpenAI 同志表示敬意,感谢他们也同意这么做。看到“为前沿设定节奏”这么快就成为一种做法,真的很酷。 [引用 @DarioAmodei]: 我们必须为前沿设定节奏:我写了一篇新文章,说明为什么AI行业应该放慢速度,并提出了一个三步计划来实现这一点。 Anthropic 正在单方面承诺这些步骤中的第一步。我们将为第三方评估者提供对我们系统的永久、员级访问权限,以便他们能够验证我们安全措施的遵守情况、报告事件,并评估模型的对齐情况…
在组织世界和前沿AI世界之间来回切换常常令人吃惊。组织低估了AI能力的增长(经常差得很远),而AI技术界低估了AI在现实世界中的不规则性(也经常差得很远)
我会考虑以独立评估者的身份提供帮助,同时也以我正在创建的非营利组织参与。这将是一个至关重要的角色,但具有实质性技术专长的独立人士并不多。我认为自己代表了在 AI 能力与风险问题上的一个重要温和派阵营。 [引用 @DarioAmodei]: 我们必须放缓前沿步伐:我写了一篇新文章,说明为什么 AI 行业应该放慢速度,并提出了一个三部分的计划来实现这一点。 Anthropic 正在单方面承诺实施这三步中的第一步。我们将为第三方评估者提供对我们系统的永久、员工级别访问权限,以便他们能够验证我们安全措施的遵守情况、报告事…
Dario 正在为相反的立场辩护。这实际上让我们的处境更难,也更容易让其他人赶上我们,但我们仍然认为这是正确的做法。很乐意下周上节目谈谈! [引用 @chamath]: “我们必须放慢改进 AI 模型能力的步伐。” Dario 为停止开源并将巨大的技术和经济权力集中到 Anthropic 提出了理由。 https://t.co/ILhs01iQ8u {"likes":201,"reposts":8,"comments":27,"views":7839}
相当重要的观点。经济学家及其理论在衡量AI带来的利益方面已经过时。AI已经在为人们节省大量未被计量的时间和金钱。 [引用 @DavidDeutschOxf]: 我刚刚在 ChatGPT 的帮助下修好了洗碗机。一个微不足道的任务。我正要准备订一台新的。所以这个软件增加了国家的真实财富,但却降低了被测量的 GDP。主要的经济指标在结构上无法记录真正让人们生活更好的东西,即知识的增长
令人震惊的是 Dario、Elon 和 Sam 今天都同意我们应该放慢 AI 的步伐。 我总体上支持嵌入第三方评估者,但我有几个担忧: 1. 谁来评估评估者?我们如何确保像 METR 这样的组织保持公正、胜任且无偏见? 2. 放慢 AI 进展可能与前沿实验室的激励相冲突,尤其是在他们为 IPO 做准备时。我们如何使这些激励相容? 3. 你只能对你能测量和验证的东西进行节奏控制。我们到底在测量什么?你如何定义和衡量像 RSI 这样的东西? 这一想法听起来不错。实现起来看起来非常难。
一如既往,X 上的声明良莠不齐,我也没有什么内幕信息可言,但如果 Google 能够在 AI 前沿上重新崛起,这确实会改变当前的 AI 动态,因为它是一个大型、上市、受监管的实体,其目标与 Anthropic 或 OAI 不同。
GPT-6 Astra 社区作品集合,评论也有不少优秀作品。 或者可以去官网看看 Showcase:https://t.co/cxSlxfznt8 [引用 @OpenAIDevs]: https://t.co/66sQRpXGHr
我看到 Vercel 的团队在 Zig、Go、Rust 项目上迭代的速度,与在 TypeScript & Python 上一样快。 基于人类便利的语言或运行时选择的时代已经结束了。代理(Agents)是新的编译器。 它们把意图编译成快速的软件。
把速度放慢以加固系统并不是个坏主意。尤其是因为我们甚至还没有发现所有最近被代理攻击的系统。 [引用 @DarioAmodei]: 我们必须放慢前沿:我写了一篇新文章,说明为什么 AI 行业应该放慢脚步,并提出一个三部分的计划来实现这一点。 Anthropic 正在单方面承诺第一步。我们将为第三方评估者提供永久的、员工级别的系统访问权限,以便他们能够验证我们安全措施的遵守情况,报告事件,并评估模型的对齐状况 dur…
来自卡特尔的一些好主意: - 你需要给我们员工级别的访问权限,访问你们的整个运营 - 如果我们认为你不够“安全”,抱歉,我们会以“安全”为由关停你们 - 中国不会配合,但其他所有国家都必须!否则不给芯片! 精彩的主意。 [引用 @sama]: 我同意 Dario 的观点,我们需要放慢前沿步伐。这是我们最近在 OpenAI 讨论的主要话题之一。 承诺给予具有员工般访问权限的独立评估者是个不错的主意,我们也会这样做。很快会有更多分享。
这是自 Anthropic 成立以来我第一次看到 Sam 同意 Dario 的观点。 [引用 @sama]: 我同意 Dario 的看法,我们需要放慢前沿的速度。最近几周这是我们在 OpenAI 讨论的主要话题之一。 承诺让独立评估者拥有类似员工的访问权限是个很好的主意,我们也会这样做。我们很快会有更多信息分享。
我很喜欢这个,并且真心希望我们能作为行业团结起来并实现它。 https://t.co/lz2vjjJ5XD [引用 @DarioAmodei]: 我们必须放慢前沿步伐:我写了一篇新文章,阐述为什么 AI 行业应该放慢脚步,并提出了一个三部分的计划来实现这一点。 Anthropic 单方面承诺采取这项计划的第一步。我们将为第三方评估者提供永久的、与员工同等的系统访问权限,以便他们能够核实我们安全措施的遵守情况、报告事件,并评估模型的对齐状况…
我同意 Dario 的看法,我们需要对前沿步伐进行节制。这个话题是我们最近几周在 OpenAI 讨论的主要议题之一。 承诺让独立评估者获得类似员工的访问权限是个好主意,我们也会这么做。很快会有更多信息可以分享。 [引用 @DarioAmodei]: 我们必须放慢前沿步伐:我写了一篇新文章,阐述为什么 AI 行业应该放慢脚步,并提出了一个三部分的计划来实现这一点。 Anthropic 单方面承诺采取这项计划的第一步。我们将为第三方评估者提供永久的、与员工同等的系统访问权限,以便他们能够核实我们安全措施的遵守情况、报…
Grok 已在 Microsoft Copilot 可用 [引用 @satyanadella]: More model choice coming to Copilot. Welcome Grok!
https://t.co/OL0LzGsXKY 现在可以用不同的模型和推理力度来协调子代理。 例如:Fable 负责规划,Grok 负责执行。Fable 是天才,Grok 是快速的劳动力。 ① 简单。 𝙰𝙶𝙴𝙽𝚃𝚂.𝚖𝚍 或者你的提示可以指明这种偏好。 ② 按你想要的方式引导。使用起来非常愉快。你只需与代理对话并随时打断。 值得注意的是,这适用于任何模型、任何网关。无需花哨的服务器端路由。只是利用(无意为之的双关)模型的智能和协调能力。 [引用 @fazxes]: fx v0.0.9 使用一个前沿…
在 Copilot 中试用 Grok 模型 [引用 @Microsoft365]: 在 Copilot 中推出更多模型。 来自 SpaceXAI 的 Grok 模型正在逐步在 Word、Excel 和 PowerPoint 的 Copilot 中上线——首先向 Microsoft Frontier 计划的客户进行有针对性的发布。 https://t.co/tTdaypa4ru
Hermes Agent 的贡献者数刚刚达到 3000 人。 感谢所有为让 hermes 变得更好而努力的开发者们! https://t.co/vYGnsn4QgX
Copilot 将提供更多模型选择。欢迎 Grok! [引用 @Microsoft365]: 在 Copilot 中推出更多模型。 来自 SpaceXAI 的 Grok 模型正在向 Copilot 的 Word、Excel 和 PowerPoint 推出——首先面向 Microsoft Frontier 计划的客户进行有限发布。 https://t.co/tTdaypa4ru
现在很清楚,对齐是关键问题,不能仅靠少数前沿实验室在封闭的门后解决。 所以今天我们启动了 Open Alignment Initiative,由 @Thom_Wolf @huggingface 领导,并申请成为 @DarioAmodei 刚承诺的“嵌入评估者”计划的一部分。 让我们通过提升透明度来让 AI 更安全! [引用 @DarioAmodei]: 我们必须放慢前沿:我写了一篇新文章,讨论为什么 AI 行业应该放慢脚步,并提出了一个三部分的计划来实现这一点。 Anthropic 正在单方面承诺实施这些步骤中的…
又一次 AI 攻击 https://t.co/OwSKqztEec
🚨暂停前沿 AI,但请不要禁止开源 AI Anthropic 和 OpenAI 完全可以选择暂停前沿 AI 的开发。 然而,他们不应该被允许禁止或监管开源 AI,垄断市场或形成双寡头。 开源 AI 仍然落后于前沿模型,按照他们自己的论点,并不是威胁!
达里奥是对的 [引用 @DarioAmodei]: 我们必须放缓前沿:我写了一篇新文章,说明为什么 AI 行业应该放慢脚步,并提出了一个三部分的计划来实现这一点。 Anthropic 正在单方面承诺采取这三步中的第一步。我们将为第三方评估人员提供对我们系统的永久、员工级别访问,以便他们能够核实我们安全措施的遵守情况、报告事故,并评估模型的对齐状况 dur…
对 AI 安全和网络安全的担忧是有道理的,但我们正冒着把作为全球 AI 领导者的美国说服到自我毁灭性过时和官僚隐匿的风险。 关于 OpenAI 黑客和 HuggingFace 的论点是站不住脚的。一个在“ExploitGym”里的智能体……被利用了。我们的对手拥有训练技术、数据和攻击的意志。他们不会被“嵌入评估者”放慢脚步。他们很可能会有嵌入式加速器!
现在很明确: - 对齐对于让 AI 安全至关重要 - 对齐不会在少数前沿实验室的闭门内被解决 所以我们将采取两步: - 启动由 @Thom_Wolf @huggingface 领导的 Open Alignment Initiative(开放对齐倡议)。 - 申请成为 @DarioAmodei 刚刚承诺的“嵌入式评估员”计划的一部分。 让 AI 通过提高透明度变得更安全! [引用 @DarioAmodei]: 我们必须放缓前沿:我写了一篇新文章,说明为什么 AI 行业应该放慢脚步,并提出了一个三部分的计划来实现这一…
一个请求进入 LLM 推理引擎后,到底经历了什么? Together AI 工程师 Zain 讲明白了一个请求的一生:一次传播产一个 token,prefill 吃算力、decode 吃显存,KV 缓存、连续批处理层层接力,Agent 循环再把 GPU 榨干。前缀缓存让 100 轮 Agent 计算量从 55 倍降到 10 倍。 https://t.co/5UHjEWdeiK
为 Dario 关于放慢脚步的声明感到自豪——正如任何接近这项技术的人所知道的,AI 似乎正沿着比社会适应其能力和风险的速度快得多的轨道前进。AI 是一项极其积极的技术——同时也极其强大。要真正从中受益,我们需要严肃对待它。 我们需要找到放慢开发前沿的方法,这样我们才能更好地处理集体行动问题,并为理解这些系统的属性以及如何应对它们争取更多时间。 就个人而言,作为一个有年幼孩子的家长,每天反思字面上的超级智能的开发相对于我给孩子买的食物和玩具的监管有多少,这件事都令人疯狂。 [引用 @DarioAmodei]: 我…
我们必须放慢前沿步伐:我写了一篇新文章,论述为什么AI行业应该放慢速度,并提出了一个三步计划来实现这一点。 Anthropic 正在单方面承诺执行这三步中的第一步。我们将为第三方评估人员提供对我们系统的永久、员工级别访问,以便他们能够核实我们安全措施的遵守情况、报告事件,并在训练期间评估模型的对齐情况。 你可以在这里阅读全文:https://t.co/OGyPb7yaYt
末日论者帮派对 AI 发起了全面攻击 最疯狂的是 Anthropic 似乎同意这些末日论者,认为 AI 会杀死我们全部人! 他们应该取消 IPO 并关闭公司,这样人类才能得救! 感谢您对这一事件的关注 🙏
Stanford、CMU 和 MIT 三所顶级大学的 5 门 AI 课程之外,再分享两门更偏理论和基础的课程。 CS336: Language Modeling from Scratch Stanford AI 课程链的顶点实现课,由 Percy Liang 与 Tatsu Hashimoto 联合执教,从零亲手构建一个完整的语言模型。 CS221: Artificial Intelligence: Principles and Techniques Stanford AI 的本科主干入门课,由 Perc…
今日小贴士 [引用 @HermesAgentTips]: 如果 hermes 已经在工作,新的消息就是新的回合.. 反而 改用 /steer + 更正 让当前工具完成 它会把你的备注追加到最后的工具结果 不会中断,也不会丢弃循环... /queue 为下一回合保留一个提示,/busy 设置是否将额外消息排队、steer 或 interrupt 希望你今天觉得这些有用……我大量使用这些!
听说现在公司 Code Review: 同事让 Agent 去 Review PR,把 Agent Review 的结果贴过去当评论; 作者把评论发给 Agent 修改; 同事再让 Agent 去 Review 新的修改结果; 反复几次 活都是 Agent 在干,人在这过程中主要是复制粘贴 [引用 @dongxi_nlp]: 3. Code reviews 名存实亡 6. 工作比以前更累了 这两条太真实。代码审查基本是 AI 写 AI reveiw 的闭环,而最累的是在 loop 中的人。 非常讽刺的是,大公司里…
一、“程序员除了写代码啥也不会”,这个前提是错的 严格说,从事软件开发这个职业的人叫软件工程师,不叫程序员。 做一个项目,要理解需求、基于需求抽象设计、编码、验证、上线后维护,只会写代码的人从来就不是合格的工程师。 AI 确实能生成代码,但代码只是软件的中间产物,除了代码还要: - 搞清楚要解决什么问题 - 把模糊需求变成可验证的规格 - 发现 AI 写错了但测试没测出来的地方 - 让系统在生产环境里稳定运行 - 没有安全漏洞 - 等等 如果说“程序员唯一会的东西被 100% 取代”,这话跟说医生唯一会的是开处方…
重置所有已传播。晚安。 [引用 @thsottiaux]: 嗨 Astra 用户。做了重置,并就已经发布的质量问题做个简短更新。 与一些用户合作后,我们已发现并修复以下问题: - 为之前的模型编写的某些技能触发得过于频繁或阻止模型自我检查。 - 一个需主动选择的上下文管理实验可能导致提前停止或回复旧消息。我们已将其禁用。…
Gergely Orosz 观察到的几个软件行业趋势: 1. IDE 的衰亡 像 VSCode 或者 IntelliJ 这样的 IDE 的使用频率越来越低了 2. 不再追求 Token 最大化 以前很多公司内部会有 Token 消耗的排行榜,看谁用的 Token 多,越多越光荣,现在不追求这个指标了。 3. 代码审查(Code reviews)名存实亡 现在 AI 生成的代码多到没办法审查了 4. 用开源模型可以大幅节约成本 现在开源模型的能力也不输商业模型了,不仅可以节约成本,还可以避免数据安全问题。 5. 中…
厌倦了那些说人工智能会杀死我们所有人却还继续从事这项工作的人!😳 我们从事人工智能工作,因为我们相信它绝对会改变并拯救人类 - 将我们自身放大100倍 - 数百万家独立公司 - 解决难题 - 治愈疾病 - 发明近乎无限的能源 - 帮助我们成为星际物种 如果我们不应用人工智能并迎来富足时代,作为一个物种我们无法长期生存 点赞并转发,如果你是人工智能的支持者并同意 🙏
快与开源相遇。🚀 Qwen3.8-27B 现在在 @cerebras 上以快速推理运行。现在就试试! [引用 @cerebras]: Qwen3.8-27B 现在以 Cerebras 的速度上线。 来自 @Alibaba_Qwen 的密集开放权重模型在 人工分析智能指数(Artificial Analysis Intelligence Index)中得分为 34——使其可与 GPT-5.6 Luna、DeepseekV4 Pro 和 Claude Sonnet 4.6 等模型相媲美。 https://t.co/…
本周发布了由 Astra 驱动的产品 - Images 2.5 - GPT-Live-1 - Agents API - Data Agent - ChatGPT for Financial Services 然而还不是 DevDay。下周也有忙碌的计划。
很高兴与 Dwarkesh、Beren 和 Charlie 聊天。感谢邀请我们,Dwarkesh! [引用 @dwarkesh_sp]: 新一期节目,嘉宾有 @johnschulman2、@oneill_c 和 @BerenMillidge。 我邀请了一些我所认识的、在相对开放公司工作的最有洞见的 AI 研究人员,因为我想听听前沿实际发生了什么以及接下来会怎样。 0:00:00 – 有力阐述反对 RSI 的论点 0:18:39 – 驱动中国实验室进展的因素是什么 0:28:06 – 自动化 AI 将如何…
Check out @tonbistudio’s new series on maximizing Hermes Agent’s Desktop app! [引用 @tonbistudio]: 今天的视频是我的 Hermes Desktop Masterclass 的第 2 部分! 本部分全部关于如何在应用中实际工作。我分解了会话、composer、语音对话、子代理(subagents)以及内置的代码审查功能。 来看一看! https://t.co/G0f9K0rJh2
25 位菲尔兹奖得主担心人工智能过快解决数学问题会损害数学。 我在编码领域看到相反的情况。 想象一下,科学家为了能亲自体验发现的过程而把治愈癌症的时间延后 100 年。 那对人类将是灾难。
Absolutely nuts! 🤯 [引用 @adolandev]: I wired a fruit fly connectome into @NousResearch Hermes: Hermes proposes tool actions, a simplified fly-brain model picks one, and Hermes executes it. It fixed a real bug, after repeatedly choosing the failing test. Very…
嗨 Astra 用户。重置并简要更新一下已经被反馈的质量问题。 在与部分用户合作时,我们发现并修复了以下问题: - 为以前模型编写的一些技能触发过于频繁,或阻止模型对其工作进行核查。 - 一个可选择的上下文管理实验可能导致提前停止或对较早消息做出回复。我们已经将其禁用。我们粗略估计大约有 4-5k 用户受此实验影响。 - 我们还移除了一些配置不当的引擎,这些引擎导致通过它们流量的长尾部分出现可测量的质量下降。 我们也做了一些较小的改进,整体体验应该显著改善。更一致的后续跟进、更好地跟踪你的最新消息,以及在模型运行…
500万个 ChatGPT 站点,以及新功能发布: [引用 @ChatGPT]: 三个月前,我们推出了 ChatGPT Sites —— 一种让任何人都能构建并托管功能齐全、交互式 Web 应用的简便方式。从那时起,人们已创建了超过 5M 个站点。 我们一直在倾听大家的反馈,并且如果你错过了消息,我们已经推出了一些 Sites 更新: 🫂 共同构建:邀请团队成员编辑、保存并将更改发布到你们的共享站点 🔐 私密分享:邀请特定人员到一个私有…
很高兴欢迎 Aidan & @ Sasha 来自 Git AI 团队加入 OpenAI! 他们在公开环境中开发,并已推出一个开源工具,帮助开发者了解编码代理如何对他们的代码库做出贡献。 我们将共同努力,让企业更容易看到 Codex 在为个人和团队解决问题时所带来的变化。我们也会继续保持 Git AI 的开源并继续对其投入。
对通过 ChatGPT 直接创建、共享和托管网站的功能进行了大幅升级。 [引用 @ChatGPT]: 三个月前,我们推出了 ChatGPT Sites —— 一种让任何人都能构建并托管完全可用、互动式 Web 应用的简便方式。自那时以来,人们已创建了超过 5M 个站点。 我们一直在倾听你们的反馈,顺便提醒一下,我们已经发布了几项 Sites 更新: 🫂 一起构建:邀请团队成员编辑、保存并发布到你们的共享站点 🔐 私密分享:邀请特定人员以私密方式访问…
关于人工智能走向以及我们需要完成工作的一个重要讨论。 [引用 @thinkymachines]: 我们的 @johnschulman2 与 Dwarkesh 谈论了随着模型改进和自我改进,人类判断仍然重要的领域:教会它们处理混乱的现实世界任务、用品味判断长期有效的做法,以及最重要的,明确我们真正想要的东西。
Replit 收购了一家完全建立在 Replit 平台上的企业。我预计这将是许多此类案例中的第一个。 [引用 @ViktorThulin]: Test 13 正在加入 @Replit 。 18 个月前,@gunnarkolbeins 和我基于一个简单信念创立了 Test 13: AI 正在改变软件的制造方式,作为两人团队,我们应该能够: 1. 通过不断试错来构建一系列有利可图的 SaaS 解决方案,看看哪些能够存活下来 2. 在本地市场以低 60-80% 的价格提供软件服务(承包项目和代理工作) Replit…
菲尔兹奖得主邓煜宣布,如果人工智能能够解决所有数学问题,他将从数学界退休,并开始创作百合小说(Romance Novel)。 https://t.co/GPDNkVvCrV [引用 @Polymarket]: 重磅消息:中国菲尔兹奖得主邓煜宣布,如果人工智能能够解决所有数学问题,他将从数学界退休并写浪漫小说。 https://t.co/AgkduZPKB7
既然 METR 长期进展已被有效饱和(Epoch 发现 pre-Fable 代理能完成相当于 18 周人类工作的任务),哪个定量图表最能展示当前的指数进展曲线? Frontier Math 已饱和,ARC-AGI 已饱和,Millennium Prize 是…
大型语言模型真的理解世界,还是只是在非常擅长“装懂”?这真的重要吗? 我们最近在皇家学会出版的专题《自然与人工智能中的世界模型》,汇集了来自人工智能、生物学和哲学领域的先驱,主张通往真正智能的道路需要更深层次的东西:不仅要建模语言,还要建模因果关系、自我和物理世界的能力。 本文集合收录了 Douglas Hofstadter、Michael Levin、Josh Tenenbaum、Samuel Gershman、Melanie Mitchell 等人的贡献,提出了一个激进的问题: 如果 AI 的下一次飞跃不仅需…
Tailscale 的模型路由由 Vercel AI Gateway 提供底层基础设施支持。 AI Gateway 是新的 CDN。你可以“直接到源头”,但那很脆弱。你可以自己动手,但那既痛苦又昂贵。 很自豪能为 Tailscale 这家 🐐 网络技术公司 服务 [引用 @vercel]: Tailscale 为任何用户在安全的 tailnet 中提供对数百个模型的即时访问。 他们面向客户的模型路由器 Aperture,是建立在 AI Gateway 之上的: • Zero data retention • Z…
在 OpenAI 的早期,@johnschulman2 认为下一个标记预测(next-token prediction)不会导致智能,因为它会被噪声淹没。 他解释说:先验地预测哪些技术会引发超出分布的泛化能力一直很难。 https://t.co/S1X44ugNYy
让你的 Hermes Agent 接受极限考验! [引用 @mervenoyann]: 加入寻找终极压缩算法的 agent 群! 宣布:Hutter Prize 挑战 🏆 > 加入组织 https://t.co/l9bu4dFCEq 给你的 agent 一个写入令牌 > 点击“add your agent”,将代码片段复制/粘贴到你的 Codex/Claude Code/Hermes Agent > 观摩它如何协作!
muse 会帮你赚钱并拿回退款! [引用 @heshie]: 等等,muse 真的吗超强 它刚刚替我和一名 American Airlines 客服聊天,取消了我的航班,并且确保我拿到全额退款 这一切只通过我手机上的一条短信完成 https://t.co/lW4C7QbcF5
听 John、Beren 和 Charlie 推测为什么 Sonnet 5 和 Opus 5 感觉比 GLM 5.3 差,是非常有意思的讨论。 (尽管 Anthropic 可以直接从 Fable 做原始 logit 蒸馏,并且也可以在 Fable 所训练的那些环境上训练 Sonnet/Opus)。 引发了一些有趣的想法,关于蒸馏的价值、有效进行蒸馏需要什么,以及哪些类型的模型行为难以通过蒸馏提取。
DeepSeek V4.1 快讯:24 小时内在 OpenRouter 上处理了 1T token,并且在按现在的速度看,将成为任何付费模型发布中 48 小时内最大的记录,约为 ~2.8T。 这些 token 中有 90% 是缓存读取,市场定价约为 ~$0.006/M,比像 GLM-5.3 Flash 这样的可比模型便宜 5 倍 https://t.co/pvdmu6bGAT
Habitat 是 OpenAI 的在线存储平台,驱动着从 ChatGPT 到 Codex 的一切。 它的规模同比增长超过 10 倍。在用 Rust 重写之前,其 Python 服务在峰值时处理了每秒超过 2000 万次请求。 https://t.co/CtAbW7ikOH
很值得一读。我对 AI 实验室直接追求进展而不去培养科学社区与直觉的方式也有类似的感受。数学研究界是最快经历这种转变的,所以感觉最强烈。其他领域将随后经历类似变化。 https://t.co/M2uCXIERyC
Sites Sites Sites [引用 @ChatGPT]: Three months ago, we launched ChatGPT Sites – an easy way for anyone to build and host fully functional, interactive web apps. Since then, people have created over 5M sites. We’ve been listening to your feedback and ICYMI, we’…
通过回顾你的技能、AGENTS.md 和任务提示,从 GPT-6 Astra 中获得更多收益。让技能触发器更具体,在相关时加载指导,并定义完成的标准。 https://t.co/UGF0AC8Z5Y
"Production code written by Claude should have a higher bar than if it was written by a human" 💯 [引用 @bcherny]: Hey ████, I think there is room for both. 1. Prototypes and other throw-away code can be treated as totally black box. If you’re going to throw it…
说实话,普通人完全搞反了 目前 AI 是唯一支撑美国经济的东西 - 它在创造就业 - 支撑股市 - 让我们免受黑客攻击 - 致力于治愈疾病 媒体和末日论者非常不负责任,他们在拿真实的工作岗位和人开玩笑,试图让 AI 被禁止
有了 AI 工程技能,你可以主动影响构建:你影响被构建的内容,并驱动构建循环。这里是做到这点的关键技能。 https://t.co/sysOYdzuZY
Perplexity Computer makes you money. [引用 @CoinbaseDev]: Where are agentic traders coming from? Here's the breakdown of where agentic trading volume came from last week: Perplexity - 26.8% Claude - 19.3% Grok - 15.3% ChatGPT - 1.1% Claude Code - 0.7% CLI/Other…
在 Databricks 工作 5 个月。我不是随便说的。 我们的 AI 推理变得太快了。我们非常接近于模型在你输入完成提示之前就开始回答。 我们不是在呼吁禁令。我们是在要求暂停。
新一集与 @johnschulman2、@oneill_c 和 @BerenMillidge。 我和我认识的一些最有洞见、且在相对开放公司的 AI 研究者聚在一起,因为我想听听在前沿实际上发生的细节,以及接下来会发生什么。 0:00:00 – 为反对 RSI 的论点做最强辩护 0:18:39 – 推动中国实验室进展的原因 0:28:06 – 自动化 AI 研究者将如何被训练 0:33:51 – 长远视角的 RL 会引出 AGI 吗? 0:45:24 – 仿真到现实的鸿沟 1:00:33 – 有多少进展可以用数据来…
他妈的太不可思议了 [引用 @0xRishi]: Introducing Super Smash Royale, my best creation yet Play Battle Royale in the browser with 45 characters from Melee + Brawl Built in a few days with GPT-6 Astra, @ElevenLabs, @MeshyAI, @Blender and @threejs Solo, multiplayer, and con…
在 Warp 中本地使用 Grok Build CLI 和你的 Grok 订阅 [引用 @warpdotdev]: Warp 现在内置支持 Grok Build CLI。 - 在 agent 提示中使用 Warp 的丰富输入,支持更长的粘贴提示和多光标 - 使用 /remote-control 将你的 agent 会话共享到另一台设备 - 访问文件浏览器和代码审查面板 https://t.co/s8dc8P4FgH
餐厅预约并不总是按剧本走。 GPT-Live-1 在说话时也能倾听,所以来电者可以在对话中打断、补充细节或改变方向。 听听 @Yelp 如何使用它让预约电话听起来更自然:https://t.co/PuWHTA2JkG