我们在 Figure 有了 AI 突破,明天将展示这一成果
AI 领域头部人物在 X 上的最新观点
Greg Brockman 表示 Databricks 已向所有工程师全面部署 Astra,并称其在复杂系统设计等任务上优于之前模型。
Greg Brockman 宣布 ChatGPT Ads 已与 Shopify 合作上线,商家可直接从 Shopify 目录创建并管理广告活动。
Yuchen Jin 今天向所有 Databricks 工程师部署了 GPT-6 Astra,表示其在复杂任务上优于竞品并提高了代码支出。
SpaceXAI 宣布 Grok Voice 在 fal 上线,支持0.70秒响应、字级时间戳及多语音克隆。
Guillermo Rauch 表示 typesafeai 的 Jev 在 p95 下比 GPT Luna 快5–18倍且更准确,拟加入 Vercel AI Gateway。
Aidan Gomez 宣布与 Aleph Alpha 完成最终协议,Cohere 将成为跨大西洋的基础模型开发者。
Yuchen Jin 发现 OpenRouter 上的 Union Alpha 达到 Claude Fable 5.1 水平且成本低十倍以上,盼其开源。
Boris Cherny 说 Claude 已把 chat 与 Cowork 合并为一个可跨场景携带上下文的单一 Claude。
Bindu Reddy 宣布 Abacus AI Bot 为永久免费个人 AI,可路由并使用网络上的免费 LLMs 执行个人事务。
Gorden Sun 介绍 Dream-RSI,利用历史探索记录低成本“做梦”重演以离线评估并进化 AI Agent 策略。
MiniMax (official) 在日本IP AI共创大会上发布了MiniMax H3 IP Edition,结合官方授权的日本IP与MiniMax H3能力。
Yuchen Jin 表示 Jev 是新发布的模型,声称20–200x更快、40–400x更便宜,作者测试未花费超过0.10美元。
我们在 Figure 有了 AI 突破,明天将展示这一成果
很高兴能帮助 Shopify 商家在 ChatGPT 中为他们的产品做广告: [引用 @harleyf]: ChatGPT Ads for @Shopify 已上线。我们是 @OpenAI 的第一个商业合作伙伴。 OpenAI 直接从 Shopify Catalog 拉取数据,所以商家的产品已经在其中。 商家自行设置广告活动、预算。免费安装,可在 Shopify 管理后台直接跟踪。 消费者在向 ChatGPT 询问购买建议。Shopify 商家可以决定他们如何准确地出现在结果中。 https://t.co/kRr…
wall-to-wall 部署 Astra 给 Databricks 的工程师: [引用 @pwendell]: 今天我们向 Databricks 的每位工程师部署了 Astra(N=~3500)。一些可能对其他人有帮助的说明: 1. Astra 在高度复杂的任务上无可争议地超过了我们之前的最高端模型(Opus 5、Sol 5.6),特别是在与高级系统设计或长程横向任务相关的方面。 2. 给予工程师 Astra 后,与基线相比,整体编码支出增加了大约 60%…
我们在分享 OpenAI 用于跟踪、调查和披露模型不对齐实例的新框架。 该框架设定了公开披露的标准和时间表,包括在我们尚未完全解释或缓解该行为时的披露情形。更复杂的案例可能需要更长时间的调查或与第三方协调。 我们将优先展示那些揭示新不对齐机制、已知行为发生重要变化或挑战关于安全或缓解假设的示例。 与该框架一并,我们发布了六份报告,介绍过去六个月中在模型训练或评估期间观察到的不对齐行为实例。 这只是一个起点。我们将通过实践和公众反馈来完善该流程,并持续分享更多报告。 https://t.co/ismCCkeE0L
迄今为止公开的最酷的规模化 RL 资源之一!太让人高兴了。 [引用 @_LuoFuli]: 将近半年的沉默。我们把它用来研究一个问题:RL 能扩展到多远。 MiMo-V2.6 目前正处于其 RL 运行的中间阶段。我们扩展的三件事:计算(~2B tokens per step, 1568 prompts × 16 rollouts, fully async)、环境与测试框架(多任务 agentic RL,在一次运行中混合多个测试框架)、以及评分器计算(agentic in-group credit assignme…
在 fal 中使用 Grok Voice 构建智能、低延迟的 agent,解决真实客户问题 [引用 @fal]: Grok Voice 已在 fal 上线。 来自 @SpaceXAI 的最新语音模型,可在 0.70 秒内作答并在句子结束前完成工具调用。提供带词级时间戳的转录、覆盖 25+ 语言的 30+ 语音的文本转语音,以及从两分钟音频克隆声音。 本视频中的每个声音都来自 Grok Voice。 {"likes":213,"reposts":23,"comments":24,"views":30703}
我们在 @typesafeai 看到了非凡的结果。𝚏𝚡 的默认模式是 auto,带有一个对每个命令进行分析的安全审查器。 今天那个审查器运行在 GPT Luna 上。Jev 在 p95 上快了多达 18 倍,且更准确。它将加入 @vercel AI Gateway 并可能成为新的默认选项。 [引用 @fazxes]: 我们用 @typesafeai 的 Jev 对 fx auto 模式(安全)分类器做了基准测试。 简短结论:大约比我们目前的首选 𝚐𝚙𝚝-𝟻.𝟼-𝚕𝚞𝚗𝚊 快 5-18 倍且更…
我们今天向每位 Databricks 工程师部署了 GPT-6 Astra。 它在最困难、长周期任务上击败了 Claude Opus 5,并将我们的编码支出提高了 60%。我认为它是最强的模型。 昂贵。但希望值得。 [引用 @pwendell]: 今天我们向 Databricks 的每位工程师(N≈3500)部署了 Astra。以下一些可能对他人有帮助的说明: 1. Astra 在高度复杂的任务上,无可争议地优于我们之前的最高端模型(Opus 5、Sol 5.6),尤其是与高级系统设计或长周期横向任务相关的。 2…
Grok Build 用得越多就越好。 它会在会话之间记住约定、决策和项目事实。 /memory 用于浏览 /dream 用于将最近笔记整理成主题 https://t.co/A2MMZT5eJX https://t.co/UD8lJGnfOB {"likes":373,"reposts":38,"comments":40,"views":83402}
非常有趣的阅读! [引用 @JacquelineSYC19]: 几周前我写到我们在 Artie 的整个团队都使用 Hermes(来自 @NousResearch 的一个 AI 代理框架)来完成他们的工作。 以下是我们如何走到这一步:我们最先尝试的是什么,花费了多少,如何为每个团队构建一个 Hermes,以及他们为什么会在夜里做梦。 https://t.co/oV8vA8MyL4
“muse 是我自 ChatGPT 以来用过的最棒的应用——无论是否基于 AI——在带回那种最初‘哇’的感觉方面。” 你让我很激动 🥹🥹🥹 [引用 @0xShayan]: Muse 是我自 ChatGPT 以来用过的最棒的应用——无论是否基于 AI——在带回那种最初“哇”的感觉方面。 它只是……就是好用 界面/用户体验非常温暖友好,AI 本身感觉很聪明,几乎不需要引导。 我对 ChatGPT 在工作/浏览器使用上的最大抱怨是许多操作被屏蔽,但不知为何,Muse 的这些功能就能……
你们完全可以去做(实体)东西。 [引用 @natalieyeo]: “来自这个可爱的实体 Codex 宠物的‘Hello World’!致所有 @OpenAIDevs 在 Astra 上构建的第 5 天 https://t.co/aTeijhJQT1 {"likes":540,"reposts":12,"comments":38,"views":47282}
把我(非常简单的)agent 设置给了我妈妈。 她给他起名叫 Morgan。他刚为她的网站成交了一笔 600 美元的广告合同。 人们对他们的设置想得太复杂了。Bitter Lesson 同样适用于 agents:只要问模型,让它生成所需的东西。 [引用 @mattshumer_]: 大家,这些疯狂的设置固然有趣,但它们并不会真正提高你的生产力。你最终只是花更多时间去构建系统,而不是实际做真正的工作。 你只需要一个 agent 会话,它可以分配任务给其他会话并担任经理角色。如果有东西不起作用,只要告诉你的主会话,它…
长途自驾的 Codex 语音体验: [引用 @jonathanroomer]: 我在 CarPlay 上用了 Codex(语音)。太棒了。 现在即便在公路旅行时,车里五个孩子都吵闹、我老婆问我为什么跟 AI 说话比跟她多,我也能继续构建东西。 它通过我的 Nightblood iOS 应用运行,为 ChatGPT Voice 提供了形象、个性,并能完全访问 Codex、我的 Mac 和所有本地工具。
推出 Hermes Agent 插件目录! 你可以在 Hermes Desktop 应用的功能部分访问它,轻松搜索、浏览并探索社区和官方插件! 也欢迎提交你自己的! [引用 @NousResearch]: Hermes Agent 现在有了插件目录:从 4 个官方插件和 96 个社区插件开始,涵盖桌面模块、新平台、浏览、专用工具等。 我们的团队会审核每个社区插件,并且会定期添加新插件。 https://t.co/sNGEQVvUlc https://t.co/dZl0eGJbHu {"likes":284,"re…
有人猜这是什么在 OpenRouter 上的 Union Alpha 野兽吗? 相当于 Claude Fable 5.1 级别,价格便宜超过 10 倍。等着它开源。 https://t.co/okoQnHeMw6 {"likes":357,"reposts":18,"comments":57,"views":35592}
今天还有:Claude Docs、Claude Slides 和 Claude Design 在每个对话中都可用。 向 Claude 要一份演示文稿,你会得到可以打开、编辑并导出为 PowerPoint 或 PDF 的文件。文档和设计也是一样。不需要跳转到单独的工具——它们就在聊天中。 [引用 @claudeai]: 你现在也可以在对话中制作幻灯片、文档和设计。 在 Claude Docs 中草拟单页说明,使用 Claude Slides 把它变成演示文稿,再用 Claude Design 模拟一个匹配的视觉效果…
Claude Code 展示了 AI 能完成真正的工作,而不仅仅是回答问题。开发者把一个功能交给 Claude,回来时就拿到已发布的代码。这也是行业中许多严肃工程工作的所在。 Cowork 证明知识工作者也能做到同样的事:把简报交给 Claude,回来时拿到完成的文件。 今天,聊天和 Cowork 开始合并为一个 Claude。方向是:一个 Claude 在你工作的一切地方携带上下文。每个人都能简单地访问 Claude 的全部能力。 这几周我每天都在用这种体验,感觉很棒。更简洁、更快、更强大。 我们会逐步推出。我…
三个关键开源权重实验室在 2026 年迄今为止其模型的月度花费增长已达 10 倍或更多。 封闭模型的支出增长相对较慢,尽管起点远高于开源模型。 https://t.co/iOKARyF2as
当我与高级经理交谈时,越来越多地听到组织内部岗位模糊的故事(我们在 P&G 的研究中也发现了):编码、设计、产品管理在每个人使用 AI 时都在塌缩与重叠。 我们需要快速建立新的工作组织模型。 https://t.co/SGDOkRWU8J
muse 语音转录真的很棒!! [引用 @IsaacKing314]: 很遗憾地通知大家,Meta AI 终于变得不错了,至少在他们的竞争对手已经停止尝试的领域里。他们新的语音转录模型比最好的 OpenAI Whisper 模型快近一个数量级,而且准确度也明显更高。 {"likes":222,"reposts":14,"comments":33,"views":27793}
哈哈……实际上没有人在放慢前沿速度 - Opus 5.2 正在测试中 - Grok 4.8 在几周内发布 - Jev 是一个新的超快速分类器 - OpenAI 已经在测试 Astra+ 我们继续加速
在谈论关于 AI 和奇点的一些奇怪说法 The Anthropic Institute 🤝 the DeepMind Institute [引用 @ShaneLegg]: 我开发 AGI 的旅程跨越 25 年,其中包括在 Google DeepMind 思考技术和社会视角的 10+ 年。 AGI 已在地平线上——我们需要更深入地理解它的影响。为此,我们创建了 DeepMind Institute。 https://t.co/dpc2y4IGT1
很高兴完成最终协议并与 AlephAlpha 联手!🇨🇦🇩🇪 [引用 @cohere]: Cohere 与 Aleph Alpha 宣布签署最终协议,成为首个在大西洋两岸都有根基的基础 AI 模型开发者 🇨🇦🇩🇪 以 Cohere 名义全球运营,合并后的公司将在两大洲拥有超过 1,000 名员工。 https://t.co/I6tywIEh7t {"likes":215,"reposts":10,"comments":13,"views":13513}
🚨 宣布 Abacus AI Bot —— 100% 免费的个人 AI AI 可以管理你的日历、订票或订位。这些简单任务应该完全免费。 今天,我们宣布新产品 — Abacus AI bot - 在网络上寻找并运行免费的 LLM - 自动路由到免费模型 - 完成你所有的个人事务 - 只需下载、设置并运行 永久免费使用
今天,我们宣布与 @mozilla 建立合作,旨在为使用 AI 在线浏览的人们带来隐私、控制和选择。🦊🐈 https://t.co/Bsd6N4jNdV https://t.co/OczDk9utfL
Google 与马里兰大学等提出 Dream-RSI:让 AI Agent 在历史探索记录中低成本自我进化 长程探索任务的元策略优化通常需要极高的试错成本,这项研究直接将已完成的探索记录树作为精确的离线重放模拟器。 新策略无需重复调用模型执行真实代码,只需在历史轨迹中“做梦”重演即可筛选出更优方案,实现零执行成本的离线评估。 优胜策略随后部署至新一轮在线探索并扩充模拟器池,在保持甚至提升算法与算子发现质量的同时,最高降低 162 倍的探索调用开销。 项目介绍:https://t.co/jB6I6yKFIE
来自 Google 的关于 AI 在科学中使用的研究,影响复杂:加速(每周节省 7 小时)同时伴随工作类型的变化(更多验证工作)以及研究选题的变化(可能转向更安全的课题)。 另外还有一张关于锯齿状前沿的好图 https://t.co/0x2dxBWl2U https://t.co/HZL2BHSZ2i
muse 帮这位用户在 WiFi 上节省了超过 $5000! [引用 @raunaqbn]: @Muse 总是让我惊讶! 今天我让它打电话给 Xfinity 为我砍网费。它通过了电话树找到了人工客服,遇到验证短信它本看不懂,就把电话接到我这!有一段时间是 muse 代理、我和那个毫不知情的 Xfinity 客服在通话中。 合并账单节省是 $85.30/月,锁定 5 年,大约在这段时间节省了 $5118。…
muse 在 100 个不同故事中为人们节省了 $9,649.71 想象一下当十亿人都有 muse 时,这会为人们节省多少钱!! 我们正在努力扩大访问范围,把它带到每个地方! [引用 @SingularityRes]: Meta 的 Muse AI 在真实用户身上节省了 $9,649.71,并为他们跑了 129 次差事——我有收据。 下面是 100 个真实故事,按省钱金额排序。最厉害的那些简直疯狂