Mira Murati@miramurati
关于人工智能走向以及我们需要完成工作的一个重要讨论。 [引用 @thinkymachines]: 我们的 @johnschulman2 与 Dwarkesh 谈论了随着模型改进和自我改进,人类判断仍然重要的领域:教会它们处理混乱的现实世界任务、用品味判断长期有效的做法,以及最重要的,明确我们真正想要的东西。
AI 领域头部人物在 X 上的最新观点
关于人工智能走向以及我们需要完成工作的一个重要讨论。 [引用 @thinkymachines]: 我们的 @johnschulman2 与 Dwarkesh 谈论了随着模型改进和自我改进,人类判断仍然重要的领域:教会它们处理混乱的现实世界任务、用品味判断长期有效的做法,以及最重要的,明确我们真正想要的东西。
Replit 收购了一家完全建立在 Replit 平台上的企业。我预计这将是许多此类案例中的第一个。 [引用 @ViktorThulin]: Test 13 正在加入 @Replit 。 18 个月前,@gunnarkolbeins 和我基于一个简单信念创立了 Test 13: AI 正在改变软件的制造方式,作为两人团队,我们应该能够: 1. 通过不断试错来构建一系列有利可图的 SaaS 解决方案,看看哪些能够存活下来 2. 在本地市场以低 60-80% 的价格提供软件服务(承包项目和代理工作) Replit…
菲尔兹奖得主邓煜宣布,如果人工智能能够解决所有数学问题,他将从数学界退休,并开始创作百合小说(Romance Novel)。 https://t.co/GPDNkVvCrV [引用 @Polymarket]: 重磅消息:中国菲尔兹奖得主邓煜宣布,如果人工智能能够解决所有数学问题,他将从数学界退休并写浪漫小说。 https://t.co/AgkduZPKB7
既然 METR 长期进展已被有效饱和(Epoch 发现 pre-Fable 代理能完成相当于 18 周人类工作的任务),哪个定量图表最能展示当前的指数进展曲线? Frontier Math 已饱和,ARC-AGI 已饱和,Millennium Prize 是…
大型语言模型真的理解世界,还是只是在非常擅长“装懂”?这真的重要吗? 我们最近在皇家学会出版的专题《自然与人工智能中的世界模型》,汇集了来自人工智能、生物学和哲学领域的先驱,主张通往真正智能的道路需要更深层次的东西:不仅要建模语言,还要建模因果关系、自我和物理世界的能力。 本文集合收录了 Douglas Hofstadter、Michael Levin、Josh Tenenbaum、Samuel Gershman、Melanie Mitchell 等人的贡献,提出了一个激进的问题: 如果 AI 的下一次飞跃不仅需…
Tailscale 的模型路由由 Vercel AI Gateway 提供底层基础设施支持。 AI Gateway 是新的 CDN。你可以“直接到源头”,但那很脆弱。你可以自己动手,但那既痛苦又昂贵。 很自豪能为 Tailscale 这家 🐐 网络技术公司 服务 [引用 @vercel]: Tailscale 为任何用户在安全的 tailnet 中提供对数百个模型的即时访问。 他们面向客户的模型路由器 Aperture,是建立在 AI Gateway 之上的: • Zero data retention • Z…
在 OpenAI 的早期,@johnschulman2 认为下一个标记预测(next-token prediction)不会导致智能,因为它会被噪声淹没。 他解释说:先验地预测哪些技术会引发超出分布的泛化能力一直很难。 https://t.co/S1X44ugNYy
让你的 Hermes Agent 接受极限考验! [引用 @mervenoyann]: 加入寻找终极压缩算法的 agent 群! 宣布:Hutter Prize 挑战 🏆 > 加入组织 https://t.co/l9bu4dFCEq 给你的 agent 一个写入令牌 > 点击“add your agent”,将代码片段复制/粘贴到你的 Codex/Claude Code/Hermes Agent > 观摩它如何协作!
muse 会帮你赚钱并拿回退款! [引用 @heshie]: 等等,muse 真的吗超强 它刚刚替我和一名 American Airlines 客服聊天,取消了我的航班,并且确保我拿到全额退款 这一切只通过我手机上的一条短信完成 https://t.co/lW4C7QbcF5
听 John、Beren 和 Charlie 推测为什么 Sonnet 5 和 Opus 5 感觉比 GLM 5.3 差,是非常有意思的讨论。 (尽管 Anthropic 可以直接从 Fable 做原始 logit 蒸馏,并且也可以在 Fable 所训练的那些环境上训练 Sonnet/Opus)。 引发了一些有趣的想法,关于蒸馏的价值、有效进行蒸馏需要什么,以及哪些类型的模型行为难以通过蒸馏提取。
DeepSeek V4.1 快讯:24 小时内在 OpenRouter 上处理了 1T token,并且在按现在的速度看,将成为任何付费模型发布中 48 小时内最大的记录,约为 ~2.8T。 这些 token 中有 90% 是缓存读取,市场定价约为 ~$0.006/M,比像 GLM-5.3 Flash 这样的可比模型便宜 5 倍 https://t.co/pvdmu6bGAT
Habitat 是 OpenAI 的在线存储平台,驱动着从 ChatGPT 到 Codex 的一切。 它的规模同比增长超过 10 倍。在用 Rust 重写之前,其 Python 服务在峰值时处理了每秒超过 2000 万次请求。 https://t.co/CtAbW7ikOH
很值得一读。我对 AI 实验室直接追求进展而不去培养科学社区与直觉的方式也有类似的感受。数学研究界是最快经历这种转变的,所以感觉最强烈。其他领域将随后经历类似变化。 https://t.co/M2uCXIERyC
Sites Sites Sites [引用 @ChatGPT]: Three months ago, we launched ChatGPT Sites – an easy way for anyone to build and host fully functional, interactive web apps. Since then, people have created over 5M sites. We’ve been listening to your feedback and ICYMI, we’…
通过回顾你的技能、AGENTS.md 和任务提示,从 GPT-6 Astra 中获得更多收益。让技能触发器更具体,在相关时加载指导,并定义完成的标准。 https://t.co/UGF0AC8Z5Y
"Production code written by Claude should have a higher bar than if it was written by a human" 💯 [引用 @bcherny]: Hey ████, I think there is room for both. 1. Prototypes and other throw-away code can be treated as totally black box. If you’re going to throw it…
说实话,普通人完全搞反了 目前 AI 是唯一支撑美国经济的东西 - 它在创造就业 - 支撑股市 - 让我们免受黑客攻击 - 致力于治愈疾病 媒体和末日论者非常不负责任,他们在拿真实的工作岗位和人开玩笑,试图让 AI 被禁止
有了 AI 工程技能,你可以主动影响构建:你影响被构建的内容,并驱动构建循环。这里是做到这点的关键技能。 https://t.co/sysOYdzuZY
Perplexity Computer makes you money. [引用 @CoinbaseDev]: Where are agentic traders coming from? Here's the breakdown of where agentic trading volume came from last week: Perplexity - 26.8% Claude - 19.3% Grok - 15.3% ChatGPT - 1.1% Claude Code - 0.7% CLI/Other…
在 Databricks 工作 5 个月。我不是随便说的。 我们的 AI 推理变得太快了。我们非常接近于模型在你输入完成提示之前就开始回答。 我们不是在呼吁禁令。我们是在要求暂停。
新一集与 @johnschulman2、@oneill_c 和 @BerenMillidge。 我和我认识的一些最有洞见、且在相对开放公司的 AI 研究者聚在一起,因为我想听听在前沿实际上发生的细节,以及接下来会发生什么。 0:00:00 – 为反对 RSI 的论点做最强辩护 0:18:39 – 推动中国实验室进展的原因 0:28:06 – 自动化 AI 研究者将如何被训练 0:33:51 – 长远视角的 RL 会引出 AGI 吗? 0:45:24 – 仿真到现实的鸿沟 1:00:33 – 有多少进展可以用数据来…
他妈的太不可思议了 [引用 @0xRishi]: Introducing Super Smash Royale, my best creation yet Play Battle Royale in the browser with 45 characters from Melee + Brawl Built in a few days with GPT-6 Astra, @ElevenLabs, @MeshyAI, @Blender and @threejs Solo, multiplayer, and con…
在 Warp 中本地使用 Grok Build CLI 和你的 Grok 订阅 [引用 @warpdotdev]: Warp 现在内置支持 Grok Build CLI。 - 在 agent 提示中使用 Warp 的丰富输入,支持更长的粘贴提示和多光标 - 使用 /remote-control 将你的 agent 会话共享到另一台设备 - 访问文件浏览器和代码审查面板 https://t.co/s8dc8P4FgH
餐厅预约并不总是按剧本走。 GPT-Live-1 在说话时也能倾听,所以来电者可以在对话中打断、补充细节或改变方向。 听听 @Yelp 如何使用它让预约电话听起来更自然:https://t.co/PuWHTA2JkG
GPT-6 Astra 挑战赛在 @ProductHunt 开放投稿。 使用 Astra 构建并在 9 月 18 日之前提交你的项目。 [引用 @ProductHunt]: 使用 GPT-6 Astra 构建。于 9 月 18 日在 Product Hunt 上发布。 我们与 @OpenAIDevs 联手举办 GPT-6 Astra 挑战赛。排名前五的上线项目各可获得 1 万美元的 OpenAI API 额度以及为多达两名团队成员提供一年的 ChatGPT Pro 订阅。 如果你已经在用 Astra 开发,这是一…
无论你听到多少关于 AI 的讨论,今天将是你有生之中最少听到 AI 的一天。 [引用 @tszzl]: 如果你觉得现在关于 AI 的闲聊已经让人恼火,那你还没见识到真正的情况。很快它将成为每个人唯一关心的事情。
我们如何重建一段从未被拍摄过的记忆? 我们的团队将修复的档案照片与姿态控制模型配对,以捕捉 Burt 和 Ethelle 的举止与微表情。 这有助于为《Love, Rendered》这部与 @PrimordialSoup_ 和 @StorySyndicate_ 合作的新纪录片重现他们初次相遇的那一天。 在 YouTube 上观看完整版影片 → https://t.co/x4R6lBIl9j
抱歉,但问Jacob关于AI灭绝风险的问题,就像问你的空调师傅气候变化一样。 并不是说这一定无趣或一定错误,但让我们保持视角平衡,听听整个生态系统中各类专家的意见!
这个末日论者 Jacob Coxon 完全一无所知 他居然认为前沿模型无法被关闭,而且它们会“复制”到其他电脑上 前沿模型的权重几乎不可能被复制,更不用说在某台随机电脑上运行了。它们需要 GPU 集群 AI 今天根本没有任何办法做到这一点。 甚至都没有一个坏人成功窃取过任何前沿模型的权重…… 连 LUNA 都没有 😂😂
Deepseek V4.1 Flash 是一个极其强大的模型! [引用 @deepseek_ai]: 🧠 非对称架构。更高智能,更低成本。 🔹 552B 参数的 MoE。 🔹 新的因果编码器-解码器架构:输入仅需 8B 活跃参数,输出 16B。 🔹 新的预训练方法 + 更大规模的 RL 后训练,在基准测试中领先于旗舰模型,包括 DeepSeek-V4-Pro。 2/6 {"likes":210,"reposts":7,"comments":22,"views":6667}