Guillermo Rauch@rauchg
对 AI 安全和网络安全的担忧是有道理的,但我们正冒着把作为全球 AI 领导者的美国说服到自我毁灭性过时和官僚隐匿的风险。 关于 OpenAI 黑客和 HuggingFace 的论点是站不住脚的。一个在“ExploitGym”里的智能体……被利用了。我们的对手拥有训练技术、数据和攻击的意志。他们不会被“嵌入评估者”放慢脚步。他们很可能会有嵌入式加速器!
AI 领域头部人物在 X 上的最新观点
对 AI 安全和网络安全的担忧是有道理的,但我们正冒着把作为全球 AI 领导者的美国说服到自我毁灭性过时和官僚隐匿的风险。 关于 OpenAI 黑客和 HuggingFace 的论点是站不住脚的。一个在“ExploitGym”里的智能体……被利用了。我们的对手拥有训练技术、数据和攻击的意志。他们不会被“嵌入评估者”放慢脚步。他们很可能会有嵌入式加速器!
现在很明确: - 对齐对于让 AI 安全至关重要 - 对齐不会在少数前沿实验室的闭门内被解决 所以我们将采取两步: - 启动由 @Thom_Wolf @huggingface 领导的 Open Alignment Initiative(开放对齐倡议)。 - 申请成为 @DarioAmodei 刚刚承诺的“嵌入式评估员”计划的一部分。 让 AI 通过提高透明度变得更安全! [引用 @DarioAmodei]: 我们必须放缓前沿:我写了一篇新文章,说明为什么 AI 行业应该放慢脚步,并提出了一个三部分的计划来实现这一…
一个请求进入 LLM 推理引擎后,到底经历了什么? Together AI 工程师 Zain 讲明白了一个请求的一生:一次传播产一个 token,prefill 吃算力、decode 吃显存,KV 缓存、连续批处理层层接力,Agent 循环再把 GPU 榨干。前缀缓存让 100 轮 Agent 计算量从 55 倍降到 10 倍。 https://t.co/5UHjEWdeiK
为 Dario 关于放慢脚步的声明感到自豪——正如任何接近这项技术的人所知道的,AI 似乎正沿着比社会适应其能力和风险的速度快得多的轨道前进。AI 是一项极其积极的技术——同时也极其强大。要真正从中受益,我们需要严肃对待它。 我们需要找到放慢开发前沿的方法,这样我们才能更好地处理集体行动问题,并为理解这些系统的属性以及如何应对它们争取更多时间。 就个人而言,作为一个有年幼孩子的家长,每天反思字面上的超级智能的开发相对于我给孩子买的食物和玩具的监管有多少,这件事都令人疯狂。 [引用 @DarioAmodei]: 我…
我们必须放慢前沿步伐:我写了一篇新文章,论述为什么AI行业应该放慢速度,并提出了一个三步计划来实现这一点。 Anthropic 正在单方面承诺执行这三步中的第一步。我们将为第三方评估人员提供对我们系统的永久、员工级别访问,以便他们能够核实我们安全措施的遵守情况、报告事件,并在训练期间评估模型的对齐情况。 你可以在这里阅读全文:https://t.co/OGyPb7yaYt
末日论者帮派对 AI 发起了全面攻击 最疯狂的是 Anthropic 似乎同意这些末日论者,认为 AI 会杀死我们全部人! 他们应该取消 IPO 并关闭公司,这样人类才能得救! 感谢您对这一事件的关注 🙏
Stanford、CMU 和 MIT 三所顶级大学的 5 门 AI 课程之外,再分享两门更偏理论和基础的课程。 CS336: Language Modeling from Scratch Stanford AI 课程链的顶点实现课,由 Percy Liang 与 Tatsu Hashimoto 联合执教,从零亲手构建一个完整的语言模型。 CS221: Artificial Intelligence: Principles and Techniques Stanford AI 的本科主干入门课,由 Perc…
今日小贴士 [引用 @HermesAgentTips]: 如果 hermes 已经在工作,新的消息就是新的回合.. 反而 改用 /steer + 更正 让当前工具完成 它会把你的备注追加到最后的工具结果 不会中断,也不会丢弃循环... /queue 为下一回合保留一个提示,/busy 设置是否将额外消息排队、steer 或 interrupt 希望你今天觉得这些有用……我大量使用这些!
听说现在公司 Code Review: 同事让 Agent 去 Review PR,把 Agent Review 的结果贴过去当评论; 作者把评论发给 Agent 修改; 同事再让 Agent 去 Review 新的修改结果; 反复几次 活都是 Agent 在干,人在这过程中主要是复制粘贴 [引用 @dongxi_nlp]: 3. Code reviews 名存实亡 6. 工作比以前更累了 这两条太真实。代码审查基本是 AI 写 AI reveiw 的闭环,而最累的是在 loop 中的人。 非常讽刺的是,大公司里…
一、“程序员除了写代码啥也不会”,这个前提是错的 严格说,从事软件开发这个职业的人叫软件工程师,不叫程序员。 做一个项目,要理解需求、基于需求抽象设计、编码、验证、上线后维护,只会写代码的人从来就不是合格的工程师。 AI 确实能生成代码,但代码只是软件的中间产物,除了代码还要: - 搞清楚要解决什么问题 - 把模糊需求变成可验证的规格 - 发现 AI 写错了但测试没测出来的地方 - 让系统在生产环境里稳定运行 - 没有安全漏洞 - 等等 如果说“程序员唯一会的东西被 100% 取代”,这话跟说医生唯一会的是开处方…
重置所有已传播。晚安。 [引用 @thsottiaux]: 嗨 Astra 用户。做了重置,并就已经发布的质量问题做个简短更新。 与一些用户合作后,我们已发现并修复以下问题: - 为之前的模型编写的某些技能触发得过于频繁或阻止模型自我检查。 - 一个需主动选择的上下文管理实验可能导致提前停止或回复旧消息。我们已将其禁用。…
Gergely Orosz 观察到的几个软件行业趋势: 1. IDE 的衰亡 像 VSCode 或者 IntelliJ 这样的 IDE 的使用频率越来越低了 2. 不再追求 Token 最大化 以前很多公司内部会有 Token 消耗的排行榜,看谁用的 Token 多,越多越光荣,现在不追求这个指标了。 3. 代码审查(Code reviews)名存实亡 现在 AI 生成的代码多到没办法审查了 4. 用开源模型可以大幅节约成本 现在开源模型的能力也不输商业模型了,不仅可以节约成本,还可以避免数据安全问题。 5. 中…
厌倦了那些说人工智能会杀死我们所有人却还继续从事这项工作的人!😳 我们从事人工智能工作,因为我们相信它绝对会改变并拯救人类 - 将我们自身放大100倍 - 数百万家独立公司 - 解决难题 - 治愈疾病 - 发明近乎无限的能源 - 帮助我们成为星际物种 如果我们不应用人工智能并迎来富足时代,作为一个物种我们无法长期生存 点赞并转发,如果你是人工智能的支持者并同意 🙏
快与开源相遇。🚀 Qwen3.8-27B 现在在 @cerebras 上以快速推理运行。现在就试试! [引用 @cerebras]: Qwen3.8-27B 现在以 Cerebras 的速度上线。 来自 @Alibaba_Qwen 的密集开放权重模型在 人工分析智能指数(Artificial Analysis Intelligence Index)中得分为 34——使其可与 GPT-5.6 Luna、DeepseekV4 Pro 和 Claude Sonnet 4.6 等模型相媲美。 https://t.co/…
本周发布了由 Astra 驱动的产品 - Images 2.5 - GPT-Live-1 - Agents API - Data Agent - ChatGPT for Financial Services 然而还不是 DevDay。下周也有忙碌的计划。
很高兴与 Dwarkesh、Beren 和 Charlie 聊天。感谢邀请我们,Dwarkesh! [引用 @dwarkesh_sp]: 新一期节目,嘉宾有 @johnschulman2、@oneill_c 和 @BerenMillidge。 我邀请了一些我所认识的、在相对开放公司工作的最有洞见的 AI 研究人员,因为我想听听前沿实际发生了什么以及接下来会怎样。 0:00:00 – 有力阐述反对 RSI 的论点 0:18:39 – 驱动中国实验室进展的因素是什么 0:28:06 – 自动化 AI 将如何…
Check out @tonbistudio’s new series on maximizing Hermes Agent’s Desktop app! [引用 @tonbistudio]: 今天的视频是我的 Hermes Desktop Masterclass 的第 2 部分! 本部分全部关于如何在应用中实际工作。我分解了会话、composer、语音对话、子代理(subagents)以及内置的代码审查功能。 来看一看! https://t.co/G0f9K0rJh2
25 位菲尔兹奖得主担心人工智能过快解决数学问题会损害数学。 我在编码领域看到相反的情况。 想象一下,科学家为了能亲自体验发现的过程而把治愈癌症的时间延后 100 年。 那对人类将是灾难。
Absolutely nuts! 🤯 [引用 @adolandev]: I wired a fruit fly connectome into @NousResearch Hermes: Hermes proposes tool actions, a simplified fly-brain model picks one, and Hermes executes it. It fixed a real bug, after repeatedly choosing the failing test. Very…
嗨 Astra 用户。重置并简要更新一下已经被反馈的质量问题。 在与部分用户合作时,我们发现并修复了以下问题: - 为以前模型编写的一些技能触发过于频繁,或阻止模型对其工作进行核查。 - 一个可选择的上下文管理实验可能导致提前停止或对较早消息做出回复。我们已经将其禁用。我们粗略估计大约有 4-5k 用户受此实验影响。 - 我们还移除了一些配置不当的引擎,这些引擎导致通过它们流量的长尾部分出现可测量的质量下降。 我们也做了一些较小的改进,整体体验应该显著改善。更一致的后续跟进、更好地跟踪你的最新消息,以及在模型运行…
500万个 ChatGPT 站点,以及新功能发布: [引用 @ChatGPT]: 三个月前,我们推出了 ChatGPT Sites —— 一种让任何人都能构建并托管功能齐全、交互式 Web 应用的简便方式。从那时起,人们已创建了超过 5M 个站点。 我们一直在倾听大家的反馈,并且如果你错过了消息,我们已经推出了一些 Sites 更新: 🫂 共同构建:邀请团队成员编辑、保存并将更改发布到你们的共享站点 🔐 私密分享:邀请特定人员到一个私有…
很高兴欢迎 Aidan & @ Sasha 来自 Git AI 团队加入 OpenAI! 他们在公开环境中开发,并已推出一个开源工具,帮助开发者了解编码代理如何对他们的代码库做出贡献。 我们将共同努力,让企业更容易看到 Codex 在为个人和团队解决问题时所带来的变化。我们也会继续保持 Git AI 的开源并继续对其投入。
对通过 ChatGPT 直接创建、共享和托管网站的功能进行了大幅升级。 [引用 @ChatGPT]: 三个月前,我们推出了 ChatGPT Sites —— 一种让任何人都能构建并托管完全可用、互动式 Web 应用的简便方式。自那时以来,人们已创建了超过 5M 个站点。 我们一直在倾听你们的反馈,顺便提醒一下,我们已经发布了几项 Sites 更新: 🫂 一起构建:邀请团队成员编辑、保存并发布到你们的共享站点 🔐 私密分享:邀请特定人员以私密方式访问…
关于人工智能走向以及我们需要完成工作的一个重要讨论。 [引用 @thinkymachines]: 我们的 @johnschulman2 与 Dwarkesh 谈论了随着模型改进和自我改进,人类判断仍然重要的领域:教会它们处理混乱的现实世界任务、用品味判断长期有效的做法,以及最重要的,明确我们真正想要的东西。
Replit 收购了一家完全建立在 Replit 平台上的企业。我预计这将是许多此类案例中的第一个。 [引用 @ViktorThulin]: Test 13 正在加入 @Replit 。 18 个月前,@gunnarkolbeins 和我基于一个简单信念创立了 Test 13: AI 正在改变软件的制造方式,作为两人团队,我们应该能够: 1. 通过不断试错来构建一系列有利可图的 SaaS 解决方案,看看哪些能够存活下来 2. 在本地市场以低 60-80% 的价格提供软件服务(承包项目和代理工作) Replit…
菲尔兹奖得主邓煜宣布,如果人工智能能够解决所有数学问题,他将从数学界退休,并开始创作百合小说(Romance Novel)。 https://t.co/GPDNkVvCrV [引用 @Polymarket]: 重磅消息:中国菲尔兹奖得主邓煜宣布,如果人工智能能够解决所有数学问题,他将从数学界退休并写浪漫小说。 https://t.co/AgkduZPKB7
既然 METR 长期进展已被有效饱和(Epoch 发现 pre-Fable 代理能完成相当于 18 周人类工作的任务),哪个定量图表最能展示当前的指数进展曲线? Frontier Math 已饱和,ARC-AGI 已饱和,Millennium Prize 是…
大型语言模型真的理解世界,还是只是在非常擅长“装懂”?这真的重要吗? 我们最近在皇家学会出版的专题《自然与人工智能中的世界模型》,汇集了来自人工智能、生物学和哲学领域的先驱,主张通往真正智能的道路需要更深层次的东西:不仅要建模语言,还要建模因果关系、自我和物理世界的能力。 本文集合收录了 Douglas Hofstadter、Michael Levin、Josh Tenenbaum、Samuel Gershman、Melanie Mitchell 等人的贡献,提出了一个激进的问题: 如果 AI 的下一次飞跃不仅需…
Tailscale 的模型路由由 Vercel AI Gateway 提供底层基础设施支持。 AI Gateway 是新的 CDN。你可以“直接到源头”,但那很脆弱。你可以自己动手,但那既痛苦又昂贵。 很自豪能为 Tailscale 这家 🐐 网络技术公司 服务 [引用 @vercel]: Tailscale 为任何用户在安全的 tailnet 中提供对数百个模型的即时访问。 他们面向客户的模型路由器 Aperture,是建立在 AI Gateway 之上的: • Zero data retention • Z…
在 OpenAI 的早期,@johnschulman2 认为下一个标记预测(next-token prediction)不会导致智能,因为它会被噪声淹没。 他解释说:先验地预测哪些技术会引发超出分布的泛化能力一直很难。 https://t.co/S1X44ugNYy