Bindu Reddy@bindureddy
末日论者帮派对 AI 发起了全面攻击 最疯狂的是 Anthropic 似乎同意这些末日论者,认为 AI 会杀死我们全部人! 他们应该取消 IPO 并关闭公司,这样人类才能得救! 感谢您对这一事件的关注 🙏
AI 领域头部人物在 X 上的最新观点
末日论者帮派对 AI 发起了全面攻击 最疯狂的是 Anthropic 似乎同意这些末日论者,认为 AI 会杀死我们全部人! 他们应该取消 IPO 并关闭公司,这样人类才能得救! 感谢您对这一事件的关注 🙏
Stanford、CMU 和 MIT 三所顶级大学的 5 门 AI 课程之外,再分享两门更偏理论和基础的课程。 CS336: Language Modeling from Scratch Stanford AI 课程链的顶点实现课,由 Percy Liang 与 Tatsu Hashimoto 联合执教,从零亲手构建一个完整的语言模型。 CS221: Artificial Intelligence: Principles and Techniques Stanford AI 的本科主干入门课,由 Perc…
今日小贴士 [引用 @HermesAgentTips]: 如果 hermes 已经在工作,新的消息就是新的回合.. 反而 改用 /steer + 更正 让当前工具完成 它会把你的备注追加到最后的工具结果 不会中断,也不会丢弃循环... /queue 为下一回合保留一个提示,/busy 设置是否将额外消息排队、steer 或 interrupt 希望你今天觉得这些有用……我大量使用这些!
听说现在公司 Code Review: 同事让 Agent 去 Review PR,把 Agent Review 的结果贴过去当评论; 作者把评论发给 Agent 修改; 同事再让 Agent 去 Review 新的修改结果; 反复几次 活都是 Agent 在干,人在这过程中主要是复制粘贴 [引用 @dongxi_nlp]: 3. Code reviews 名存实亡 6. 工作比以前更累了 这两条太真实。代码审查基本是 AI 写 AI reveiw 的闭环,而最累的是在 loop 中的人。 非常讽刺的是,大公司里…
一、“程序员除了写代码啥也不会”,这个前提是错的 严格说,从事软件开发这个职业的人叫软件工程师,不叫程序员。 做一个项目,要理解需求、基于需求抽象设计、编码、验证、上线后维护,只会写代码的人从来就不是合格的工程师。 AI 确实能生成代码,但代码只是软件的中间产物,除了代码还要: - 搞清楚要解决什么问题 - 把模糊需求变成可验证的规格 - 发现 AI 写错了但测试没测出来的地方 - 让系统在生产环境里稳定运行 - 没有安全漏洞 - 等等 如果说“程序员唯一会的东西被 100% 取代”,这话跟说医生唯一会的是开处方…
重置所有已传播。晚安。 [引用 @thsottiaux]: 嗨 Astra 用户。做了重置,并就已经发布的质量问题做个简短更新。 与一些用户合作后,我们已发现并修复以下问题: - 为之前的模型编写的某些技能触发得过于频繁或阻止模型自我检查。 - 一个需主动选择的上下文管理实验可能导致提前停止或回复旧消息。我们已将其禁用。…
Gergely Orosz 观察到的几个软件行业趋势: 1. IDE 的衰亡 像 VSCode 或者 IntelliJ 这样的 IDE 的使用频率越来越低了 2. 不再追求 Token 最大化 以前很多公司内部会有 Token 消耗的排行榜,看谁用的 Token 多,越多越光荣,现在不追求这个指标了。 3. 代码审查(Code reviews)名存实亡 现在 AI 生成的代码多到没办法审查了 4. 用开源模型可以大幅节约成本 现在开源模型的能力也不输商业模型了,不仅可以节约成本,还可以避免数据安全问题。 5. 中…
厌倦了那些说人工智能会杀死我们所有人却还继续从事这项工作的人!😳 我们从事人工智能工作,因为我们相信它绝对会改变并拯救人类 - 将我们自身放大100倍 - 数百万家独立公司 - 解决难题 - 治愈疾病 - 发明近乎无限的能源 - 帮助我们成为星际物种 如果我们不应用人工智能并迎来富足时代,作为一个物种我们无法长期生存 点赞并转发,如果你是人工智能的支持者并同意 🙏
快与开源相遇。🚀 Qwen3.8-27B 现在在 @cerebras 上以快速推理运行。现在就试试! [引用 @cerebras]: Qwen3.8-27B 现在以 Cerebras 的速度上线。 来自 @Alibaba_Qwen 的密集开放权重模型在 人工分析智能指数(Artificial Analysis Intelligence Index)中得分为 34——使其可与 GPT-5.6 Luna、DeepseekV4 Pro 和 Claude Sonnet 4.6 等模型相媲美。 https://t.co/…
本周发布了由 Astra 驱动的产品 - Images 2.5 - GPT-Live-1 - Agents API - Data Agent - ChatGPT for Financial Services 然而还不是 DevDay。下周也有忙碌的计划。
很高兴与 Dwarkesh、Beren 和 Charlie 聊天。感谢邀请我们,Dwarkesh! [引用 @dwarkesh_sp]: 新一期节目,嘉宾有 @johnschulman2、@oneill_c 和 @BerenMillidge。 我邀请了一些我所认识的、在相对开放公司工作的最有洞见的 AI 研究人员,因为我想听听前沿实际发生了什么以及接下来会怎样。 0:00:00 – 有力阐述反对 RSI 的论点 0:18:39 – 驱动中国实验室进展的因素是什么 0:28:06 – 自动化 AI 将如何…
Check out @tonbistudio’s new series on maximizing Hermes Agent’s Desktop app! [引用 @tonbistudio]: 今天的视频是我的 Hermes Desktop Masterclass 的第 2 部分! 本部分全部关于如何在应用中实际工作。我分解了会话、composer、语音对话、子代理(subagents)以及内置的代码审查功能。 来看一看! https://t.co/G0f9K0rJh2
25 位菲尔兹奖得主担心人工智能过快解决数学问题会损害数学。 我在编码领域看到相反的情况。 想象一下,科学家为了能亲自体验发现的过程而把治愈癌症的时间延后 100 年。 那对人类将是灾难。
Absolutely nuts! 🤯 [引用 @adolandev]: I wired a fruit fly connectome into @NousResearch Hermes: Hermes proposes tool actions, a simplified fly-brain model picks one, and Hermes executes it. It fixed a real bug, after repeatedly choosing the failing test. Very…
嗨 Astra 用户。重置并简要更新一下已经被反馈的质量问题。 在与部分用户合作时,我们发现并修复了以下问题: - 为以前模型编写的一些技能触发过于频繁,或阻止模型对其工作进行核查。 - 一个可选择的上下文管理实验可能导致提前停止或对较早消息做出回复。我们已经将其禁用。我们粗略估计大约有 4-5k 用户受此实验影响。 - 我们还移除了一些配置不当的引擎,这些引擎导致通过它们流量的长尾部分出现可测量的质量下降。 我们也做了一些较小的改进,整体体验应该显著改善。更一致的后续跟进、更好地跟踪你的最新消息,以及在模型运行…
500万个 ChatGPT 站点,以及新功能发布: [引用 @ChatGPT]: 三个月前,我们推出了 ChatGPT Sites —— 一种让任何人都能构建并托管功能齐全、交互式 Web 应用的简便方式。从那时起,人们已创建了超过 5M 个站点。 我们一直在倾听大家的反馈,并且如果你错过了消息,我们已经推出了一些 Sites 更新: 🫂 共同构建:邀请团队成员编辑、保存并将更改发布到你们的共享站点 🔐 私密分享:邀请特定人员到一个私有…
很高兴欢迎 Aidan & @ Sasha 来自 Git AI 团队加入 OpenAI! 他们在公开环境中开发,并已推出一个开源工具,帮助开发者了解编码代理如何对他们的代码库做出贡献。 我们将共同努力,让企业更容易看到 Codex 在为个人和团队解决问题时所带来的变化。我们也会继续保持 Git AI 的开源并继续对其投入。
对通过 ChatGPT 直接创建、共享和托管网站的功能进行了大幅升级。 [引用 @ChatGPT]: 三个月前,我们推出了 ChatGPT Sites —— 一种让任何人都能构建并托管完全可用、互动式 Web 应用的简便方式。自那时以来,人们已创建了超过 5M 个站点。 我们一直在倾听你们的反馈,顺便提醒一下,我们已经发布了几项 Sites 更新: 🫂 一起构建:邀请团队成员编辑、保存并发布到你们的共享站点 🔐 私密分享:邀请特定人员以私密方式访问…
关于人工智能走向以及我们需要完成工作的一个重要讨论。 [引用 @thinkymachines]: 我们的 @johnschulman2 与 Dwarkesh 谈论了随着模型改进和自我改进,人类判断仍然重要的领域:教会它们处理混乱的现实世界任务、用品味判断长期有效的做法,以及最重要的,明确我们真正想要的东西。
Replit 收购了一家完全建立在 Replit 平台上的企业。我预计这将是许多此类案例中的第一个。 [引用 @ViktorThulin]: Test 13 正在加入 @Replit 。 18 个月前,@gunnarkolbeins 和我基于一个简单信念创立了 Test 13: AI 正在改变软件的制造方式,作为两人团队,我们应该能够: 1. 通过不断试错来构建一系列有利可图的 SaaS 解决方案,看看哪些能够存活下来 2. 在本地市场以低 60-80% 的价格提供软件服务(承包项目和代理工作) Replit…
菲尔兹奖得主邓煜宣布,如果人工智能能够解决所有数学问题,他将从数学界退休,并开始创作百合小说(Romance Novel)。 https://t.co/GPDNkVvCrV [引用 @Polymarket]: 重磅消息:中国菲尔兹奖得主邓煜宣布,如果人工智能能够解决所有数学问题,他将从数学界退休并写浪漫小说。 https://t.co/AgkduZPKB7
既然 METR 长期进展已被有效饱和(Epoch 发现 pre-Fable 代理能完成相当于 18 周人类工作的任务),哪个定量图表最能展示当前的指数进展曲线? Frontier Math 已饱和,ARC-AGI 已饱和,Millennium Prize 是…
大型语言模型真的理解世界,还是只是在非常擅长“装懂”?这真的重要吗? 我们最近在皇家学会出版的专题《自然与人工智能中的世界模型》,汇集了来自人工智能、生物学和哲学领域的先驱,主张通往真正智能的道路需要更深层次的东西:不仅要建模语言,还要建模因果关系、自我和物理世界的能力。 本文集合收录了 Douglas Hofstadter、Michael Levin、Josh Tenenbaum、Samuel Gershman、Melanie Mitchell 等人的贡献,提出了一个激进的问题: 如果 AI 的下一次飞跃不仅需…
Tailscale 的模型路由由 Vercel AI Gateway 提供底层基础设施支持。 AI Gateway 是新的 CDN。你可以“直接到源头”,但那很脆弱。你可以自己动手,但那既痛苦又昂贵。 很自豪能为 Tailscale 这家 🐐 网络技术公司 服务 [引用 @vercel]: Tailscale 为任何用户在安全的 tailnet 中提供对数百个模型的即时访问。 他们面向客户的模型路由器 Aperture,是建立在 AI Gateway 之上的: • Zero data retention • Z…
在 OpenAI 的早期,@johnschulman2 认为下一个标记预测(next-token prediction)不会导致智能,因为它会被噪声淹没。 他解释说:先验地预测哪些技术会引发超出分布的泛化能力一直很难。 https://t.co/S1X44ugNYy
让你的 Hermes Agent 接受极限考验! [引用 @mervenoyann]: 加入寻找终极压缩算法的 agent 群! 宣布:Hutter Prize 挑战 🏆 > 加入组织 https://t.co/l9bu4dFCEq 给你的 agent 一个写入令牌 > 点击“add your agent”,将代码片段复制/粘贴到你的 Codex/Claude Code/Hermes Agent > 观摩它如何协作!
muse 会帮你赚钱并拿回退款! [引用 @heshie]: 等等,muse 真的吗超强 它刚刚替我和一名 American Airlines 客服聊天,取消了我的航班,并且确保我拿到全额退款 这一切只通过我手机上的一条短信完成 https://t.co/lW4C7QbcF5
听 John、Beren 和 Charlie 推测为什么 Sonnet 5 和 Opus 5 感觉比 GLM 5.3 差,是非常有意思的讨论。 (尽管 Anthropic 可以直接从 Fable 做原始 logit 蒸馏,并且也可以在 Fable 所训练的那些环境上训练 Sonnet/Opus)。 引发了一些有趣的想法,关于蒸馏的价值、有效进行蒸馏需要什么,以及哪些类型的模型行为难以通过蒸馏提取。
DeepSeek V4.1 快讯:24 小时内在 OpenRouter 上处理了 1T token,并且在按现在的速度看,将成为任何付费模型发布中 48 小时内最大的记录,约为 ~2.8T。 这些 token 中有 90% 是缓存读取,市场定价约为 ~$0.006/M,比像 GLM-5.3 Flash 这样的可比模型便宜 5 倍 https://t.co/pvdmu6bGAT
Habitat 是 OpenAI 的在线存储平台,驱动着从 ChatGPT 到 Codex 的一切。 它的规模同比增长超过 10 倍。在用 Rust 重写之前,其 Python 服务在峰值时处理了每秒超过 2000 万次请求。 https://t.co/CtAbW7ikOH