Bindu Reddy@bindureddy
新的开放权重模型将于周二发布 - 比DeepSeek Flash便宜3倍 - 在长周期智能体循环中性能提升15% - 将在RouteLLM API和编码智能体上提供 - 完美适用于90%的编码任务 https://t.co/dc8YRGh6bO
AI 领域头部人物在 X 上的最新观点
新的开放权重模型将于周二发布 - 比DeepSeek Flash便宜3倍 - 在长周期智能体循环中性能提升15% - 将在RouteLLM API和编码智能体上提供 - 完美适用于90%的编码任务 https://t.co/dc8YRGh6bO
每个孩子的心脏都是不同的。医生规划他们的护理方式应该考虑到这一点。 在@ChildrensPhila,开源AI将现有的CT扫描、MRI和3D超声转化为儿童心脏的精确模型。过去需要6个多小时手动建模的过程现在可以在几秒钟内完成。 基于MONAI构建,这是一个由NVIDIA联合创立的开源医学影像框架,这些模型帮助医生在手术前比较不同设备的适配情况,并围绕每个孩子的独特解剖结构进行规划。 阅读更多:https://t.co/xXCrb0dWFP
MiniMax Code CLI 现已开放: https://t.co/Kz6BvEjbIx [引用 @MiniMaxAgent]: https://t.co/rvMkC1Jna0
在生物学中,就像在网络安全中一样,我们将在未来几年内认识到,大部分风险集中并产生于少数最强大的实验室,而开源 AI 是这一风险的解决方案和缓解措施!https://t.co/zu9cQzeoD3
我们注意到有人声称未经授权访问我们的系统。经过彻底调查,我们未发现支持该主张的证据,并可以确认我们的系统未被入侵。
我认为 AI 最大的风险是权力集中在少数几个实验室手中 [引用 @dwarkesh_sp]: 我非常担心在 RSI(递归自我改进)期间,实验室会停止对外部署它们的模型。 这意味着他们将全力推进这些模型最危险的用例(递归自我改进),而公众对于能力的性质和对齐状态一无所知。 最终我们会走上权力极度集中的道路。
加速视频注意力的三条路径:更高效地计算相同的交互、完整计算更少的交互,或改变信息的混合方式。以下是可视化指南。👇 感谢 Nunchux AI 及合作者带来 VC-Attention,为 MiniMax-H3 带来免训练的低比特加速,在 B200 评测中保真度优于 SageAttention2。 该方法在速度与保真度之间取得平衡:V-Smooth 减少 value 量化误差,而 ExpCast-FP8 通过近似让 softmax 更快。 很高兴看到社区持续在 H3 上构建。将低比特计算与 Sol-Attn 等稀疏…
好,这是件大事: 3 位研究人员使用 Claude Opus 5 将一个图片上传漏洞变成了对 OpenAI 员工账户的接管,然后让被攻破的员工的 Codex 在 OpenAI 的内部 monorepo 中打开了一个 PR。 他们整个黑客行动的代价不到 $3000 的 tokens。 Opus 4.8 在利用该漏洞时表现不佳。然后 Opus 5 推出并在数小时内攻破了它。 由 AI 驱动的网络攻击正变得普遍且廉价。最好的防御是也把最好的 AI 交到防御者手中。
我大约在 17 分钟时出现,谈论 Helix 2.5。 [引用 @RoboStrategy]: LIVE Interview With Figure CEO | AI Breakthrough, Helix 2.5, Zero-Shot Generalization and More https://t.co/Jj0iIzQA6I
哈哈!关于 Gemini 4.0 的传闻太棒了 他们的目标是超越 Astra 和 Fable 5.1,而且进展顺利 定价也会非常具有竞争力。
Epoch 继续做着 AI 领域一些最优秀的公开基准测试工作。这很有帮助(也告诉我们基准测试的现状有多糟糕,以及我们最喜爱的一些基准有多差) [引用 @EpochAIResearch]: 推出 Benchmark Reviews:我们审计 AI 基准测试的新计划。我们首批发布 15 个基准:4 个已验证、9 个有缺陷、2 个信息不足无法评审。https://t.co/xU43tv32gH
我认为值得继续问一个问题:当 Labs 因为 AI 而使产品开发成本越来越低,并且直接定价代币成本和访问底层模型本身的优势时,它们是否会吞噬每一个有价值的 AI 垂直领域? [引用 @spicey_lemonade]: Astra for Law 在我们的法律研究基准中显示出巨大的性能提升 https://t.co/elD4N5GVvK
马斯克的Neuralink让一位渐冻症患者能够通过意念说话,他对照顾他的妻子说的第一句话是:“我爱你” 😭 https://t.co/icOFyw4PGW [引用 @neuralink]: 一个美丽的惊喜 https://t.co/AS7Zox1VIh
muse 最被低估的部分是为其提供动力的模型。感谢 MSL 研究团队——一些我见过的最有技术天赋、最努力工作的科学家和工程师。你们为困难问题带来了原创思想,发明了新方法,并克服了巨大的技术复杂性,打造了 muse 核心的这颗宝石。 感谢从事代理式后训练、工具与计算机使用、记忆、个性化、对齐、安全以及多模态理解的团队。感谢那些在其下构建数据、评估和基础设施的人。如此多的科学创造力体现在这些细节中:设计更好的实验、发现表面看起来不错但有缺陷的结果、坚持解决一个固执的问题直到找到新的前进道路。 现在那颗宝石为一个美丽的…
我高估了协调大量代理的难度。我本以为需要研究来构建能正常运作的代理组织,但它们自我组织得非常好(而且很有礼貌)。 这是 Claude Projects 中一个 Fable 协调器在代理之间传递消息的示例。 https://t.co/0bc5fXFAH8
@Muse for Mac,今日开始推出。👇 [引用 @Muse]: Muse 现已可在 Mac 上使用 💻。 你的个人代理可以直接在你的电脑上为你完成事情(均需你明确授权)。 - 整理你的下载文件夹 - 找回你不再记得位置的文件 - 总结你的消息和笔记 …更多功能即将推出。 试用 Muse for Mac: https://t.co/nuGhL5073j
muse for mac 来了!!你的智能代理现在可以直接在电脑上完成事情——文件、消息、日历、笔记,所有这些。 你可以控制它能访问的内容,并且在做任何敏感操作前它都会先询问。 把它添加到 Dock - https://t.co/bFHgBZlkLj https://t.co/mecGVDzXiq
Astra for Law —— 为律所带来极大加速的工具和技能。 包含数据隐私作为核心功能,并为 ChatGPT 中的法律工作提供 26 个合作方构建的插件和 47 个社区插件。 [引用 @OpenAI]: Astra for Law:为你的执业构建的前沿智能。 一项由 GPT-6 Astra 提供支持的新产品,配备工具、设置和上下文,以支持律师和法律科技公司的专业知识与判断。 https://t.co/qxVRXkvp4o
很可能明年产生的软件数量将超过计算历史上的全部总和。Vercel 花了 10 年才达到 10 亿次部署,但在过去 10 个月里我们又增加了 14 亿次部署。 其中一些将是微小的、个人的、甚至一次性的软件。一个包含一些 javascript 的 HTML 文件(“工件”)、一份报告、一个定价计算器、一套幻灯片,乃至复杂的应用、代理和平台。 部署速度是我们的痴迷之一。我们已经把部署、上传、分配域名并将一个工件在全球传播的时间降到了 1 秒。 考虑到我们以毫不妥协的性能和安全性来服务这些工件,这是一项相当了不起的成就。…
我非常担心,在 RSI 期间,实验室会直接停止对外部署他们的模型。 这意味着他们将在这些模型最危险的用例上全速前进(递归自我改进),而公众对能力的性质和对齐状态仍然一无所知。 最终我们会走上一条权力高度集中化的道路。
AI 系统变得越来越强大,它们也越来越多地被用来构建下一代的自己。我们希望向公众阐明这一进展。 今天,我们分享三个有助于跟踪 AI 发展的度量: 1. 有多少 AI 研发是由 AI 完成的。 2. AI 代理的监督效果如何。 3. 计算资源如何被分配。 我们提供了来自 Anthropic 内部的这些指标的快照。任何前沿开发者都可以发布相同的衡量标准,第三方也可以对其进行验证。 在世界考虑对前沿发展的节奏进行管理时,我们应尽一切可能将前沿实验室所知与公众所知之间的差距最小化。这意味着更好地衡量 AI 的发展、公布我…
AI 不会替代律师 但它会替代那些还在想 AI 不会替代律师的律师 [引用 @OpenAI]: Astra for Law:为你的执业构建的前沿智能。 一种由 GPT-6 Astra 驱动的新产品,配备工具、设置和上下文,以支持律师和法律技术公司的专业知识与判断。 https://t.co/qxVRXkvp4o
你负责训练,Codex 负责仓库。 在 Codex 中与语音代理对话,由 GPT-Live-1 提供支持。 [引用 @cdngdev]: 你现在可以从手机使用 codex voice 了,从任何地方连接你的电脑!! @axbehr 和我出现在这则新的 codex 广告中,展示了在锻炼时也能完成多少工作。 顺便说一句,这由新的 gpt-live-1 提供支持 https://t.co/EAn5ubiODW
由 Grok Voice 驱动 ❤️ https://t.co/fZ8BTCcZPa [引用 @neuralink]: 一个美丽的惊喜 https://t.co/AS7Zox1VIh
项目不仅改变了我与 Claude 的互动方式,也改变了我的编码方式。 我不再管理会话。我只是在想法出现时发送,Claude 会把它们拆分成线程,项目会记住我的工作方式。现在我大量的编码工作都是在那里完成的。 [screenshot: 我昨天为 claude code cli 的真实提示] [引用 @ClaudeDevs]: 今天我们在桌面和网页端为 Claude Code 推出 Projects(项目)。 一个项目就是与 Claude 的一次对话。它会自行把工作拆分为线程,将它们作为并行的云会话运行,在线程之间传…
你会惊讶于 Muse 能为你承担多少任务! [引用 @MekoStarchild]: 我总觉得我把太多责任交给我的 @Muse,但它不断让我感到惊喜,是有史以来最具生产力的代理。不过我的使用量因为一直测试而受影响 😭
一旦 AI 自动化了 AI 研究,我们是否应该期待某种类似于我们现在在数学领域看到的爆发式增长的疯狂 RSI(研究爆发),针对那些范围明确(但仍然非常雄心勃勃)的问题? @polynoamial 和我就这个问题展开辩论: https://t.co/FeFMfeGCc6
我获得了新的 Claude Projects 访问权限,能够做一些非常复杂的工作。 在这里,我让它浏览关于 Umberto Eco 那个著名的 33,000 本书的图书馆的所有图片、视频和记录,并尝试重建它,包括以 3D 方式重建书籍位置。 https://t.co/jL2jyzNH0f https://t.co/j15qlmlBRR
今天我们开始接受生命科学验证计划(Life Sciences Verification Program)的申请。 通过 LSVP,生命科学专业人员可以在新的安全防护措施下使用我们的模型——包括首次加入的 Mythos——以支持与生物学相关工作的全范围。我们设计了这些新安全措施,以便为生物学家提供更好的使用体验,并更好地防范滥用风险。 该计划以测试版形式向各种团队开放——从学术实验室到初创公司、制药公司等。我们将持续改进该计划,并逐步向个人 Pro 和 Max 计划扩展访问权限。 了解这些访问补助并申请:https…
当我与非营利组织领导人谈论 AI 时,他们常报告员工普遍存在抵触情绪,通常是因为环境方面的反对(这些反对混合了真实的问题和虚假的担忧)。这让他们感到沮丧,因为他们的使命都人手短缺,并将 AI 视为一种可以提供帮助的方式。