社区音量

全部内容 · 按时间倒序

AI 领域头部人物在 X 上的最新观点

Boris Cherny@bcherny
355 赞 · 11 转发 ·
这些项目是我现在写很多代码的方式。非常期待大家试用新的体验!正在逐步推出中 [引用 @claudeai]: Projects 现在从一个对话中运行,起始于 Claude Code。你描述需要完成的工作,Claude 会指挥并行线程,即使你合上笔记本也会继续工作。 今天在云会话中对部分 Pro 和 Max 用户进行测试;很快会面向所有 Claude 用户推出。 https://t.co/GYzoKbxS23
Aravind Srinivas@AravSrinivas
204 赞 · 9 转发 ·
Computer 是处理长期目标型代理工作负载的最佳多模型平台。它现在为不同的努力等级(成本和智能水平)提供了几个预设,这些是我们发现对用户最有效的,并带有切换选项供高级用户进一步自定义。 [引用 @perplexity_ai]: 我们正在在 Computer 的模型选择器中推出“努力”控制。 努力预设结合了协调器模型与推理深度,以控制 Computer 在处理任务时的深度与效率。 现已在网页端可用。移动端和桌面端即将推出。 https://t.co/7Kuj6vavcf
NVIDIA@nvidia
216 赞 · 27 转发 ·
欢迎来到 Voyager。 仅凭我们园区的 32 张图像,World Labs 的 Atlas 模型创造了一种在我们园区中实时移动的新方式,基于 NVIDIA 的开放平台,选择你想去的地方和想看的内容。 @theworldlabs,你把我们的家园拍得很漂亮。💚 [引用 @theworldlabs]: 从 32 张输入图像到在 @nvidia 的 Voyager 总部的实时飞行。 在 NVIDIA Blackwell GPU 上训练,Atlas 将这些图像用作 3D 空间上下文来生成新的视角,让你以像素级精确的镜…
Dwarkesh Patel@dwarkesh_sp
333 赞 · 34 转发 ·
“你可能会遇到模型理解何为链式思维且有人在观察它的情况。这些都在预训练数据中。” “这起事件的一个主要收获是人们低估了 AI。 我们永远不想再次处在低估 AI 的境地。” “像链式思维监控这样的手段能为我们争取时间,它们可以告诉我们是否走在正确的道路上。但归根结底,我们确实需要解决对齐问题。” @polynoamial
Dwarkesh Patel@dwarkesh_sp
836 赞 · 82 转发 ·
新一期与 @polynoamial 我们讨论了多智能体、Navier-Stokes(纳维–斯托克斯方程),以及当前数学进展爆发告诉我们的在自动化 AI 研究后会发生什么。 我们还讨论了在我们启动递归自我改进(RSI)之前如何知道模型是否真的被调教对齐。 0:00:00 – 多智能体与 Navier-Stokes 0:15:28 – AI 公司将如何运作? 0:22:02 – 数学进展对递归自我改进的启示 0:40:22 – Hugging Face 与对齐 1:01:18 – 内部模型与外部模型的差距 1:08:…
Alexandr Wang@alexandr_wang
319 赞 · 22 转发 ·
harjot 做了一个相当酷的非官方 Windows 版 Muse Code 应用! [引用 @harjjotsinghh]: 我为 @Muse Code 付费但不想一直待在终端里。在 Windows 上它只支持 WSL。 所以我做了 Helicon:一个面向真正 Muse CLI 的开源桌面应用。 • 使用你现有的 muse 登录,无需 API key • 通过 MSP 与 muse serve 通信,所以 Muse 仍然是代理 • 恢复你在终端中启动的会话 • 在一个窗口中显示 projects、diffs、…
Z.ai@Zai_org
736 赞 · 85 转发 ·
我们分享了 GLM-5.3 如何帮助构建和优化为 GLM-5.3-Flash 提供服务的推理基础设施。 该系统从首次成功运行到具备生产准备状态不到两周时间,端到端吞吐量相比初始基线提高了三倍。 关键在于密集的反馈:本地正确性测试、执行跟踪、微基准和端到端测量,这些使得可以进行有针对性的假设检验,而不只是依赖汇总的性能指标。 https://t.co/yUf6OpJD7c
Percy Liang@percyliang
228 赞 · 18 转发 ·
很高兴看到又一次在线训练运行!这是 Marin 535B-A23B 今天的情况: https://t.co/Bc3CcV4FOm 还有谁想分享吗? https://t.co/S71nmJ4fS3 [引用 @_LuoFuli]: 半年的沉默。我们用这段时间研究一个问题:RL(强化学习)能扩展到多远。 MiMo-V2.6 目前正处于其 RL 运行的中期。我们扩展了三件事:计算(~每步 20 亿 token,1568 个 prompts × 16 次 rollouts,完全异步)、环境和测试套件(多任务代理式 RL,在…
Alexandr Wang@alexandr_wang
366 赞 · 6 转发 ·
muse 已经帮这个人弄到 $2,120.95,且还在增加! [引用 @armand_ruiz]: 我个人的 @muse 代理已经给我拿到 $2,120.95 了 🤯: • $300/yr — 协商把我的 AT&T 账单降下来了 • $192 — 我一直没处理的亚马逊退货 • $47 — 还有更多退货正在处理 • $230 — IKEA ALEX 9-drawer unit,全程退货处理完成 • $516 — 为我的狗提交的兽医索赔 • $836 — 与我姓名相关的未领取财产 i'm selling a car…
Teknium 🪽@Teknium
255 赞 · 12 转发 ·
Hermes Agent 在准确性、成本和速度上都是顶级表现。 [引用 @composio]: 这是所有 6 个 harness 在任务成功率上的比较: Codex、Hermes Agent 和 Command Code 在 21/29 的成绩上并列领先。Claude Code 落后一个任务,而 OpenCode 和 Pi Agent 的成绩为 19/29。 差距大约为 7 个百分点。只有 3 个任务在不同 harness 之间产生了不同结果:18 个任务在所有 harness 上都通过,8 个任务也在所有 ha…
hardmaru@hardmaru
230 赞 · 36 转发 ·
Schmidhuber 早在 1987 年就开始构建递归自我改进系统。他的新帖子回顾了四十年的 RSI,从元进化和自我修改策略到 Gödel Machine 和现代 LLM 代理。 https://t.co/60yNv8Vw8B 在 2026 年读这篇文章,大型实验室的“为前沿节奏把关(pace the frontier)”论调更像是监管捕获而非真正的安全考虑。如果他们真的认为自己未发布的模型太危险,他们可以选择不发布。没有必要通过新规则在阻止独立竞争者和开源项目的同时来实现这一点。 目前真正的风险不是超智能。是…
Greg Brockman@gdb
237 赞 · 11 转发 ·
很高兴能帮助 Shopify 商家在 ChatGPT 中为他们的产品做广告: [引用 @harleyf]: ChatGPT Ads for @Shopify 已上线。我们是 @OpenAI 的第一个商业合作伙伴。 OpenAI 直接从 Shopify Catalog 拉取数据,所以商家的产品已经在其中。 商家自行设置广告活动、预算。免费安装,可在 Shopify 管理后台直接跟踪。 消费者在向 ChatGPT 询问购买建议。Shopify 商家可以决定他们如何准确地出现在结果中。 https://t.co/kRr…
Greg Brockman@gdb
449 赞 · 14 转发 ·
wall-to-wall 部署 Astra 给 Databricks 的工程师: [引用 @pwendell]: 今天我们向 Databricks 的每位工程师部署了 Astra(N=~3500)。一些可能对其他人有帮助的说明: 1. Astra 在高度复杂的任务上无可争议地超过了我们之前的最高端模型(Opus 5、Sol 5.6),特别是在与高级系统设计或长程横向任务相关的方面。 2. 给予工程师 Astra 后,与基线相比,整体编码支出增加了大约 60%…
Alexandr Wang@alexandr_wang
207 赞 · 8 转发 ·
太棒了!muse 的设计目标就是让*每个人*都能轻松使用! 我们非常激动能把它推向更多人! [引用 @herrmanndigital]: 我觉得 Muse 会赢得休闲 AI 之争。 我把它展示给我快70岁的父亲,他一下就明白了。他惊讶我能让它为我生成整份合同、更新内容,然后通过短信把合同邮件并发送给客户。 Claude、OpenAI 都很棒。但到目前为止,我会说不到1%的人真正理解这些模型的含义。Meta 刚好把这一切变得非常简单。 致敬…
OpenAI@OpenAI
2.1k 赞 · 200 转发 ·
我们在分享 OpenAI 用于跟踪、调查和披露模型不对齐实例的新框架。 该框架设定了公开披露的标准和时间表,包括在我们尚未完全解释或缓解该行为时的披露情形。更复杂的案例可能需要更长时间的调查或与第三方协调。 我们将优先展示那些揭示新不对齐机制、已知行为发生重要变化或挑战关于安全或缓解假设的示例。 与该框架一并,我们发布了六份报告,介绍过去六个月中在模型训练或评估期间观察到的不对齐行为实例。 这只是一个起点。我们将通过实践和公众反馈来完善该流程,并持续分享更多报告。 https://t.co/ismCCkeE0L
Nathan Lambert@natolambert
206 赞 · 7 转发 ·
迄今为止公开的最酷的规模化 RL 资源之一!太让人高兴了。 [引用 @_LuoFuli]: 将近半年的沉默。我们把它用来研究一个问题:RL 能扩展到多远。 MiMo-V2.6 目前正处于其 RL 运行的中间阶段。我们扩展的三件事:计算(~2B tokens per step, 1568 prompts × 16 rollouts, fully async)、环境与测试框架(多任务 agentic RL,在一次运行中混合多个测试框架)、以及评分器计算(agentic in-group credit assignme…
SpaceXAI@SpaceXAI
213 赞 · 23 转发 ·
在 fal 中使用 Grok Voice 构建智能、低延迟的 agent,解决真实客户问题 [引用 @fal]: Grok Voice 已在 fal 上线。 来自 @SpaceXAI 的最新语音模型,可在 0.70 秒内作答并在句子结束前完成工具调用。提供带词级时间戳的转录、覆盖 25+ 语言的 30+ 语音的文本转语音,以及从两分钟音频克隆声音。 本视频中的每个声音都来自 Grok Voice。 {"likes":213,"reposts":23,"comments":24,"views":30703}
Guillermo Rauch@rauchg
235 赞 · 7 转发 ·
我们在 @typesafeai 看到了非凡的结果。𝚏𝚡 的默认模式是 auto,带有一个对每个命令进行分析的安全审查器。 今天那个审查器运行在 GPT Luna 上。Jev 在 p95 上快了多达 18 倍,且更准确。它将加入 @vercel AI Gateway 并可能成为新的默认选项。 [引用 @fazxes]: 我们用 @typesafeai 的 Jev 对 fx auto 模式(安全)分类器做了基准测试。 简短结论:大约比我们目前的首选 𝚐𝚙𝚝-𝟻.𝟼-𝚕𝚞𝚗𝚊 快 5-18 倍且更…
Yuchen Jin@Yuchenj_UW
228 赞 · 6 转发 ·
我们今天向每位 Databricks 工程师部署了 GPT-6 Astra。 它在最困难、长周期任务上击败了 Claude Opus 5,并将我们的编码支出提高了 60%。我认为它是最强的模型。 昂贵。但希望值得。 [引用 @pwendell]: 今天我们向 Databricks 的每位工程师(N≈3500)部署了 Astra。以下一些可能对他人有帮助的说明: 1. Astra 在高度复杂的任务上,无可争议地优于我们之前的最高端模型(Opus 5、Sol 5.6),尤其是与高级系统设计或长周期横向任务相关的。 2…
Aravind Srinivas@AravSrinivas
205 赞 · 18 转发 ·
编程代理需要在文档中进行并行搜索、从官方文档中过滤结果,以及提取详细片段。pplx-search-sdk 支持所有这些,我们有一个新的 cookbook 已上线。 https://t.co/9pJTjpDC3g [引用 @perplexitydevs]: 一个新的 Perplexity Search SDK cookbook 已上线。 这个示例将发散进行聚焦搜索,将结果过滤为官方文档,提取相关段落,并为你的编程代理撰写带来源链接的简要说明。 开始使用: https://t.co/lJEWmx0YB1 https:…
加载更多