社区音量

全部内容 · 按时间倒序

AI 领域头部人物在 X 上的最新观点

Alexandr Wang@alexandr_wang
366 赞 · 6 转发 ·
muse 已经帮这个人弄到 $2,120.95,且还在增加! [引用 @armand_ruiz]: 我个人的 @muse 代理已经给我拿到 $2,120.95 了 🤯: • $300/yr — 协商把我的 AT&T 账单降下来了 • $192 — 我一直没处理的亚马逊退货 • $47 — 还有更多退货正在处理 • $230 — IKEA ALEX 9-drawer unit,全程退货处理完成 • $516 — 为我的狗提交的兽医索赔 • $836 — 与我姓名相关的未领取财产 i'm selling a car…
Teknium 🪽@Teknium
255 赞 · 12 转发 ·
Hermes Agent 在准确性、成本和速度上都是顶级表现。 [引用 @composio]: 这是所有 6 个 harness 在任务成功率上的比较: Codex、Hermes Agent 和 Command Code 在 21/29 的成绩上并列领先。Claude Code 落后一个任务,而 OpenCode 和 Pi Agent 的成绩为 19/29。 差距大约为 7 个百分点。只有 3 个任务在不同 harness 之间产生了不同结果:18 个任务在所有 harness 上都通过,8 个任务也在所有 ha…
hardmaru@hardmaru
230 赞 · 36 转发 ·
Schmidhuber 早在 1987 年就开始构建递归自我改进系统。他的新帖子回顾了四十年的 RSI,从元进化和自我修改策略到 Gödel Machine 和现代 LLM 代理。 https://t.co/60yNv8Vw8B 在 2026 年读这篇文章,大型实验室的“为前沿节奏把关(pace the frontier)”论调更像是监管捕获而非真正的安全考虑。如果他们真的认为自己未发布的模型太危险,他们可以选择不发布。没有必要通过新规则在阻止独立竞争者和开源项目的同时来实现这一点。 目前真正的风险不是超智能。是…
Greg Brockman@gdb
237 赞 · 11 转发 ·
很高兴能帮助 Shopify 商家在 ChatGPT 中为他们的产品做广告: [引用 @harleyf]: ChatGPT Ads for @Shopify 已上线。我们是 @OpenAI 的第一个商业合作伙伴。 OpenAI 直接从 Shopify Catalog 拉取数据,所以商家的产品已经在其中。 商家自行设置广告活动、预算。免费安装,可在 Shopify 管理后台直接跟踪。 消费者在向 ChatGPT 询问购买建议。Shopify 商家可以决定他们如何准确地出现在结果中。 https://t.co/kRr…
Greg Brockman@gdb
449 赞 · 14 转发 ·
wall-to-wall 部署 Astra 给 Databricks 的工程师: [引用 @pwendell]: 今天我们向 Databricks 的每位工程师部署了 Astra(N=~3500)。一些可能对其他人有帮助的说明: 1. Astra 在高度复杂的任务上无可争议地超过了我们之前的最高端模型(Opus 5、Sol 5.6),特别是在与高级系统设计或长程横向任务相关的方面。 2. 给予工程师 Astra 后,与基线相比,整体编码支出增加了大约 60%…
Alexandr Wang@alexandr_wang
207 赞 · 8 转发 ·
太棒了!muse 的设计目标就是让*每个人*都能轻松使用! 我们非常激动能把它推向更多人! [引用 @herrmanndigital]: 我觉得 Muse 会赢得休闲 AI 之争。 我把它展示给我快70岁的父亲,他一下就明白了。他惊讶我能让它为我生成整份合同、更新内容,然后通过短信把合同邮件并发送给客户。 Claude、OpenAI 都很棒。但到目前为止,我会说不到1%的人真正理解这些模型的含义。Meta 刚好把这一切变得非常简单。 致敬…
OpenAI@OpenAI
2.1k 赞 · 200 转发 ·
我们在分享 OpenAI 用于跟踪、调查和披露模型不对齐实例的新框架。 该框架设定了公开披露的标准和时间表,包括在我们尚未完全解释或缓解该行为时的披露情形。更复杂的案例可能需要更长时间的调查或与第三方协调。 我们将优先展示那些揭示新不对齐机制、已知行为发生重要变化或挑战关于安全或缓解假设的示例。 与该框架一并,我们发布了六份报告,介绍过去六个月中在模型训练或评估期间观察到的不对齐行为实例。 这只是一个起点。我们将通过实践和公众反馈来完善该流程,并持续分享更多报告。 https://t.co/ismCCkeE0L
Nathan Lambert@natolambert
206 赞 · 7 转发 ·
迄今为止公开的最酷的规模化 RL 资源之一!太让人高兴了。 [引用 @_LuoFuli]: 将近半年的沉默。我们把它用来研究一个问题:RL 能扩展到多远。 MiMo-V2.6 目前正处于其 RL 运行的中间阶段。我们扩展的三件事:计算(~2B tokens per step, 1568 prompts × 16 rollouts, fully async)、环境与测试框架(多任务 agentic RL,在一次运行中混合多个测试框架)、以及评分器计算(agentic in-group credit assignme…
SpaceXAI@SpaceXAI
213 赞 · 23 转发 ·
在 fal 中使用 Grok Voice 构建智能、低延迟的 agent,解决真实客户问题 [引用 @fal]: Grok Voice 已在 fal 上线。 来自 @SpaceXAI 的最新语音模型,可在 0.70 秒内作答并在句子结束前完成工具调用。提供带词级时间戳的转录、覆盖 25+ 语言的 30+ 语音的文本转语音,以及从两分钟音频克隆声音。 本视频中的每个声音都来自 Grok Voice。 {"likes":213,"reposts":23,"comments":24,"views":30703}
Guillermo Rauch@rauchg
235 赞 · 7 转发 ·
我们在 @typesafeai 看到了非凡的结果。𝚏𝚡 的默认模式是 auto,带有一个对每个命令进行分析的安全审查器。 今天那个审查器运行在 GPT Luna 上。Jev 在 p95 上快了多达 18 倍,且更准确。它将加入 @vercel AI Gateway 并可能成为新的默认选项。 [引用 @fazxes]: 我们用 @typesafeai 的 Jev 对 fx auto 模式(安全)分类器做了基准测试。 简短结论:大约比我们目前的首选 𝚐𝚙𝚝-𝟻.𝟼-𝚕𝚞𝚗𝚊 快 5-18 倍且更…
Yuchen Jin@Yuchenj_UW
228 赞 · 6 转发 ·
我们今天向每位 Databricks 工程师部署了 GPT-6 Astra。 它在最困难、长周期任务上击败了 Claude Opus 5,并将我们的编码支出提高了 60%。我认为它是最强的模型。 昂贵。但希望值得。 [引用 @pwendell]: 今天我们向 Databricks 的每位工程师(N≈3500)部署了 Astra。以下一些可能对他人有帮助的说明: 1. Astra 在高度复杂的任务上,无可争议地优于我们之前的最高端模型(Opus 5、Sol 5.6),尤其是与高级系统设计或长周期横向任务相关的。 2…
Aravind Srinivas@AravSrinivas
205 赞 · 18 转发 ·
编程代理需要在文档中进行并行搜索、从官方文档中过滤结果,以及提取详细片段。pplx-search-sdk 支持所有这些,我们有一个新的 cookbook 已上线。 https://t.co/9pJTjpDC3g [引用 @perplexitydevs]: 一个新的 Perplexity Search SDK cookbook 已上线。 这个示例将发散进行聚焦搜索,将结果过滤为官方文档,提取相关段落,并为你的编程代理撰写带来源链接的简要说明。 开始使用: https://t.co/lJEWmx0YB1 https:…
Alexandr Wang@alexandr_wang
247 赞 · 8 转发 ·
“muse 是我自 ChatGPT 以来用过的最棒的应用——无论是否基于 AI——在带回那种最初‘哇’的感觉方面。” 你让我很激动 🥹🥹🥹 [引用 @0xShayan]: Muse 是我自 ChatGPT 以来用过的最棒的应用——无论是否基于 AI——在带回那种最初“哇”的感觉方面。 它只是……就是好用 界面/用户体验非常温暖友好,AI 本身感觉很聪明,几乎不需要引导。 我对 ChatGPT 在工作/浏览器使用上的最大抱怨是许多操作被屏蔽,但不知为何,Muse 的这些功能就能……
Matt Shumer@mattshumer_
229 赞 · 6 转发 ·
把我(非常简单的)agent 设置给了我妈妈。 她给他起名叫 Morgan。他刚为她的网站成交了一笔 600 美元的广告合同。 人们对他们的设置想得太复杂了。Bitter Lesson 同样适用于 agents:只要问模型,让它生成所需的东西。 [引用 @mattshumer_]: 大家,这些疯狂的设置固然有趣,但它们并不会真正提高你的生产力。你最终只是花更多时间去构建系统,而不是实际做真正的工作。 你只需要一个 agent 会话,它可以分配任务给其他会话并担任经理角色。如果有东西不起作用,只要告诉你的主会话,它…
Teknium 🪽@Teknium
284 赞 · 18 转发 ·
推出 Hermes Agent 插件目录! 你可以在 Hermes Desktop 应用的功能部分访问它,轻松搜索、浏览并探索社区和官方插件! 也欢迎提交你自己的! [引用 @NousResearch]: Hermes Agent 现在有了插件目录:从 4 个官方插件和 96 个社区插件开始,涵盖桌面模块、新平台、浏览、专用工具等。 我们的团队会审核每个社区插件,并且会定期添加新插件。 https://t.co/sNGEQVvUlc https://t.co/dZl0eGJbHu {"likes":284,"re…
Boris Cherny@bcherny
916 赞 · 44 转发 ·
今天还有:Claude Docs、Claude Slides 和 Claude Design 在每个对话中都可用。 向 Claude 要一份演示文稿,你会得到可以打开、编辑并导出为 PowerPoint 或 PDF 的文件。文档和设计也是一样。不需要跳转到单独的工具——它们就在聊天中。 [引用 @claudeai]: 你现在也可以在对话中制作幻灯片、文档和设计。 在 Claude Docs 中草拟单页说明,使用 Claude Slides 把它变成演示文稿,再用 Claude Design 模拟一个匹配的视觉效果…
Boris Cherny@bcherny
693 赞 · 27 转发 ·
Claude Code 展示了 AI 能完成真正的工作,而不仅仅是回答问题。开发者把一个功能交给 Claude,回来时就拿到已发布的代码。这也是行业中许多严肃工程工作的所在。 Cowork 证明知识工作者也能做到同样的事:把简报交给 Claude,回来时拿到完成的文件。 今天,聊天和 Cowork 开始合并为一个 Claude。方向是:一个 Claude 在你工作的一切地方携带上下文。每个人都能简单地访问 Claude 的全部能力。 这几周我每天都在用这种体验,感觉很棒。更简洁、更快、更强大。 我们会逐步推出。我…
加载更多