5 条
Yuchen Jin 今天向所有 Databricks 工程师部署了 GPT-6 Astra,表示其在复杂任务上优于竞品并提高了代码支出。
OpenAI 发布了用于追踪、调查和披露模型失配事件的新框架,并随框架发布六份报告。
Nathan Lambert 赞扬公开发布的 MiMo-V2.6 大规模强化学习资源,称其非常出色。
10 条
SpaceXAI 宣布 Grok Voice 在 fal 上线,支持0.70秒响应、字级时间戳及多语音克隆。
Guillermo Rauch 表示 typesafeai 的 Jev 在 p95 下比 GPT Luna 快5–18倍且更准确,拟加入 Vercel AI Gateway。
Aidan Gomez 宣布与 Aleph Alpha 完成最终协议,Cohere 将成为跨大西洋的基础模型开发者。
Yuchen Jin 发现 OpenRouter 上的 Union Alpha 达到 Claude Fable 5.1 水平且成本低十倍以上,盼其开源。
Grok 宣称 Grok Build 会随使用越发智能,记住约定、决策与项目事实并支持会话记忆与整理命令。
12 条
Boris Cherny 说 Claude 已把 chat 与 Cowork 合并为一个可跨场景携带上下文的单一 Claude。
Bindu Reddy 宣布 Abacus AI Bot 为永久免费个人 AI,可路由并使用网络上的免费 LLMs 执行个人事务。
Gorden Sun 介绍 Dream-RSI,利用历史探索记录低成本“做梦”重演以离线评估并进化 AI Agent 策略。
Alexandr Wang 表示 Muse 已在100个真实案例中为用户节省了共计$9,649.71。
OpenRouter 报告称三个开源权重实验室在2026年花费已增长10倍以上,而闭源模型支出增长较慢。
无值得记录的动态
2 条
Mistral AI宣布与Mozilla建立合作,旨在为使用AI浏览网页的用户带来隐私、控制和选择。
Bindu Reddy称扎克解决了AI节奏问题,并主张实验室应确保模型安全,否则若AI出事故将面临刑事责任。
1 条
MiniMax (official) 在日本IP AI共创大会上发布了MiniMax H3 IP Edition,结合官方授权的日本IP与MiniMax H3能力。
3 条
Yuchen Jin 表示 Jev 是新发布的模型,声称20–200x更快、40–400x更便宜,作者测试未花费超过0.10美元。
Amjad Masad 认为若输出域已知,直接训练模型生成枚举项的对数概率更合适。
Ethan Mollick 认为这是一个优秀演示,展示用于按决策规则快速分类的信息模型,非LLM且不能输出文本或代码。
6 条
Jeff Dean 转引 LiamFedus 说他们用1300台 H200 和实验数据训练的开源模型 Neon 在分析基准上超过了 GPT-6 Astra。
Alexandr Wang 宣布 muse spark 1.3 在避免作弊/奖励操纵方面表现最佳,并发布了 CheatBench 评测。
Alexandr Wang 认为必须投资于对齐,并建议各实验室建立含外部评估者和独立监督的治理框架。
Yuchen Jin 表示 Zuck 的 AI 安全观点与多数前沿实验室相反,认为将控制权集中于少数机构更危险。