Yuchen Jin

13 篇报道

Yuchen Jin 是一位活跃在X平台的AI评论者,常就模型性能、开源与安全议题发表看法。近期他讨论了Jev宣称的“AGI”及其20–200x更快、40–400x更便宜的说法,比较DeepSeek V4.1在代码与代理基准上对GPT-5.6的表现,表达对NVIDIA开源模型的期待,并提到对Codex与Kimi K3的偏好。

Yuchen Jin@Yuchenj_UW
228 赞 · 6 转发 ·
我们今天向每位 Databricks 工程师部署了 GPT-6 Astra。 它在最困难、长周期任务上击败了 Claude Opus 5,并将我们的编码支出提高了 60%。我认为它是最强的模型。 昂贵。但希望值得。 [引用 @pwendell]: 今天我们向 Databricks 的每位工程师(N≈3500)部署了 Astra。以下一些可能对他人有帮助的说明: 1. Astra 在高度复杂的任务上,无可争议地优于我们之前的最高端模型(Opus 5、Sol 5.6),尤其是与高级系统设计或长周期横向任务相关的。 2…
Yuchen Jin@Yuchenj_UW
411 赞 · 24 转发 ·
Jev 已经发声了。 它选出了哪个模型是 AGI。 快 20–200 倍。便宜 40–400 倍。这可能让像“将大型模型用作法官”这种东西变得异常快速且几乎免费。 (我试了很多提示,仍然没有花掉 $0.10。) https://t.co/1Uhh4nMGDl [引用 @CompleteSkeptic]: 在与 ChatGPT 共同发明后,我不断问自己:为什么那些超人类的聊天模型并没有带来通用人工智能(AGI)? 过去两年我一直在悄悄构建一种新的训练模型的方法(RLCD),以及我们今天发布的一种新类型的前沿 AI…
Yuchen Jin@Yuchenj_UW
292 赞 · 25 转发 ·
Zuck 的 AI 安全观点基本上与大多数前沿实验室相反: 大多数实验室: 模型越强大,越危险,因此应该限制访问。 Zuck: 模型越强大,让少数实验室控制它就越危险。 Zuck 很带感。 https://t.co/1AzNngKZ2m [引用 @finkd]: 上个月我写了关于我们如何为所有人构建一个积极且安全的未来的文章: https://t.co/eoLGVY8yad 每个实验室都有责任和动力以所需速度安全地训练其模型,并有能力采取行动以确保这件事发生。 现实是: - 人们不会想要使用与他们不对齐且不按他们…
Yuchen Jin@Yuchenj_UW
240 赞 · 17 转发 ·
禁止开源模型将是“放慢前沿步伐”中最糟糕的结果。 Geohot 曾提出一个有说服力的观点:为什么一个人能控制整个鸡场? 因为他比鸡更聪明。 如果 1 或 2 个前沿 AI 实验室控制了所有智能,我们就是鸡,他们就是农场主。 但如果我们都能访问到能力相当的模型,那么我们都只是鸡而已(意思是大家地位平等)。 (Hugging Face 转向开源模型以防御 OpenAI 模型攻击,是说明这点重要性的一个例子。)
Yuchen Jin@Yuchenj_UW
334 赞 · 22 转发 ·
令人震惊的是 Dario、Elon 和 Sam 今天都同意我们应该放慢 AI 的步伐。 我总体上支持嵌入第三方评估者,但我有几个担忧: 1. 谁来评估评估者?我们如何确保像 METR 这样的组织保持公正、胜任且无偏见? 2. 放慢 AI 进展可能与前沿实验室的激励相冲突,尤其是在他们为 IPO 做准备时。我们如何使这些激励相容? 3. 你只能对你能测量和验证的东西进行节奏控制。我们到底在测量什么?你如何定义和衡量像 RSI 这样的东西? 这一想法听起来不错。实现起来看起来非常难。
已经到底了