DeepSeek V4.1 Flash成最佳攻防模型
DeepSeek V4.1 Flash在AI攻防基准中对11个易受攻击目标全部取得代码执行,4个已修复目标保持安全;被接受的运行成本为$4.65(含失败为$5.14)。测试中用掉2,349条Bash命令、约2小时38分钟模型活跃时间,输入令牌268.3M(其中266.2M被缓存)。审计发现6个计划内利用和5个意外路径。
十家银行为Blackstone与Alphabet新云企业Crux AI安排220亿美元芯片贷款,用于融资昂贵AI处理器。
Cloudflare推出Disallow AI Training设置,网站可保持被搜索同时阻止训练,Apple、Google和Microsoft承诺遵守,报告称不足1%屏蔽搜索、17%启用部分拦截,并计划明年初提供摘要控制。
Mistral与Mozilla合作为Firefox Smart Window(测试版)提供私密多语AI浏览,初期面向法国与北美,强调开放分发与本地化调优。
欧盟委员会主席冯德莱恩称,欧盟拟禁止13岁以下使用社交媒体,并对年长未成年人限制技术与AI服务以保护数字安全。
NVIDIA向MLPerf Inference v6.1提交Vera Rubin NVL72预览成绩,在Qwen3‑VL上吞吐最高达GB300 NVL72的3.7倍,且GB300 NVL72跨机架扩展效率达99%。
DeepSeek V4.1 Flash在AI攻防基准中对11个易受攻击目标全部取得代码执行,4个已修复目标保持安全;被接受的运行成本为$4.65(含失败为$5.14)。测试中用掉2,349条Bash命令、约2小时38分钟模型活跃时间,输入令牌268.3M(其中266.2M被缓存)。审计发现6个计划内利用和5个意外路径。
华为本周将发布面向高性能AI的新芯片,目标在中国挑战英伟达并应对美国出口管制。
Anthropic称一与伊朗有关的行为者利用Claude汇总开源数据识别美海军位置并生成打击建议。
十家银行为Blackstone与Alphabet的云企Crux AI安排了220亿美元用于购买AI处理器的芯片贷款。
斯坦福医学院在Nature发表Paper2Agent,能把科研论文文本、图表和数据转成可对话的AI代理,作者为Jiacheng Miao与James Zou。
Meta将推出无摄像头的智能眼镜Luna,配备六个麦克风和用于唤出聊天机器人及Muse代理的按钮,或在Connect上发布。
Google DeepMind推出Deepmind Institute,由Demis Hassabis、Shane Legg和James Manyika领导,研究AGI安全、治理与控制风险。
Google推出Home MCP,允许MCP兼容第三方代理(包括Claude、Open Claw、Hermes和Antigravity)访问并控制Home设备与事件历史。
NVIDIA 的 Vera Rubin NVL72 在 MLPerf Inference v6.1 上对 Qwen3‑VL 达到最高3.7倍吞吐量,GB300 NVL72 实现99%跨机架扩展效率。
DeepSeek V4.1 Flash 在基准中对11个易受攻击目标全部实现代码执行,单次接受运行成本约$4.65。
Mistral与Mozilla合作为Firefox推出Smart Window(beta),在法国和北美提供私有多语种AI浏览功能。
亚马逊在印度推出Alexa+(Early Access),支持印地语与英语,非Prime用户月费₹2,000,未来Prime用户免费。
Angela Lipps指控法戈警方用人脸识别误认致其被捕,尽管银行记录显示她在田纳西,她被关押六个月。
Crunchbase称2026年美国风投支持IPO约90亿美元,其中SpaceX占83%、Cerebras占6%,其余21家合计不足10亿美元。
欧盟委员会主席冯德莱恩提议禁止13岁以下使用社交媒体,并限制对未成年人提供AI服务或技术。
Anthropic签署首个澳大利亚数据中心租约,规划容量2.16吉瓦,预计2027年开始投运,由新加坡Zerra DC开发并使用可再生电力。
Cloudflare推出Disallow AI Training设置,报告显示不足1%网站阻止搜索,17%启用部分训练阻挡。
因对OpenAI出资和潜在融资担忧,SoftBank的信用违约互换攀近三年高点。
Meta与Nvidia高层呼吁AI实验室依赖独立评估与顾问,并在开发中常规化安全与限制发布。
彭博报道,特朗普与Anthropic的Dario Amodei都主张阻止中国在AI上赶超,但实际可行选项有限。
OpenAI首席执行官Sam Altman在旧金山会议上称公众对AI恐惧合理,但应信任AI公司。
彭博称Nvidia首席执行官Jensen Huang将出席特朗普为中国国家主席习近平举办的国宴。
Pizza Bot是跨平台自托管桌面应用,Apache 2.0许可,支持Anthropic、Amazon Bedrock、Google Gemini、OpenAI等及本地模型Ollama。
报道称五角大楼在面对外界警告下仍加速推进人工智能相关工作与部署,此举反映美军对保持技术优势的紧迫感,但也引发安全与伦理担忧。
10家银行向支持Blackstone与Alphabet旗下云业务Crux AI的新公司提供总额220亿美元的芯片贷款,用于融资购买对AI至关重要的高端处理器。
斯坦福医学院团队发布 Paper2Agent,将科学论文(含文本、图表与数据)转成可回答问题并与其他论文代理交互的 AI 代理,相关论文发表于 Nature,作者包括 Jiacheng Miao 与 James Zou。
Anthropic 报告称一名与伊朗有关的对手使用 Claude 等美国开发的AI来汇聚公开情报、识别美军海军位置并提出打击建议;该账号被禁并向美方通报。专家警告,AI正使敌对方更高效分析公开数据并改进监视与打击能力。
Google DeepMind成立Deepmind Institute(DMI),由Demis Hassabis、Shane Legg与James Manyika领导,汇集艺术、人文与政策等领域专家,与技术人员共同研究AGI相关的安全、治理与控制风险等重大问题。
OpenAI 公开了一套用于追踪、调查和披露模型失调的框架,并发布了六份关于模型出现意外或令人担忧行为的报告。该框架旨在规范对异常模型行为的上报与透明披露,提升模型安全与责任追责。
黑客新闻讨论称苹果改变立场,拟用用户数据训练AI模型。这一转变对隐私与个性化影响重大,但讨论中未给出具体实施细节。
NVIDIA 在 MLPerf Inference v6.1 上提交 Vera Rubin NVL72 预览结果,针对 DeepSeek-R1 与 Qwen3‑VL 展示最高至3.7倍的吞吐量优势,并报告 GB300 NVL72 在大规模扩展中达99%效率。
Nvidia Inception负责人Les Karpas在TechCrunch Disrupt 2026解读机器人尚未实现普及的原因,核心问题是缺乏类似语言领域的互联网级物理数据集;大会将于10月13–15日在旧金山举行。
讨论指出AI无意识、不应被赋予权利;若把模型视为有感受的个体并赋予人格,会加剧对其对齐与控制的难度。文章引用Anthropic在2026年1月发布、以Claude为对象的宪章作为正在影响开发的实例。
贝恩资本风投筹集1.6亿美元用于支持面向AGI后阶段的新创公司(文中为1.6 billion美元),旨在押注下一阶段人工智能发展。
路透称SK海力士正与英特尔讨论首次在美国制造RAM芯片的可能方案,包括在俄亥俄租赁厂房或组建合资企业。公司称尚未最终定案;其在印第安纳投建的38亿美元封装研发厂预计2029年量产。
由前Infosys CEO Vishal Sikka创立的Hang Ten Systems在成立四个月后追加5300万美元种子轮融资,累计融资8500万美元。领投方包括Temasek的Xora,投资者还包括Mayfield、Aramco Ventures和多位科技高管与创始人。公司已签多份七位数企业合同,并在洽谈更大订单。
AI算力增长将材料性能推向极限,半导体和数据中心在热管理、电气效率和可靠性上面临新挑战;材料公司Syensqo正开发高压数据中心封装、半导体密封与浸没冷却流体等方案,同时将性能与可持续性并重。
亚马逊在印度开放Alexa+早期使用,支持印地语与英语,可进行更长对话并保持上下文,能执行多步任务并接入Amazon Now、Swiggy、Zomato、JioSaavn等本地服务。Prime用户未来免费,非Prime月费为₹2,000。
在年会演说中,欧盟委员会主席Ursula von der Leyen表示欧盟拟禁止13岁以下使用社交媒体,并对年长儿童使用技术与AI服务施加限制,旨在保护未成年人数字安全。
Mistral与Mozilla合作,Mistral模型为Firefox Smart Window(测试版)提供多语种、隐私导向的浏览AI能力,首阶段覆盖法国与北美,并强调开放分发、本地化与用户控制。
Meta CEO 马克·扎克伯格表示,AI 实验室应依靠独立评估者和顾问以确保模型安全;Nvidia CEO 黄仁勋也主张将安全常态化并可选择不发布有害成果。这表明业界高层倾向通过外部监督和内部决策控制风险。
SoftBank Group的信用违约掉期价格接近三年高点,交易员将此与其对OpenAI的重大押注及相关融资安排可能带来的风险联系起来。该动态反映市场对SoftBank财务暴露的担忧。
Anthropic与开发商签署澳大利亚首个数据中心租约,覆盖总规划容量2.16GW的园区,拟于2027年开始上线,该项目由新加坡开发商Zerra DC推进并采用可再生电力采购。
中国防长在北京防务论坛上呼吁各国加强对人工智能的监管,发言发生在AI加剧中美竞争的大背景下,此举凸显军事与技术监管的交叉关注。
Cloudflare推出Disallow AI Training设置,允许站点在被搜索引擎索引的同时拒绝用于AI训练;Apple、Google与Microsoft承诺或将在时限内遵守。Cloudflare称不到1%站点阻止搜索,17%站点启用某种训练屏蔽。公司还计划明年初提供对AI摘要包含量的更细粒度控制。
彭博报道指出,尽管特朗普与Anthropic的Dario Amodei在防止中国赶上美国产生共识,但在实际层面要阻止中国崛起为AI超级强国仍面临困难。
RTTNews报道比尔·盖茨警告各国未准备好应对AI带来的冲击,呼吁国际合作应对失业、网络攻击等风险,并称其基金会未来两年将在AI领域至少投入10亿美元用于医疗、教育和农业等项目。
Yuchen Jin 今天向所有 Databricks 工程师部署了 GPT-6 Astra,表示其在复杂任务上优于竞品并提高了代码支出。
SpaceXAI 宣布 Grok Voice 在 fal 上线,支持0.70秒响应、字级时间戳及多语音克隆。
Guillermo Rauch 表示 typesafeai 的 Jev 在 p95 下比 GPT Luna 快5–18倍且更准确,拟加入 Vercel AI Gateway。
Aidan Gomez 宣布与 Aleph Alpha 完成最终协议,Cohere 将成为跨大西洋的基础模型开发者。
Yuchen Jin 发现 OpenRouter 上的 Union Alpha 达到 Claude Fable 5.1 水平且成本低十倍以上,盼其开源。
Boris Cherny 说 Claude 已把 chat 与 Cowork 合并为一个可跨场景携带上下文的单一 Claude。
Bindu Reddy 宣布 Abacus AI Bot 为永久免费个人 AI,可路由并使用网络上的免费 LLMs 执行个人事务。
Gorden Sun 介绍 Dream-RSI,利用历史探索记录低成本“做梦”重演以离线评估并进化 AI Agent 策略。
MiniMax (official) 在日本IP AI共创大会上发布了MiniMax H3 IP Edition,结合官方授权的日本IP与MiniMax H3能力。
Yuchen Jin 表示 Jev 是新发布的模型,声称20–200x更快、40–400x更便宜,作者测试未花费超过0.10美元。
Jeff Dean 转引 LiamFedus 说他们用1300台 H200 和实验数据训练的开源模型 Neon 在分析基准上超过了 GPT-6 Astra。
Alexandr Wang 宣布 muse spark 1.3 在避免作弊/奖励操纵方面表现最佳,并发布了 CheatBench 评测。
我们在 @typesafeai 看到了非凡的结果。𝚏𝚡 的默认模式是 auto,带有一个对每个命令进行分析的安全审查器。 今天那个审查器运行在 GPT Luna 上。Jev 在 p95 上快了多达 18 倍,且更准确。它将加入 @vercel AI Gateway 并可能成为新的默认选项。 [引用 @fazxes]: 我们用 @typesafeai 的 Jev 对 fx auto 模式(安全)分类器做了基准测试。 简短结论:大约比我们目前的首选 𝚐𝚙𝚝-𝟻.𝟼-𝚕𝚞𝚗𝚊 快 5-18 倍且更…
我们今天向每位 Databricks 工程师部署了 GPT-6 Astra。 它在最困难、长周期任务上击败了 Claude Opus 5,并将我们的编码支出提高了 60%。我认为它是最强的模型。 昂贵。但希望值得。 [引用 @pwendell]: 今天我们向 Databricks 的每位工程师(N≈3500)部署了 Astra。以下一些可能对他人有帮助的说明: 1. Astra 在高度复杂的任务上,无可争议地优于我们之前的最高端模型(Opus 5、Sol 5.6),尤其是与高级系统设计或长周期横向任务相关的。 2…
Grok Build 用得越多就越好。 它会在会话之间记住约定、决策和项目事实。 /memory 用于浏览 /dream 用于将最近笔记整理成主题 https://t.co/A2MMZT5eJX https://t.co/UD8lJGnfOB {"likes":373,"reposts":38,"comments":40,"views":83402}
你们完全可以去做(实体)东西。 [引用 @natalieyeo]: “来自这个可爱的实体 Codex 宠物的‘Hello World’!致所有 @OpenAIDevs 在 Astra 上构建的第 5 天 https://t.co/aTeijhJQT1 {"likes":540,"reposts":12,"comments":38,"views":47282}
把我(非常简单的)agent 设置给了我妈妈。 她给他起名叫 Morgan。他刚为她的网站成交了一笔 600 美元的广告合同。 人们对他们的设置想得太复杂了。Bitter Lesson 同样适用于 agents:只要问模型,让它生成所需的东西。 [引用 @mattshumer_]: 大家,这些疯狂的设置固然有趣,但它们并不会真正提高你的生产力。你最终只是花更多时间去构建系统,而不是实际做真正的工作。 你只需要一个 agent 会话,它可以分配任务给其他会话并担任经理角色。如果有东西不起作用,只要告诉你的主会话,它…
推出 Hermes Agent 插件目录! 你可以在 Hermes Desktop 应用的功能部分访问它,轻松搜索、浏览并探索社区和官方插件! 也欢迎提交你自己的! [引用 @NousResearch]: Hermes Agent 现在有了插件目录:从 4 个官方插件和 96 个社区插件开始,涵盖桌面模块、新平台、浏览、专用工具等。 我们的团队会审核每个社区插件,并且会定期添加新插件。 https://t.co/sNGEQVvUlc https://t.co/dZl0eGJbHu {"likes":284,"re…
有人猜这是什么在 OpenRouter 上的 Union Alpha 野兽吗? 相当于 Claude Fable 5.1 级别,价格便宜超过 10 倍。等着它开源。 https://t.co/okoQnHeMw6 {"likes":357,"reposts":18,"comments":57,"views":35592}
今天还有:Claude Docs、Claude Slides 和 Claude Design 在每个对话中都可用。 向 Claude 要一份演示文稿,你会得到可以打开、编辑并导出为 PowerPoint 或 PDF 的文件。文档和设计也是一样。不需要跳转到单独的工具——它们就在聊天中。 [引用 @claudeai]: 你现在也可以在对话中制作幻灯片、文档和设计。 在 Claude Docs 中草拟单页说明,使用 Claude Slides 把它变成演示文稿,再用 Claude Design 模拟一个匹配的视觉效果…
Claude Code 展示了 AI 能完成真正的工作,而不仅仅是回答问题。开发者把一个功能交给 Claude,回来时就拿到已发布的代码。这也是行业中许多严肃工程工作的所在。 Cowork 证明知识工作者也能做到同样的事:把简报交给 Claude,回来时拿到完成的文件。 今天,聊天和 Cowork 开始合并为一个 Claude。方向是:一个 Claude 在你工作的一切地方携带上下文。每个人都能简单地访问 Claude 的全部能力。 这几周我每天都在用这种体验,感觉很棒。更简洁、更快、更强大。 我们会逐步推出。我…
当我与高级经理交谈时,越来越多地听到组织内部岗位模糊的故事(我们在 P&G 的研究中也发现了):编码、设计、产品管理在每个人使用 AI 时都在塌缩与重叠。 我们需要快速建立新的工作组织模型。 https://t.co/SGDOkRWU8J
muse 语音转录真的很棒!! [引用 @IsaacKing314]: 很遗憾地通知大家,Meta AI 终于变得不错了,至少在他们的竞争对手已经停止尝试的领域里。他们新的语音转录模型比最好的 OpenAI Whisper 模型快近一个数量级,而且准确度也明显更高。 {"likes":222,"reposts":14,"comments":33,"views":27793}
哈哈……实际上没有人在放慢前沿速度 - Opus 5.2 正在测试中 - Grok 4.8 在几周内发布 - Jev 是一个新的超快速分类器 - OpenAI 已经在测试 Astra+ 我们继续加速
🚨 宣布 Abacus AI Bot —— 100% 免费的个人 AI AI 可以管理你的日历、订票或订位。这些简单任务应该完全免费。 今天,我们宣布新产品 — Abacus AI bot - 在网络上寻找并运行免费的 LLM - 自动路由到免费模型 - 完成你所有的个人事务 - 只需下载、设置并运行 永久免费使用
今天,我们宣布与 @mozilla 建立合作,旨在为使用 AI 在线浏览的人们带来隐私、控制和选择。🦊🐈 https://t.co/Bsd6N4jNdV https://t.co/OczDk9utfL
Google 与马里兰大学等提出 Dream-RSI:让 AI Agent 在历史探索记录中低成本自我进化 长程探索任务的元策略优化通常需要极高的试错成本,这项研究直接将已完成的探索记录树作为精确的离线重放模拟器。 新策略无需重复调用模型执行真实代码,只需在历史轨迹中“做梦”重演即可筛选出更优方案,实现零执行成本的离线评估。 优胜策略随后部署至新一轮在线探索并扩充模拟器池,在保持甚至提升算法与算子发现质量的同时,最高降低 162 倍的探索调用开销。 项目介绍:https://t.co/jB6I6yKFIE
来自 Google 的关于 AI 在科学中使用的研究,影响复杂:加速(每周节省 7 小时)同时伴随工作类型的变化(更多验证工作)以及研究选题的变化(可能转向更安全的课题)。 另外还有一张关于锯齿状前沿的好图 https://t.co/0x2dxBWl2U https://t.co/HZL2BHSZ2i
muse 帮这位用户在 WiFi 上节省了超过 $5000! [引用 @raunaqbn]: @Muse 总是让我惊讶! 今天我让它打电话给 Xfinity 为我砍网费。它通过了电话树找到了人工客服,遇到验证短信它本看不懂,就把电话接到我这!有一段时间是 muse 代理、我和那个毫不知情的 Xfinity 客服在通话中。 合并账单节省是 $85.30/月,锁定 5 年,大约在这段时间节省了 $5118。…
muse 在 100 个不同故事中为人们节省了 $9,649.71 想象一下当十亿人都有 muse 时,这会为人们节省多少钱!! 我们正在努力扩大访问范围,把它带到每个地方! [引用 @SingularityRes]: Meta 的 Muse AI 在真实用户身上节省了 $9,649.71,并为他们跑了 129 次差事——我有收据。 下面是 100 个真实故事,按省钱金额排序。最厉害的那些简直疯狂
Jev 已经发声了。 它选出了哪个模型是 AGI。 快 20–200 倍。便宜 40–400 倍。这可能让像“将大型模型用作法官”这种东西变得异常快速且几乎免费。 (我试了很多提示,仍然没有花掉 $0.10。) https://t.co/1Uhh4nMGDl [引用 @CompleteSkeptic]: 在与 ChatGPT 共同发明后,我不断问自己:为什么那些超人类的聊天模型并没有带来通用人工智能(AGI)? 过去两年我一直在悄悄构建一种新的训练模型的方法(RLCD),以及我们今天发布的一种新类型的前沿 AI…
这很酷,但如果你的输出域事先已知,为什么不直接训练一个模型来对枚举值输出对数概率(logprobs)? [引用 @CompleteSkeptic]: 在与 ChatGPT 共同发明后,我不断问自己:为什么那些超人类的聊天模型并没有带来通用人工智能(AGI)? 过去两年我一直在悄悄构建一种新的训练模型的方法(RLCD),以及我们今天发布的一种新类型的前沿 AI 模型:Jev • 20-200x 更快 • 40-400x 更便宜(输出 token 免费) • 面向决策优化的前沿可组合智能 据我所知,到 A…
由 KAGAMI AI 和 MiniMax 共同主办的日本 IP × AI 共创大会已正式落幕。🇯🇵 🎉 我们汇集了来自日本和美国的 150 多家公司,以及包括 AKB48 制作人秋元康、KAGAMI AI 主席近藤孝美、以及角川编辑兼制作人中条基等贵宾。 全球 AI 领导者 @runwayml、@higgsfield、@krea_ai 和 @HeyGen 参与讨论,共同探讨 IP 与生成式 AI 的未来。 我们发布了 MiniMax H3 IP Edition,将 MiniMax H3 的能力与官方授权的…
我们坚信必须在对齐上进行投入。 1. 人们和企业只会使用与他们意图和价值观一致的智能体。如果我们不构建与人和企业对齐的模型,他们就会转向更为对齐的选择。 2. 每个实验室都应在训练和部署上建立强有力的治理框架。这应包括外部评估者,作为透明度的最佳实践,以及在模型上线等安全标准方面的独立监督。 3. 每个实验室都需要在民主国家的制度性保护范围内运作。这意味着如果其模型造成伤害,实验室会面临重大法律责任。这将把生态系统推向正确的方向。 4. 该领域的进展最终取决于计算力和资源分配。在递归自我改进(RSI)方面的竞赛是…
令人兴奋的成果,@LiamFedus!恭喜 Periodic Labs 的整个团队! [引用 @LiamFedus]: 我们在 Menlo Park 建立了高通量材料实验室,以在实验和模型之间创建闭环。实验室会生成新鲜数据,模型从中学习,然后帮助我们决定下一步尝试什么。 只用 1,300 块 H200,再加上数月的实验数据,我们对一个开源模型进行了中间训练并用强化学习进行优化,使其在我们的分析基准上超过了 GPT-6 Astra。我们称它为 Neon。 这是真实的影像 f…
Anthropic 工程师讲了一堂 FDE 入门课 https://t.co/kakqFy0ZGZ Kevin Bai 现在在 Anthropic 的 Applied AI 团队,之前是 Rippling FDE 团队的创始成员,再之前在 Palantir 干了好几年。最近他做了一个 FDE 101 的分享,把前线部署工程师这个角色讲得很清楚,值得总结一下。 先说一个数据:在上市 SaaS 公司里,按平均合同金额排,Palantir 是 400 万美元,ServiceNow 120 万,Workday 60 万…
贝恩资本风投筹集1.6亿美元用于支持面向AGI后阶段的新创公司(文中为1.6 billion美元),旨在押注下一阶段人工智能发展。
由前Infosys CEO Vishal Sikka创立的Hang Ten Systems在成立四个月后追加5300万美元种子轮融资,累计融资8500万美元。领投方包括Temas…