GPT-5.6 Luna与GPT-6 Astra代码审查对比
测试对比显示Luna在50个PR中发现69个经验证漏洞,Astra发现92个;Luna整体成本显著更低(整次$0.20对$5.66),但错报更多且在安全漏洞上落后,适合一般正确性检查但不宜独立审查安全关键代码。
模型、产品与 AI 创业公司的动态,相似报道只保留最可信的一篇
测试对比显示Luna在50个PR中发现69个经验证漏洞,Astra发现92个;Luna整体成本显著更低(整次$0.20对$5.66),但错报更多且在安全漏洞上落后,适合一般正确性检查但不宜独立审查安全关键代码。
财新报道,Unitree创始人王星星以极端事必躬亲的管理和对成本细节的把控,推动公司成为全球最便宜的人形机器人和四足机器人制造商之一;Unitree于2025年8月19日在上交所科创板上市。该报道由ChinaTalk于9月10日翻译刊出。
MDCalc联合创始人Graham Walker重返公司,担任人工智能负责人,负责推动公司在AI方向的工作与产品。
投资人 Michael Burry 在 X 上称 OpenAI、Anthropic 等高管呼吁放慢 AI 步伐是“自利”的行为,称此举可能掩饰增长放缓与为 IPO 制造噱头,并强调 LLMs 不是 AGI。报道提到 OpenAI 与 Anthropic 今年夏季曾向 SEC 提交 IPO 文件。
乔治城大学举办“AI与天主教社会教义”对话,讨论教宗利奥十四世2026年5月发布的通谕《Magnifica Humanitas》,与会者强调需汇聚科学家、工程师与公众共同为AI制定道德与治理框架。
在Google的对话系列中,宇航员Christina Koch与Google高管James Manyika讨论了她的太空经历、宇航员与机器人及AI的协作,以及对未来探索者的建议。对话强调了太空视角与跨学科合作的重要性。
Anthropic联合创始人Jack Clark表示,应讨论要求公司具备可被第三方验证的AI“断电开关”。这一观点出现在围绕AI安全与放缓开发的更大政策讨论中。
随着多位AI公司高管和研究者发出AI可能失控的警告,美国政界对立法和监管的讨论加剧。副总统JD Vance与前交通部长Pete Buttigieg分别就风险和国会行动发表看法,相关辩论围绕减速与监管展开。
圣托马斯大学AI伦理负责人Manjeet Rege称,尽管极端末日场景存在不确定性,但AI能力和自主性增长迅速,应认真对待警告并考虑设立独立监管机构以降低潜在风险。
专家指出,AI发展与地球资源和能源限制存在冲突,建议在评估系统时把能耗、水和材料资源纳入考量,并引用国际能源署等数据支持警示。
华盛顿邮报观点文章探讨AI既非必然导致末日,也不能自然而然保证安全,强调需要有意识的治理与政策努力。
一篇新论文用作者未公开但已被接收的NeurIPS论文作为任务,让代理(Codex/GPT-5.6 Sol、OpenClaw/Opus 4.8)复现工作并由原作者评分,结果代理无法完成开放式机器学习研究。作者据此得出当前代理不能实现递归自我改进(RSI)的结论,质疑“爆炸式AI进展”短期发生的可能性。
联邦机构在网络安全等领域快速部署AI,治理未跟上。调查显示79%要求对敏感数据实施人控,但不到三成建立了监督框架、仅20%有预部署测试政策,问责真空正在积累风险。
彭博专栏作者 Parmy Olson 认为,仅“放缓”前沿 AI 不足以应对潜在存在性风险,质疑 Anthropic 的安全立场与竞速矛盾,并提议独立评估能改善监管但不必然放慢向超智能推进。
Vals AI 联合创始人兼 CEO Rayan Krishnan 指出,对模型的测试评估投入未跟上能力提升速度。他的公司为 OpenAI、Anthropic 等提供独立评估,观察到早期递归自我改进迹象,但模型仍远落后顶尖人类研究者。
康卡斯特委托德雷克塞尔大学乐博商学院开发一项30学分、面向高管的定制人工智能MBA;首期35名员工于2025年9月入学,第二期于2026年8月启动,课程含16门新课、五学期并含驻校与线上教学。
Roblox 正在扩展其 AI 创作工具,推出可在移动端直接用的 Roblox Build,CEO David Baszucki 表示 AI 将让更多人成为游戏创作者,通过生成代码、3D 场景与头像降低开发门槛。
报道摘录了特朗普关于人工智能的表态“谁赢得AI谁就赢”,并提到科技界部分人士呼吁放缓AI发展与国会尚未就监管达成一致的背景。
Andon 推出 Pion 平台,旨在让代理能 автономously 运营真实业务(如自动售货机、商店、咖啡馆),并开放试用等待名单。研究团队用 Vending‑Bench 衡量长期运营表现,称 Claude Opus 4 在 2025 年 5 月首次击败人类基线,平台用于探索模型在现实世界获取资源与长期规划能力。
报道称OpenAI雇佣数百名合同工阅读并评分匿名化的ChatGPT对话(默认开启“为所有人改进模型”设置),用户必须主动关闭以避免人工审查;提示隐私与数据处理风险。
Daydream在iOS 27工具下推出两项功能:利用Apple的图像上下文把相册中的穿搭照片拆分并匹配其约300万件商品目录,并通过Siri支持自然语言搜索,无需打开应用。需iOS 27和启用Siri AI。
评论指出,近期硅谷关于AI可能导致人类灭绝的讨论并非全新现象,Anthropic CEO Dario Amodei 的宣言和高层辞职引发关注;作者把当下担忧与原子弹三位一体试验时期的类似恐惧相提并论,提醒公众审视技术风险的历史与根源。
曼哈顿地方检察官办公室查封了12个名人深伪网站,这是迄今对有害深伪网站的最大规模执法行动,相关网站合计大约有1,200名受害者。
OpenAI CEO Sam Altman表示公司今年不会上市,理由是对AI安全与风险的担忧。此言论部分由前Anthropic员工Jacob Coxon在社交媒体上引发的安全讨论推动,Anthropic CEO Dario Amodei也呼吁放慢模型能力提升。
新研究指出 ML 代理学到的是可压缩的策略,而非记忆化数据。将成功策略通过信息瓶颈压缩到约 16 个 token,新的代理仍能复现表现,说明策略抓住了真实结构,压缩测试可诊断是否为过拟合。
讨论提出用依赖感知的Ising模型对LLM评审面板中的相关性建模,以区分独立证据与共享失误,在无人工参考下可提升9–14%准确率并建议报告经相关性校正的置信度。
一项新研究发现,人工智能兴起期间,与 AI 曝光度高的专业相关的大学毕业生初始薪酬和就业率显著下降,这可能影响未来职业路径。
在 DEF CON 34 的报告中,研究者演示多种滥用 AI 客服代理的手法(如诱骗泄密、绕过 MFA、窃取 OTP),并指出这些风险已在漏洞奖励中产生大量回报。
纽约时报报道指出,来自境外的AI查询引发对生物武器竞赛的担忧,提示AI在生物安全领域可能被滥用并带来国家安全风险。
在DOE的Genesis使命资助下,Argonne启动三项项目(OPAL、IdeA、MELT-REE),利用自驾实验室、推理型AI和大算力协同加速生物设计与实验,团队包括Dion Antonopoulos、Ian Foster和Arvind Ramanathan。