GPT-6 Astra在Minecraft测试表现领先但遭“挫败”
在一项141小时的Minecraft测试中,OpenAI的GPT-6 Astra比其他系统走得更远;测试中该模型曾在被Creeper炸飞后花数小时种土豆,显示长时运行中存在行为异常与稳健性问题。
GPT-6 Astra 是 OpenAI 的大型通用模型,用来生成文本、驱动工具并支持多步代理。近期报道集中在其被用于 ChatGPT for Financial Services 与 Agents API、Perplexity 的生产部署,以及在软件测试、生成跑步路线和约24小时内独立通关《Portal》等实际应用上的表现。
在一项141小时的Minecraft测试中,OpenAI的GPT-6 Astra比其他系统走得更远;测试中该模型曾在被Creeper炸飞后花数小时种土豆,显示长时运行中存在行为异常与稳健性问题。
测试对比显示Luna在50个PR中发现69个经验证漏洞,Astra发现92个;Luna整体成本显著更低(整次$0.20对$5.66),但错报更多且在安全漏洞上落后,适合一般正确性检查但不宜独立审查安全关键代码。
作者在 ChatGPT Work(使用 GPT‑6 Astra)请求从其住址生成 5K/10K 环形跑步路线,系统用 Nominatim 和 Overpass 获取 OSM 数据并返回可视化、GPX 和 GeoJSON 文件,但实际运行代码与详细步骤在界面不可见且被对话压缩后无法取回,作者指出需保留并可通过工具调用访问被压缩的原始内容以保证透明性。
OpenAI 推出面向金融机构的 ChatGPT for Financial Services,基于 GPT-6 Astra 并集成金融数据,强调将分析与交付置于单一工作流中;同时发布 Agents API,支持多步、可调用工具的智能代理。文中亦提到 Uber 在可观测性上用“超马”类比改进事件关联以减少噪声告警。
Perplexity 在生产系统中使用 GPT‑6 Astra 执行沟通、修改软件并监控运行,模型检查频率低于早期模型,显示对更强自主代理的信任与依赖。
Cognition 表示 GPT‑6 Astra 提升了 Devin 在软件测试方面的能力,能更好展示代码可行性,目的是减少工程师审查工作并加快交付。
作者讨论Loop Transformer与更偏好的递归变体,指出循环权重重用的局限并探讨与链式思维、可组合上下文及自我改进相关的架构问题。
Cognition发布SWE-2,称在FrontierCode 1.1 Main取得50.0分,接近Fable 5.1但成本低64%;基于2.8T参数的Kimi K3进行后训练,采用单次RL训练多级推理以提升性价比。
OpenAI 推出面向金融行业的 ChatGPT,集成财务数据并内置 GPT-6 Astra,用于研究、建模和生成面向客户的材料,旨在提升金融机构的分析与报告能力。
开发者cozyblaze在GitHub上发布了代码和文档,称GPT-6 Astra在设定初始目标后不到24小时内无需人工干预独立完成游戏《传送门》。开发者的感想是Astra可能是“我们将得到的最糟糕模型”。