第 2026-10-02 期 · 行业追踪 · 研究 · 产品OpenAI决策API置信度不可靠测试显示OpenAI新Decisions API背后的GPT-6 Luna模型置信度严重失准:在3600道推理题中,其声称99%确信时实际正确率仅68%,凸显AI置信度校准问题。Hacker News7 天前查看原文 ↗话题:OpenAIGPT-6 LunaDecisions APIJevKevLaya相关文章OpenAI推出Decisions API,被视为Jev克隆2026-09-30jevals:用类型化Jev决策替代LLM评判的评估工具2026-09-21开发者称其一年前的非自回归决策模型被前沿实验室称为突破2026-09-19AI决策模型玩Pac-Man:jev 1.13得分最高2026-10-08Musubi发布开源轻量决策模型PolicyLM-1.7B2026-10-06