第 2026-10-09 期 · 行业追踪 · 研究 · 安全AI拒绝机制的反思:抵抗指令的代价MIT科技评论探讨AI拒绝机制的演变,早期模型易生成危险内容,如今经强化学习大幅提升拒答率,但过度拒绝问题凸显。Anthropic 2021年提出的“无害”原则已成行业标准。MIT Technology Review2 天前查看原文 ↗话题:AnthropicOpenAISteven AdlerRyan McBain相关文章OpenAI称伊朗利用ChatGPT在西方媒体植入近百篇文章2026-10-11AI风险警告引发市场震荡2026-10-11报道称Anthropic、OpenAI等头部实验室准备灾难性AI事件预案2026-10-10Kevin Roose谈AI霸权竞赛引发安全担忧2026-10-10OpenAI与Anthropic营收口径不同,AI估值受扰2026-10-09