第 2026-10-09 期 · 行业追踪 · 研究 · 安全

AI拒绝机制的反思:抵抗指令的代价

AI拒绝机制的反思:抵抗指令的代价

MIT科技评论探讨AI拒绝机制的演变,早期模型易生成危险内容,如今经强化学习大幅提升拒答率,但过度拒绝问题凸显。Anthropic 2021年提出的“无害”原则已成行业标准。

MIT Technology Review2 天前
查看原文 ↗