第 2026-09-09 期 · 行业追踪 · 研究 · 安全

研究:边界感知自蒸馏改进安全拒绝

Hugging Face 发布论文《Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal》,指出现有安全工作以主题为单位拒绝请求会误伤安全子集,举例 LlamaGuard-3、基准 XSTest 与 OR-Bench 的相关失败模式。论文在政治提示构成的主题宇宙中形式化了“目标有害子集”与应答/拒绝边界,研究如何训练与衡量模型以在话题内精确拒绝有害子集而非整个话题。

Hugging Face Blog40 小时前
查看原文 ↗