LlamaGuard-3

1 篇报道

AI 日报收录的 LlamaGuard-3 相关报道,共 1 篇,按时间倒序,每小时更新。

相关话题

研究:边界感知自蒸馏改进安全拒绝

Hugging Face 发布论文《Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal》,指出现有安全工作以主题为单位拒绝请求会误伤安全子集,举例 LlamaGuard-3、基准 XSTest 与 OR-Bench 的相关失败模式。论文在政治提示构成的主题宇宙中形式化了“目标有害子集”与应答/拒绝边界,研究如何训练与衡量模型以在话题内精确拒绝有害子集而非整个话题。

Hugging Face Blog · · 详情
已经到底了