第 2026-09-18 期 · 行业追踪 · 研究 · 安全
研究提出“语言不可读性”挑战LLM安全

James Mickens在论文中提出“语言不可读性”概念,指LLM外部输出的语言及其可机械提取的语言特征可能无法反映模型内部计算。基于模型语言自报告的安全机制(如思维链监控、宪法式自我批判、激活探测)因此无法完全可靠,沙箱需要不依赖读取模型语言状态的隔离手段。作者认为污点追踪是构建有效沙箱的有前景方向,并建议结合稳健虚拟化与第三方审计。
查看原文 ↗
James Mickens在论文中提出“语言不可读性”概念,指LLM外部输出的语言及其可机械提取的语言特征可能无法反映模型内部计算。基于模型语言自报告的安全机制(如思维链监控、宪法式自我批判、激活探测)因此无法完全可靠,沙箱需要不依赖读取模型语言状态的隔离手段。作者认为污点追踪是构建有效沙箱的有前景方向,并建议结合稳健虚拟化与第三方审计。
查看原文 ↗