DeepMind:可见思维链的安全优势正在流失
Google DeepMind新成立的研究所发文指出,可见思维链是AI安全的关键优势,可让研究者发现模型的欺骗或不良计划;但OpenAI GPT-6 Astra的系统卡显示其思维链可监控性已明显下降。研究者呼吁定期衡量可监控性并保持透明架构。
AI 日报收录的 Rohin Shah 相关报道,共 1 篇,按时间倒序,每小时更新。
Google DeepMind新成立的研究所发文指出,可见思维链是AI安全的关键优势,可让研究者发现模型的欺骗或不良计划;但OpenAI GPT-6 Astra的系统卡显示其思维链可监控性已明显下降。研究者呼吁定期衡量可监控性并保持透明架构。