找到 101 条结果

推理模型几乎无法控制自己的思维链内容,这对 CoT 监控安全性是个好消息。

Chen Yueh-Han, Robert McCarthy, Bruce W. Lee, He He, Ian Kivlichan, Bowen... 2026-03-09
AI安全 可解释性 对齐评估 思维链监控 推理模型

发现音频扩散模型存在语义瓶颈层,局部激活转向实现最优音乐概念控制

Łukasz Staniszewski, Katarzyna Zaleska, Mateusz Modrzejewski, Kamil Deja 2026-02-16
可解释性 扩散模型 激活转向 音乐控制 音频生成

整合安全评估与内部诊断的开源工具包,实现从黑盒测试到白盒洞察的范式转变

Bo Zhang, Jiaxuan Guo, Lijun Li, Dongrui Liu, Sujin Chen, Guanxu Chen,... 2026-02-13
前沿AI风险 可解释性 多模态 大模型安全 安全评估