找到 101 条结果

理论上证明激活引导把残差流推到任何提示都不可达的状态。

Aayush Mishra, Daniel Khashabi, Anqi Liu 2026-05-18
AI 安全 可解释性 满射性 激活引导 白盒/黑盒

用大模型内部高影响神经元的激活图为目标任务挑预训练数据,免训练且可解释

Zijun Wang, Haoqin Tu, Weidong Zhou, Yiyang Zhou, Xiaohuan Zhou, Bingni... 2026-04-22
可解释性 目标导向 神经元分析 语言模型 预训练数据选择

系统量化10个全模态大模型的模态偏好,发现多数模型呈现视觉偏好而非传统VLM的文本主导,且偏好信号在中后层涌现并可有效诊断跨模态幻觉

Xinru Yan, Boxi Cao, Yaojie Lu, Hongyu Lin, Weixiang Zhou, Le Sun, Xianpei Han 2026-04-21
全模态大模型 可解释性 机制分析 模态偏好 线性探针