构建BONAFIDE基准证明主流CoT忠实性指标基本无效
Yoav Gur-Arieh, Ana Marasović, Mor Geva
2026-05-26
CoT忠实性
元评估
可解释性
基准测试
大语言模型
COTRACE目标级归因框架,量化并暴露人机协作中AI对目标塑造的贡献
Eunsu Kim, Jessica R. Mindel, Kyungjin Kim, Sherry Tongshuang Wu
2026-05-22
LLM-as-judge
交互设计
人机协作
可解释性
目标塑造
CNA:仅干预 0.1% MLP 神经元,将指令模型拒绝率降低超 50% 且保质量
Sam Herring, Jake Naviasky, Karan Malhotra
2026-05-19
AI 安全
可解释性
大语言模型
对齐
机制解释
理论上证明激活引导把残差流推到任何提示都不可达的状态。
Aayush Mishra, Daniel Khashabi, Anqi Liu
2026-05-18
AI 安全
可解释性
满射性
激活引导
白盒/黑盒
SAE约束CLIP微调,仅在语义特征空间内做特征重加权
Fabian Morelli, Arnas Uselis, Ankit Sonthalia, Seong Joon Oh
2026-05-18
CLIP
分布偏移
可解释性
稀疏自编码器
鲁棒微调
DLR通过离散潜在码引导残差流,在低数据下单阶段超越SFT。
Fangyuan Yu, Xin Su, Amir Abdullah
2026-05-15
可解释性
大语言模型后训练
层级强化学习
残差流引导
离散潜在表示
在 LLM 隐藏层发现的微观-宏观社会粒度轴:对齐 PC1、跨模型可迁移、可因果引导。
Chonghan Qin, Xiachong Feng, Ziyun Song, Xiaocheng Feng, Jing Xiong, Lingpeng Kong
2026-05-08
可解释性
多智能体仿真
潜在方向
激活引导
表征工程
用多模态 CNN 从服饰图像中恢复并公开可追溯到具体时装屋的编辑身份信息
Morayo Danielle Adeyemi, Ryan A. Rossi, Franck Dernoncourt
2026-04-30
可解释性
多模态CNN
文化身份识别
时尚AI
视觉通道分析
用TAS辩证推理抑制多智能体LLM的角色归因偏差(AOA)
Bobo Li, Rui Wu, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu
2026-04-28
RLHF/RL对齐
可解释性
多智能体系统
推理
认知偏差
把工业维护问答重构为具身决策问题,用FMEA知识图+传感器仿真器+溯源验证,让LLM回答从'流畅文本'变成'可审计、可证伪'的运维建议
Chathurangi Shyalika, Dhaval Patel, Amit Sheth
2026-04-28
FMEA知识图谱
具身问答
反事实推理
可解释性
工业维护
CREDENCE:把概念层不确定性拆成认知(集成分歧)与偶然(监督歧义头),变成可执行路由决策。
Tanmoy Mukherjee, Thomas Bailleux, Pierre Marquis, Zied Bouraoui
2026-04-28
NLP分类
不确定性量化
信度集
可解释性
概念瓶颈模型
利用 LLM 内部中间层「安全神经元」替代端层表征,构建仅需 14M 参数的即插即用安全护栏
Difan Jiao, Yilun Liu, Ye Yuan, Zhenwei Tang, Linfeng Du, Haolun Wu, Ashton Anderson
2026-04-27
LLM安全
内容审核
可解释性
表征工程
轻量分类器
揭示 LLM 数字表征的"频谱 vs 几何"两级收敛分离,证明 Fourier 尖峰普遍但模运算可分性苛刻
Deqing Fu, Tianyi Zhou, Mikhail Belkin, Vatsal Sharan, Robin Jia
2026-04-23
Fourier 分析
LLM
可解释性
数字表征
机制可解释性
用大模型内部高影响神经元的激活图为目标任务挑预训练数据,免训练且可解释
Zijun Wang, Haoqin Tu, Weidong Zhou, Yiyang Zhou, Xiaohuan Zhou, Bingni...
2026-04-22
可解释性
目标导向
神经元分析
语言模型
预训练数据选择
用对比式LRP归因分析LLM在长上下文基准上的真实失败。
Rongyuan Tan, Jue Zhang, Zhuozhao Li, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang
2026-04-22
LLM失败诊断
Layer-wise Relevance Propagation
Olmo-3
Qwen3
可解释性
构建可控多模态乘法基准,用算术负荷C与强迫续写探针揭示多模态LLM的乘法失误源于计算而非感知。
Samuel G. Balter, Ethan Jerzak, Connor T. Jerzak
2026-04-21
可解释性
启发式策略
基准评测
多模态大模型
算术推理
系统量化10个全模态大模型的模态偏好,发现多数模型呈现视觉偏好而非传统VLM的文本主导,且偏好信号在中后层涌现并可有效诊断跨模态幻觉
Xinru Yan, Boxi Cao, Yaojie Lu, Hongyu Lin, Weixiang Zhou, Le Sun, Xianpei Han
2026-04-21
全模态大模型
可解释性
机制分析
模态偏好
线性探针
用Shesha几何稳定性指标分别预测steering成败与漂移
Prashant C. Raju
2026-04-21
RDM
Representation Engineering
可解释性
漂移检测
激活steering
Olmo 3 三系谱追踪揭示多样性崩塌由训练数据驱动而非算法本身
Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras
2026-04-20
CoT 蒸馏
LLM 后训练
偏好优化
可解释性
推理时缩放
用LLM自身调用日志训练轻量替代模型,按一致性门槛自动路由降本。
Adam Rida
2026-04-17
LLM路由
可解释性
学习-转交
成本优化
持续学习