横跨9个维度系统梳理基础模型可靠性与责任感的研究全景图
Xinyu Yang, Junlin Han, Rishi Bommasani, Jinqi Luo, Wenjie Qu, Wangchunshu...
2026-02-10
公平性
可解释性
可靠性
基础模型
安全性
用扩散模型学习LLM激活分布,作为先验提升引导干预和可解释性
Grace Luo, Jiahai Feng, Trevor Darrell, Alec Radford, Jacob Steinhardt
2026-02-09
元学习
可解释性
大语言模型
扩散模型
激活建模
提出Data2Behavior任务和MDF方法,在微调前预测训练数据可能诱导的意外偏差和安全风险
Mengru Wang, Zhenqian Xu, Junfeng Fang, Yunzhi Yao, Shumin Deng, Huajun...
2026-02-05
LLM安全
可解释性
数据质量评估
模型偏差
训练数据审计
LLMs的CoT推理是近视的增量转换,而非全局规划
Liyan Xu, Mo Yu, Fandong Meng, Jie Zhou
2026-02-04
LLM推理
不确定性估计
可解释性
思维链
隐藏状态
揭示指令令牌作为模态仲裁结构锚点,浅层缓冲深层仲裁的稀疏头机制
Yu Zhang, Mufan Xu, Xuefeng Bai, Kehai chen, Pengfei Zhang, Yang Xiang, Min Zhang
2026-02-04
可解释性
因果分析
多模态大语言模型
模态遵循
注意力机制
将FFN解耦为无上下文的token级神经检索记忆,提升可解释性并支持预计算卸载
Ajay Jaiswal, Lauren Hannah, Han-Byul Kim, Duc Hoang, Arnav Kundu, Mehrdad...
2026-02-04
Transformer架构
可解释性
模型压缩
模型效率
神经记忆网络
发现LLM隐藏状态中存在稀疏的奖励相关神经元子系统
Guowei Xu, Mert Yuksekgonul, James Zou
2026-02-03
可解释性
奖励建模
强化学习
推理机制
神经元分析
将权重微调、LoRA 和激活引导统一为动态权重更新,揭示偏好-效用权衡规律
Ziwen Xu, Chenyan Wu, Hengyu Sun, Haiwen Hong, Mengru Wang, Yunzhi Yao,...
2026-02-03
参数高效微调
可解释性
模型控制
激活引导
表示流形
RLVR优化的推理模型作为嵌入模型骨干时并无优势,但对比学习可对齐两者
Wun Yu Chan, Shaojin Chen, Huihao Jing, Kwun Hang Lau, Elton Chun-Chai Li,...
2026-02-02
可解释性
强化学习
推理模型
文本嵌入
表征学习
用影响函数追踪 LLM 可解释单元到训练样本的因果起源
Jianhui Chen, Yuzhang Luo, Liangming Pan
2026-01-30
上下文学习
可解释性
归纳头
影响函数
训练数据归因
语言模型的线性表征(如事实性维度)会随对话动态翻转,对可解释性构成挑战
Andrew Kyle Lampinen, Yuxuan Li, Eghbal Hosseini, Sangnie Bhardwaj, Murray Shanahan
2026-01-29
上下文学习
可解释性
表征动力学
表示学习
语言模型
Persona Prompting 在仇恨言论检测中提升分类但损害解释质量,且无法真正对齐真实人群
Jing Yang, Moritz Hechtbauer, Elisabeth Khalilov, Evelyn Luise Brinkmann,...
2026-01-29
LLM偏见
人格模拟
仇恨言论检测
可解释性
社会推理
通过选择性旋转判别层并保持激活范数,实现5.5倍攻击成功率提升且零能力退化
Quy-Anh Dang, Chris Ngo
2026-01-28
可解释性
对抗攻击
推理时干预
模型安全
激活引导
提出HTC框架,通过轨迹级特征实现AI Agent置信度的准确校准
Jiaxin Zhang, Caiming Xiong, Chien-Sheng Wu
2026-01-23
不确定性量化
可解释性
智能体
置信度校准
提出因果框架LIBERTy,用结构反事实评估LLM概念解释方法的忠实性
Gilat Toker, Nitay Calderon, Ohad Amosy, Roi Reichart
2026-01-21
LLM评估
反事实
可解释性
因果推理
概念解释
发现模型激活空间中的「助手轴线」,用于监测和稳定模型人格漂移
Christina Lu, Jack Gallagher, Jonathan Michala, Kyle Fish, Jack Lindsey
2026-01-20
人格向量
可解释性
模型安全
激活引导
角色扮演
推理模型通过模拟多视角对话实现深度思考,本质是'思维社会'的涌现
Junsol Kim, Shiyang Lai, Nino Scherrer, Blaise Agüera y Arcas, James Evans
2026-01-19
LLM推理
可解释性
多智能体
强化学习
认知科学
提出Shesha指标揭示表征稳定性与相似性独立,发现DINOv2存在"几何税"
Prashant C. Raju
2026-01-15
可解释性
模型评估
神经科学
表征学习
计算机视觉
SPINAL诊断框架揭示DPO对齐集中于Transformer终端层。
Arion Das, Partha Pratim Saha, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das
2026-01-13
DPO
信息几何
几何诊断
可解释性
模型对齐
通过降维可视化VLM视觉嵌入空间,聚类定位性能瓶颈并针对性增强训练数据
Ignacio de Rodrigo, Alvaro J. Lopez-Lopez, Jaime Boal
2026-01-09
可解释性
嵌入空间分析
数据增强
文档理解
视觉语言模型