找到 101 条结果

横跨9个维度系统梳理基础模型可靠性与责任感的研究全景图

Xinyu Yang, Junlin Han, Rishi Bommasani, Jinqi Luo, Wenjie Qu, Wangchunshu... 2026-02-10
公平性 可解释性 可靠性 基础模型 安全性

用扩散模型学习LLM激活分布,作为先验提升引导干预和可解释性

Grace Luo, Jiahai Feng, Trevor Darrell, Alec Radford, Jacob Steinhardt 2026-02-09
元学习 可解释性 大语言模型 扩散模型 激活建模

揭示指令令牌作为模态仲裁结构锚点,浅层缓冲深层仲裁的稀疏头机制

Yu Zhang, Mufan Xu, Xuefeng Bai, Kehai chen, Pengfei Zhang, Yang Xiang, Min Zhang 2026-02-04
可解释性 因果分析 多模态大语言模型 模态遵循 注意力机制

Persona Prompting 在仇恨言论检测中提升分类但损害解释质量,且无法真正对齐真实人群

Jing Yang, Moritz Hechtbauer, Elisabeth Khalilov, Evelyn Luise Brinkmann,... 2026-01-29
LLM偏见 人格模拟 仇恨言论检测 可解释性 社会推理

推理模型通过模拟多视角对话实现深度思考,本质是'思维社会'的涌现

Junsol Kim, Shiyang Lai, Nino Scherrer, Blaise Agüera y Arcas, James Evans 2026-01-19
LLM推理 可解释性 多智能体 强化学习 认知科学

提出Shesha指标揭示表征稳定性与相似性独立,发现DINOv2存在"几何税"

Prashant C. Raju 2026-01-15
可解释性 模型评估 神经科学 表征学习 计算机视觉