用强化学习训练的工具调用Agent在胸部CT报告生成中显著超越3D视觉语言模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出分歧子集评估框架,揭示LLM关于答案正确性的特权知识仅在事实任务中存在。
诊断 VLM 计数的视觉注意力塌陷,并提出 MAS 注意力预算正则。
揭示 VLM 靠语义标签“短路”视觉推理的失败机制
SteerViT通过早期融合交叉注意力让冻结ViT可文本操控,并保持原表征质量
首个全面开源的CoT可监控性评估基准,揭示LLMs隐藏决策因素的能力与局限性
SING:分类器中语义不变量的分析方法
👍 17通过零空间几何与CLIP映射,量化分类器的语义不变性
发现VLM中单个神经元可作为强分类器,实现5倍推理加速
用 Shapley 值系统剖析六个 SOTA 音视觉语音识别模型在 SNR、解码过程、时序对齐上的模态贡献动态,揭示显著的音频偏置问题。
用LLM发现类别概念+VLM定位,微调ViT相关性图对齐语义区域,提升分布偏移鲁棒性
推理模型难以控制其思维链
👍 39推理模型几乎无法控制自己的思维链内容,这对 CoT 监控安全性是个好消息。
独立训练的 Transformer 权重千差万别,但都收敛到同一低维算法核心
提出用认知模型和AI算法作为语言代理设计模板的方法论框架
用离散动作模板替代温度采样,提升思维树的多样性和可控性
发现音频扩散模型存在语义瓶颈层,局部激活转向实现最优音乐概念控制
将推理时转向向量转化为组件级 rank-1 权重编辑,实现更优的属性-效用权衡
整合安全评估与内部诊断的开源工具包,实现从黑盒测试到白盒洞察的范式转变
通过梯度归因定位安全关键神经元并进行聚类微调,在极少参数下显著提升代码安全性
提出LATENTLENS方法,证明LLM中视觉token在各层均具有高度可解释性
用混合因子分析器将LM激活空间分解为低秩高斯区域,实现更好的可解释性和控制