通过工具调用重采样解决思考-行动差距,提升智能体推理能力
Minki Kang, Shizhe Diao, Ryo Hachiuma, Sung Ju Hwang, Pavlo Molchanov,...
2026-05-28
多模态学习
大语言模型
工具使用
强化学习
智能体推理
提出MM-CreativityBench基准和affordance-grounded对齐方法,提升LMM在视觉环境中的创造性工具改用能力
Cheng Qian, Hyeonjeong Ha, Jiayu Liu, Jeonghwan Kim, Emre Can Acikgoz,...
2026-05-28
Affordance推理
创造性推理
多模态学习
工具使用
视觉基础
提出模态翻译协议与SSC准则,诊断VLM视觉集成失败。
Karan Goyal
2026-05-25
VLM评估
信息论
可信AI
多模态学习
知识发现
利用图像分割作为生成代理,统一多模态模型的理解与生成能力
Songsong Yu, Yuxin Chen, Ying Shan, Yanwei Li
2026-05-20
图像分割
多模态学习
生成调优
统一多模态模型
视觉理解与生成
首个聚焦目标感知表示的多模态表格学习基准(40数据集)
Alan Arazi, Eilam Shapira, Shoham Grunblat, Mor Ventura, Elad Hoffer, Gioia...
2026-05-14
基准测试
基础模型
多模态学习
目标感知微调
表格学习
统一框架下的高质量图像生成与精确图像编辑模型,支持长文本渲染、多语言排版和高分辨率照片级生成
Bing Zhao, Chenfei Wu, Deqing Li, Hao Meng, Jiahao Li, Jie Zhang, Jingren...
2026-05-12
MMDiT
VAE
图像生成
图像编辑
多模态学习
把模态间隙重新解读为各向异性残差,用子空间+极坐标+先验校正做无配对模态对齐。
Xiaomin Yu, Yijiang Li, Yuhui Zhang, Hanzhen Zhao, Yue Yang, Hao Tang, Yue...
2026-05-11
MLLM训练
几何诊断
各向异性
多模态学习
无配对对齐
首个统一多模态领域泛化基准,揭示专门方法相对ERM基线仅有微弱提升。
Hao Dong, Hongzhao Li, Shupan Li, Muhammad Haris Khan, Eleni Chatzi, Olga Fink
2026-05-08
Benchmark
可信度
基准研究
多模态学习
领域泛化
用可微高斯溅射替代硬投影,从理论上消除跨模态熵坍缩,让稀疏点云真正吃进图像先验。
Zhaoyang Li, Zhichao You, Tianrui Li
2026-05-06
Transformer
可微渲染
多模态学习
点云补全
自驾感知
基于视频扩散先验的统一框架,单模型支持15种像素对齐任务的文本/视频间多模态生成。
Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing...
2026-05-04
LoRA
SIGGRAPH
多模态学习
扩散模型
本征分解
统一文本概率空间的多模态蒸馏框架,含视觉切换与动态双向 logits 差异损失。
Haoyi Sun, Xiaoxiao Wang, Ning Mao, Qian Wang, Lifu Mu, Wen Zheng, Tao Wei, Wei Chen
2026-04-17
多模态学习
模型压缩
知识蒸馏
视觉-语言模型
首个统一声音、音乐、语音三大域理解、生成、编辑的端到端多模态框架。
Zeyue Tian, Binxin Yang, Zhaoyang Liu, Jiexuan Zhang, Ruibin Yuan, Hubery...
2026-04-14
Rectified Flow
多模态学习
扩散Transformer
统一模型
音频生成
首个开放前沿通用LALM,支持30分钟长音频理解和时间锚定推理
Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit...
2026-04-14
多模态学习
思维链推理
长上下文理解
音频语言模型
用视觉语言联合推理自动生成相机轨迹,实现精准可控视频生成
Haoyu Zhao, Zihao Zhang, Jiaxi Gu, Haoran Chen, Qingping Zheng, Pin Tang,...
2026-04-13
多模态学习
扩散 Transformer
扩散模型
相机控制
空间推理
发现视频理解数据集严重依赖语言捷径,提出仅用视觉基础问题后训练提升模型性能
Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang, Penghui Du, Yiming Jia, Dongfu...
2026-04-08
多模态学习
数据质量控制
视觉语言模型
视频理解
语言偏见
DISCO多模态扩散模型实现蛋白质序列-结构协同设计,无需预定义活性位点即可设计出新酶
Jarrid Rector-Brooks, Théophile Lambert, Marta Skreta, Daniel Roth, Yueming...
2026-04-08
多模态学习
扩散模型
深度学习
蛋白质设计
酶设计
将因果LLM转换为双向编码器,解决灾难性遗忘,实现模态组合
Nicolas Boizard, Théo Deschamps-Berger, Hippolyte Gisserot-Boukhlef, Céline...
2026-04-07
双向编码器
多模态学习
权重合并
模型适配
灾难性遗忘
通过连接生成和理解能力,提升统一多模态模型对退化图像的鲁棒性
Xiangzhao Hao, Zefeng Zhang, Zhenyu Zhang, Linhao Yu, Yao Chen, Yiqian...
2026-04-07
图像恢复
多模态学习
强化学习
统一模型
鲁棒性
统一2D/3D生成,用跨模态一致性约束缓解3D数据稀缺问题
Chongjie Ye, Cheng Cao, Chuanyu Pan, Yiming Hao, Yihao Zhi, Yuanming Hu,...
2026-04-03
3D生成
多模态学习
指令编辑
自回归模型
跨模态对齐
用冻结LM做教师配合层间KV共享,在零额外参数下恢复VLM的语言能力。
Patrick Amadeus Irawan, Erland Hilman Fuadi, Shanu Kumar, Alham Fikri Aji,...
2026-04-03
KV缓存共享
多模态学习
灾难性遗忘
知识蒸馏
视觉语言模型