用团队体育作动态微观世界,构建覆盖感知到智能体合成的战略视频智能基准
Yulu Pan, Han Yi, Seongsu Ha, Md Mohaiminul Islam, Benjamin Zhang, Lorenzo...
2026-06-02
体育视频
因果推理
多模态大模型
战略推理
智能体
自监督强化学习训练多模态大模型做在线心智推理,无需心理状态标注
Shunchi Zhang, Jin Lu, Chuanyang Jin, Yichao Zhou, Zhining Zhang, Tianmin Shu
2026-06-02
多模态大模型
强化学习
心智理论
智能助手
自监督学习
把视频当码率流处理,codec-stream 在事件级定位上 +44.8。
Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui...
2026-05-27
多模态大模型
感知智能
时序定位
视觉token压缩
视频理解
形式化定义"原生多模态",梳理2023–2026年40+模型架构、训练、推理与评估。
Siyu An, Junru Lu, Junnan Dong, Qiufeng Wang, Yinghui Li, Weizhi Fei, Zichao...
2026-05-26
Transformer
原生建模
多模态大模型
综述
路线图
首个支持单轮并行多工具调用的视频智能体RL框架PARA-GRPO,破解工具先验悖论。
Zuhao Yang, Kaichen Zhang, Sudong Wang, Keming Wu, Zhongyu Yang, Bo Li,...
2026-05-26
多模态大模型
工具调用
强化学习
智能体
长视频理解
用显式查询接口让VLM和SAM3协同处理复杂指令的多实例分割。
Yuqian Yuan, Wentong Li, Zhaocheng Li, Yutong Lin, Juncheng Li, Siliang...
2026-05-26
DETR式集合预测
SAM3
多模态大模型
实例分割
指令理解
提出 CMRP 新任务和 UniCharacter 框架,用极少样本让统一多模态模型同时学会角色的语言风格与视觉外观。
Chao Tang, Jianzong Wu, Qingyu Shi, Ye Tian, Aixi Zhang, Hao Jiang,...
2026-05-26
GRPO
个性化生成
多模态大模型
强化学习
文生图
首个系统化的隐喻视频理解基准MetaphorVU-Bench与基于隐喻知识图谱的推理时增强框架MetaphorBoost
Zhuoqun Li, Boxi Cao, Guiping Jiang, Fangrui Lv, Ruotong Pan, Jianan Wang,...
2026-05-26
多模态大模型
知识图谱
视频理解
评测基准
隐喻理解
统一音频-语言基础模型,RLHF驱动ASR/TTS/实时对话三方向SOTA
Bin Lin, Bo Zhao, Boyong Wu, Chao Yan, Chen Wu, Cheng Yi, Chengyuan Yao,...
2026-05-25
MoE
RLHF
多Token预测
多模态大模型
实时对话
SWIM 用纯文本提示实现视频物体定位,训练时用掩码监督跨模态注意力。
Boyuan Sun, Bowen Yin, Yuanming Li, Xihan Wei, Qibin Hou
2026-05-25
多模态大模型
注意力正则化
细粒度物体定位
视频理解
跨模态对齐
用专用图像编辑器替代工具调用与统一多模态,让MLLM真正“用图像思考”。
Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin
2026-05-25
GRPO
LoRA微调
图像编辑
多模态大模型
强化学习
通过双流注意力模块与视觉感知适配器,让冻结 LLM 精准识别并翻译 Web 图像中的多语种文字
Bo Li, Ronghao Chen, Ningyuan Deng, Huacan Wang, Shaolin Zhu, Lijie Wen
2026-05-25
OCR
参数高效微调
图像翻译
多模态大模型
网页理解
提出GPR任务与MM-OCEAN基准,揭示MLLM 51%正确评分无证据支撑。
Caixin Kang, Tianyu Yan, Sitong Gong, Mingfang Zhang, Liangyang Ouyang,...
2026-05-22
Big Five人格
人格感知
可解释AI
多模态大模型
社会认知
用MLLM在自身ViT嵌入空间做语义规划,解耦理解与扩散渲染,统一视频生成与编辑。
Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun,...
2026-05-22
多模态大模型
扩散模型
统一框架
视频生成
视频编辑
提出工具编排视觉经验蒸馏,让图像生成智能体自我进化。
Sixiang Chen, Zhaohu Xing, Tian Ye, Xinyu Geng, Yunlong Lin, Jianyu Lai,...
2026-05-22
GRPO
图像生成智能体
多模态大模型
工具调用
强化学习
从5亿YouTube视频自动挖掘GUI轨迹,构建千万级数据集WildGUI
Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian...
2026-05-21
GUI智能体
交互轨迹
多模态大模型
持续预训练
数据合成
用工具增强的智能体框架与门控强化学习实现零样本工业异常检测新 SOTA
Rongbin Tan, Fangfang Lin, Zhenlong Yuan, Min Qiu, Kejin Cui, Mengmeng Wang,...
2026-05-21
GRPO
多模态大模型
工业异常检测
工具增强
强化学习
揭示Video-LLM靠视觉先验幻觉声音而非真正听音,提出THUD诊断与干预对齐方案。
Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu, Rui Cai, Tinghui Zhu, Wendi Li,...
2026-05-20
Clever Hans效应
偏好优化
多模态大模型
视频理解
诊断评测
覆盖三类视频的 AI 伪影分层基准,揭示 MLLM 感知根本缺陷
Yuqi Tang, Yang Shi, Zhuoran Zhang, Qixun Wang, Xuehai Bai, Yue Ding, Ruizhe...
2026-05-20
AI 生成内容检测
伪影分析
基准测试
多模态大模型
视频评估
通过轨迹级奖励塑形和跨任务优势归一化,有效缓解RFT方法在视觉持续学习中的灾难性遗忘问题
Meng Lou, Hanzhong Guo, Linwei Chen, Yizhou Yu
2026-05-20
多模态大模型
强化微调
持续学习
灾难性遗忘
视觉任务