找到 210 条结果

用团队体育作动态微观世界,构建覆盖感知到智能体合成的战略视频智能基准

Yulu Pan, Han Yi, Seongsu Ha, Md Mohaiminul Islam, Benjamin Zhang, Lorenzo... 2026-06-02
体育视频 因果推理 多模态大模型 战略推理 智能体

自监督强化学习训练多模态大模型做在线心智推理,无需心理状态标注

Shunchi Zhang, Jin Lu, Chuanyang Jin, Yichao Zhou, Zhining Zhang, Tianmin Shu 2026-06-02
多模态大模型 强化学习 心智理论 智能助手 自监督学习

把视频当码率流处理,codec-stream 在事件级定位上 +44.8。

Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui... 2026-05-27
多模态大模型 感知智能 时序定位 视觉token压缩 视频理解

形式化定义"原生多模态",梳理2023–2026年40+模型架构、训练、推理与评估。

Siyu An, Junru Lu, Junnan Dong, Qiufeng Wang, Yinghui Li, Weizhi Fei, Zichao... 2026-05-26
Transformer 原生建模 多模态大模型 综述 路线图

提出 CMRP 新任务和 UniCharacter 框架,用极少样本让统一多模态模型同时学会角色的语言风格与视觉外观。

Chao Tang, Jianzong Wu, Qingyu Shi, Ye Tian, Aixi Zhang, Hao Jiang,... 2026-05-26
GRPO 个性化生成 多模态大模型 强化学习 文生图

首个系统化的隐喻视频理解基准MetaphorVU-Bench与基于隐喻知识图谱的推理时增强框架MetaphorBoost

Zhuoqun Li, Boxi Cao, Guiping Jiang, Fangrui Lv, Ruotong Pan, Jianan Wang,... 2026-05-26
多模态大模型 知识图谱 视频理解 评测基准 隐喻理解

用专用图像编辑器替代工具调用与统一多模态,让MLLM真正“用图像思考”。

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin 2026-05-25
GRPO LoRA微调 图像编辑 多模态大模型 强化学习

用MLLM在自身ViT嵌入空间做语义规划,解耦理解与扩散渲染,统一视频生成与编辑。

Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun,... 2026-05-22
多模态大模型 扩散模型 统一框架 视频生成 视频编辑