找到 86 条结果

397B 参数科学智能体基础模型:多模态科学理解、可验证强化学习与长程智能体训练的统一

Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng,... 2026-08-14
后训练 基础模型 多模态 强化学习 时间序列

Wan-Streamer v0.3 将视频分解为世界与事件流,实现通用预训练可迁移的实时音视频交互。

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu,... 2026-07-17
VLA 世界模型 多模态 实时音视觉 流式交互

首个通用指令式音频编辑综合评估基准,覆盖7种模态和6级复杂度

Ziyang Ma, Ruiqi Yan, Ruiyang Xu, Jie Fang, Zhikang Niu, Yi-Wen Chao,... 2026-06-08
基准测试 多模态 指令跟随 评估范式 音频编辑

提出camroll数据集和分层记忆代理,实现个人相册长程视觉问答

Thao Nguyen, Krishna Kumar Singh, Donghyun Kim, Yong Jae Lee, Yuheng Li 2026-06-05
AI代理 VQA 个人记忆 多模态 长程推理

统一处理多视图配置、多模态融合、长时程感知和度量尺度的几何感知框架

Haotian Wang, Yusong Huang, Zhaonian Kuang, Hongliang Lu, Xinhu Zheng, Meng... 2026-05-21
3D视觉 Transformer 几何感知 多模态 统一模型