找到 210 条结果

9B参数全双工全模态模型,<12GB内存实现实时听说看同步

Junbo Cui, Bokai Xu, Chongyi Wang, Tianyu Yu, Weiyue Sun, Yingjing Xu,... 2026-05-07
全双工交互 多模态大模型 流式推理 端侧部署 语音生成

用单一Transformer让ViT直接预测文本token,省去对比损失和文本解码器,5倍数据效率超越SigLIP2。

Yan Fang, Mengcheng Lan, Zilong Huang, Weixian Lei, Yunqing Zhao, Yujie... 2026-05-04
Vision Transformer 多模态大模型 生成式预训练 自回归语言建模 视觉编码器预训练

提出L1-L4四层时间序列推理认知分类法,构建8.3万样本HITSR数据集,并基于Qwen3-VL训练双视图(折线图+索引-数值表)的LLaTiSA模型,通过三阶段课程微调在L1-L3 OOD任务上大幅超越GPT-4o等基线。

Yueyang Ding, HaoPeng Zhang, Rui Dai, Yi Wang, Tianyu Zong, Kaikui Liu,... 2026-04-24
多模态大模型 推理基准 时间序列 视觉语言模型 课程学习

提出 GSI-Bench:首个生成式空间智能基准,仿真训练可提升空间编辑与理解。

Muzhi Zhu, Shunyao Jiang, Huanyi Zheng, Zekai Luo, Hao Zhong, Anzhou Li,... 2026-04-23
Sim2Real 图像编辑 基准评测 多模态大模型 生成式空间智能

用两阶段RL课程让多模态大模型自主掌握视觉工具调用以解决复杂视觉推理

Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang,... 2026-04-23
GRPO 多模态大模型 工具调用 强化学习 视觉推理