找到 272 条结果

首个跨六系统、评估 GUI 区域与元素功能理解及交互结果预测的大规模基准

Hongxin Li, Xiping Wang, Jingran Su, Zheng Ju, Yuntao Chen, Qing Li, Zhaoxiang Zhang 2026-04-29
GUI智能体 人机交互 功能理解 基准测试 视觉语言模型

提出L1-L4四层时间序列推理认知分类法,构建8.3万样本HITSR数据集,并基于Qwen3-VL训练双视图(折线图+索引-数值表)的LLaTiSA模型,通过三阶段课程微调在L1-L3 OOD任务上大幅超越GPT-4o等基线。

Yueyang Ding, HaoPeng Zhang, Rui Dai, Yi Wang, Tianyu Zong, Kaikui Liu,... 2026-04-24
多模态大模型 推理基准 时间序列 视觉语言模型 课程学习

提出GG-EZ框架通过区域数据过滤与模型合并实现视觉语言模型的区域适配且保留全局能力

Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong, Hitesh Laxmichand... 2026-04-16
东南亚 全球化因子 区域适配 文化对齐 模型合并

用 3021 道菜、5.27 张/菜的多视角图,系统评测 29 个视觉语言模型在精细分类、营养估计与饮食 VQA 三大任务上的真实能力。

Song Jin, Juntian Zhang, Xun Zhang, Zeying Tian, Fei Jiang, Guojun Yin, Wei... 2026-04-14
Chain-of-Thought VQA 基准测试 多视角 细粒度识别