找到 272 条结果

构建1.47亿动作片段的大规模视频动作数据集,显著提升零样本动作识别性能

Delong Chen, Tejaswi Kasarla, Yejin Bang, Mustafa Shukor, Willy Chung, Jade... 2026-01-16
动作识别 数据集构建 自监督学习 视觉语言模型 视频理解

将智能体交互历史渲染为压缩图像,用视觉 token 替代文本 token,节省 50%+ 消耗

Lang Feng, Fuchao Yang, Feng Chen, Xin Cheng, Haiyang Xu, Zhenglin Wan, Ming... 2026-01-12
Token 压缩 多模态智能体 强化学习 智能体记忆 视觉语言模型