找到 999 条结果

将任意区域掩码压缩为两个离散token,让MLLM像学语言一样学像素级能力

Yikang Zhou, Tao Zhang, Dengxian Gong, Yuanzheng Wu, Ye Tian, Haochen Wang,... 2026-01-23
向量量化 图像分割 多模态大语言模型 强化学习 掩码词元化

系统综述LLM和智能体驱动GPU内核自动生成的方法、数据与基准

Yang Yu, Peiyu Zang, Chi Hsu Tsai, Haiming Wu, Yixin Shen, Jialing Zhang,... 2026-01-23
GPU内核 LLM 代码生成 强化学习 智能体

提出RAM方法解决RL训练智能体模型合并时的信号稀释问题,实现跨任务协同增强

Xiangchi Yuan, Dachuan Shi, Chunhui Zhang, Zheyuan Liu, Shenglong Yao,... 2026-01-22
参数高效 多任务学习 强化学习 智能体 模型合并

结合LLM全局推理与RL局部决策的分层自主探索框架,在仿真和真实环境中显著提升探索效率

Shuhao Liao, Xuxin Lv, Jeric Lew, Shizhe Zhang, Jingsong Liang, Peizhuo Li,... 2026-01-22
分层规划 图推理 大语言模型 强化学习 机器人探索

让VLM通过主动探索3D点云空间进行推理,而非被动接受2D图像

Zaibin Zhang, Yuhan Wu, Lianjie Jia, Yifan Wang, Zhongbo Zhang, Yijiang Li,... 2026-01-21
3D视觉 多模态推理 工具增强 强化学习 空间智能

揭示GRPO等群组相对RL算法中优势估计的固有偏差,并提出HA-DW自适应修正方案

Fengkai Yang, Zherui Chen, Xiaohan Wang, Xiaodong Lu, Jiajun Chai, Guojun... 2026-01-19
GRPO LLM推理 优势估计 后训练 强化学习