找到 979 条结果

通过数据质量选择而非数量堆叠,仅用3%数据实现超越完整数据集的人形机器人运动跟踪性能

Yu Guan, Zekun Qi, Chenghuai Lin, Xuchuan Chen, Dairu Liu, Wenyao Zhang,... 2026-06-08
强化学习 数据质量 机器人学 模仿学习 运动捕捉

通过自适应信任区域控制稳定离策略流策略微调

Yonghoon Dong, Kyungmin Lee, Changyeon Kim, Jaehyuk Kim, Jinwoo Shin 2026-06-05
信任区域 强化学习 流策略 离策略学习 随机最优控制

首个一对多时序定位框架,解决现实视频中重复事件定位问题

Qi Xu, Yue Tan, Shihao Chen, Jiahao Meng, Anna Wang, Shunping Ji, Hao Fei, Jason Li 2026-06-05
多模态大模型 强化学习 时序定位 视频理解

引入信念熵提供细粒度记忆监督,解决长周期智能体的噪声积累和信念漂移问题

Ziyan Liu, Zhezheng Hao, Yeqiu Chen, Hong Wang, Jingren Hou, Ruiyi Ding,... 2026-06-05
POMDP 不确定性估计 强化学习 记忆增强智能体 长周期推理