找到 232 条结果

首次系统证明在情感支持对话中,一个支持者回复可以同时包含多种支持策略,并提出两种生成方法结合认知推理与强化学习。

Jie Zhu, Huaixia Dou, Junhui Li, Lifan Guo, Feng Chen, Jinsong Su, Chi... 2026-04-21
GRPO LLM微调 强化学习 情感支持对话 策略建模

提出 AVR 框架,让视觉推理模型按任务复杂度动态选择直接回答、感知或完整推理三种格式,token 消耗降低 50–90%。

Yixu Huang, Tinghui Zhu, Muhao Chen 2026-04-20
GRPO 多模态大模型 强化学习 推理效率 视觉推理

用扩散生成器采样轨迹、RL判别器在低维打分,再配BEV特征级仿真,把闭环规划的安全性提升56%。

Hao Gao, Shaoyu Chen, Yifan Zhu, Yuehao Song, Wenyu Liu, Qian Zhang, Xinggang Wang 2026-04-17
GRPO 强化学习 扩散模型 端到端学习 自动驾驶

首次系统分析 RLVR 噪声标签机制,提出在线标签精炼方法 OLR。

Shenzhi Yang, Guangcheng Zhu, Bowen Song, Sharon Li, Haobo Wang, Xing Zheng,... 2026-04-07
GRPO RLVR 噪声标签学习 强化学习 推理大模型