找到 999 条结果

提出 AVR 框架,让视觉推理模型按任务复杂度动态选择直接回答、感知或完整推理三种格式,token 消耗降低 50–90%。

Yixu Huang, Tinghui Zhu, Muhao Chen 2026-04-20
GRPO 多模态大模型 强化学习 推理效率 视觉推理

用扩散生成器采样轨迹、RL判别器在低维打分,再配BEV特征级仿真,把闭环规划的安全性提升56%。

Hao Gao, Shaoyu Chen, Yifan Zhu, Yuehao Song, Wenyu Liu, Qian Zhang, Xinggang Wang 2026-04-17
GRPO 强化学习 扩散模型 端到端学习 自动驾驶

将推理任务重构为序列级上下文强盗问题,用标量价值函数解决PPO在长链推理中的信用分配不稳定问题

Tianyi Wang, Yixia Li, Long Li, Yibiao Chen, Shaohan Huang, Yun Chen, Peng... 2026-04-15
Chain-of-Thought PPO 大语言模型 强化学习 推理任务

自动识别智能体能力缺失并合成针对性训练环境的端到端系统

Hangoo Kang, Tarun Suresh, Jon Saad-Falcon, Azalia Mirhoseini 2026-04-14
LLM智能体 LoRA路由 合成环境 强化学习 能力分解