找到 999 条结果

将动作视为潜在变量,通过前向-逆向模型交替优化实现无标注世界建模

Yifu Qiu, Zheng Zhao, Waylon Li, Yftah Ziser, Anna Korhonen, Shay B. Cohen,... 2026-02-09
GRPO 世界模型 强化学习 潜在变量 自改进学习

用强化学习优化迭代式推理的摘要时机、内容和续接策略,同时提升准确率与效率

Yuchen Yan, Liang Jiang, Jin Jiang, Shuaicheng Li, Zujie Wen, Zhiqiang... 2026-02-09
大语言模型 强化学习 推理效率 迭代推理 长链推理

首次系统研究多目标LLM对齐中的跨目标干扰问题,并提出基于协方差的权重自适应方法CTWA

Yining Lu, Meng Jiang 2026-02-09
LLM对齐 多任务学习 多目标优化 奖励函数 强化学习