提出TP-GRPO框架,用增量式步骤奖励和转折点检测缓解Flow-GRPO的奖励稀疏问题
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
构建百万级科学推理数据集,三阶段后训练提升4B模型科学推理
通过模块化预算层级和强化学习路由器,实现运行时记忆提取的显式性能-成本控制
8B参数模型通过WARP策略交替起草与深化,超越闭源深度研究系统
用RL后训练大幅提升视频世界模型的动作跟随精度和视觉质量
将化学推理从离散语言转移到连续潜在空间,实现更快更准的分子推理
大规模挖掘网页操作流程,用LLM评判器评估和改进模型的流程生成能力
通过RL训练的策略模型自适应决定何时及如何使用世界模型进行视觉空间推理
LIFT框架:SAC大规模预训练+物理信息世界模型,实现人形机器人安全高效微调
通过动态调整PPO裁剪阈值灵活控制RL训练中的策略熵
通过Focal加权缓解群相对RLVR在中等组大小下的分布锐化问题,无需额外计算
百川医疗大模型通过三阶段训练统一对话问诊与可靠诊断,在多个基准上超越GPT-5.2
基于潜在动作的自改进世界建模
👍 32将动作视为潜在变量,通过前向-逆向模型交替优化实现无标注世界建模
TRIT框架通过翻译与推理的相互强化,无需外部数据即可提升多语言长推理能力。
ProGRPO通过置信度重加权解决RLVR训练中的熵崩溃问题
用强化学习优化迭代式推理的摘要时机、内容和续接策略,同时提升准确率与效率
结果准确率还不够:对齐奖励模型的推理过程
👍 13提出推理一致性指标和MetaJudge,解决GenRM欺骗对齐
首个基于强化学习的混合模态推理框架,显著提升音视频理解能力
用RL模型动态加权mid-training阶段的关键token,建立预训练与后训练的双向飞轮
揭示多目标对齐中的跨目标干扰现象
👍 6首次系统研究多目标LLM对齐中的跨目标干扰问题,并提出基于协方差的权重自适应方法CTWA