用token级log概率差识别RLVR稀疏更新方向,提升推理精度
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
通过强化学习对齐MLLM推理与低层动作,显著提升VLA机器人操控性能
通过筛选高方差轮次和功能等价奖励,将SFT轨迹转化为高效RL训练,实现4倍计算节省同时保持OOD泛化
提出双智能体自进化架构,通过GRPO强化学习提升MLLM长链视觉推理能力
系统研究长视界工具使用代理的强化学习设计空间,提出STAR框架和规模感知的训练方法
理解动作量化的行为克隆
👍 2为动作量化的行为克隆建立理论框架,证明稳定动力学下可实现最优样本复杂度
连续环境中的语义视听导航
👍 2提出MAGNet模型解决连续环境中语义视听导航任务,在目标声音间歇或静默后仍能维持目标追踪
通过合成多跳视觉-语言推理数据训练VLM,提升长链思维推理的泛化能力
高效RL框架对齐蒸馏视频模型与人类偏好
首个评估MLLM能否主动寻求帮助的基准,揭示了当前模型严重缺乏主动性能力。
用信息瓶颈理论压缩推理链,Token减48%准确率基本不变
通过动态里程碑规划和基于势能的强化学习,显著提升Web智能体的长期任务成功率
用强化学习直接优化循环语言模型的隐空间推理步骤,实现更准更快的隐式推理
将经典RL的马尔可夫状态引入LLM后训练,突破能力天花板,实现指数级样本效率提升
教导智能体逐步绘制矢量素描
👍 5通过部分级标注和过程奖励强化学习,实现逐步生成可编辑的矢量素描
提出多代理强化学习内存控制器,通过奖励分解实现可解释的能耗延迟联合优化
30B MoE模型通过级联RL+在线蒸馏,在IMO/IOI/ICPC三大竞赛获金牌
通过读写反思学习,让LLM智能体自主构建、优化和复用技能库,实现无需参数更新的持续学习
将多轮 Agent rollout 解耦为独立 HTTP 服务,提升 RL 训练的可扩展性和可维护性
提出MHPO框架,通过LFM和DHP组件实现稳定强化学习的梯度保真与危险感知控制