通过树结构rollout和对比探索提升智能体RLVR的样本效率
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
利用Fisher-Rao距离检测注意力转移,动态重加权token级优势以提升MLLM跨模态推理。
世界模型自蒸馏:训练世界模型解决通用任务
👍 15通过自蒸馏和VLM反馈将视频扩散模型转为指令跟随的任务求解器
协同进化LLM策略与训练工具,超越人工RL基线
RACES框架将可验证环境像乐高积木一样递归组合,突破线性扩展限制提升LLM推理泛化能力。
通过优化输入图像而非模型权重,实现对冻结多模态LLM的非侵入式任务适配
提出 Feedback Distillation 方法,改进定理证明训练
提出使用单个LLM同时扮演Agent和环境两个角色,实现自举式协同进化,在多任务基准中平均提升超过4%
CPPO通过位置加权阈值和累积前缀预算解决LLM强化学习中自回归生成的不对称性
用精确KL散度替代噪声比率裁剪,提升Flow模型RL微调效率
重新思考大语言模型强化学习中的散度正则化
👍 34提出DRPO方法,用平滑正则化替代硬mask,改进LLM RL训练稳定性
用统一离散视觉token实现图像理解、生成和编辑的自回归模型
提出FlowTracer框架,通过注意力图谱追踪信息流实现token级别的精准信用分配
多块预测框架解决自回归视频世界模型训练中的短视监督问题
CapCode框架检测和防止编码代理作弊
反馈对齐在自蒸馏中的作用
👍 3研究反馈结构对自蒸馏效果的影响,发现步骤对齐的反馈显著优于二值奖励和参考解
强化学习中流策略的测试时梯度引导
👍 3QGF算法:测试时用Critic梯度引导流策略,避免反向传播
在线策略蒸馏的几何性质研究
👍 75从参数空间几何视角揭示OPD介于SFT和RLVR之间的独特更新轨迹与子空间锁定现象
通过Reward-Evaluation Skill统一异构奖励评估资源
提出多阶段门控机制,在保持准确率的同时将网络代理工具调用减少17%-58%