用难度自适应树搜索、句子熵分叉与兄弟多样性奖励扩展 RLVR 的 pass@k 推理覆盖
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
在线策略反向蒸馏:激发弱到强泛化
👍 91用弱教师策略偏移方向放大强学生自身梯度,加速训练并突破教师上限
以验证器优势校准同模型密集自引导,用轨迹平衡拟合归一化目标分布实现自改进。
用验证器抽检教师逐题可靠性,按提示在密集OPD与GRPO间独占路由
用数学教育学的启发式与语义空间解析LLM思维链,诊断推理失败并改进RLVR后训练
提出L0–L4递退监督阶梯,沿奖励与经验双轴梳理LRM超越人类监督的方法、风险与评测。
混合SFT以不到1/60的算力在RLVR后全面超越下一块推理RL
可验证奖励下的在策略蒸馏(OPDVR)
👍 17用一个 ReLU 门控把在策略蒸馏改造成合法的 RLVR 方法,零新增超参数
把KL正则从响应侧移到查询侧,稳住训练环境漂移又不牺牲探索
SFT 让模型改用希腊语推理,RLVR 修好格式缺陷,而准确率基准被 7.7 分种子噪声淹没
按目标剩余提升空间动态重加权组相对优势,把RL优化力度转向未饱和目标
验证器诱导的在线策略优化支持重塑
👍 5RLVR 在提升当前任务的同时,会把未来任务的成功轨迹挤到固定预算内难以采样
用变分后验采样扰动权重替代温度调节,为GRPO注入参数空间探索
RSTG在负零方差样本上选择性施加自适应蒸馏,恢复GRPO丢失的梯度信号
面向在策略蒸馏的稳定优势融合
👍 34提出SAF四阶段流水线融合GRPO与OPD优势,避免熵坍塌并稳定提升性能。
开源全栈OpenMLE训练元进化智能体,MLE-Bench Lite奖牌率达71.21%。
让多模态大模型学会按需调用视觉工具,既不过度也不漏用,真正提升能力。
把游戏求解器的状态价值变化转成逐回合信用信号,注入 RLVR 实现无需 logits 的策略蒸馏
用于代码优化的强化学习
👍 11让RL真正学会写更快的正确代码:从测试、沙箱、奖励到GRPO全链路改造。
复用基模型权重奇异谱、仅优化奇异框架的 RLVR 原生优化栈