用参考答案引导的对比概率差作为token级正确性信号来塑形RLVR优势
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
揭示 GRPO/Dr. GRPO/DAPO 是对组标准差的三种操作
揭示现有LLM多样性度量只捕捉表面措辞变化而非方法层面的策略差异,并提出方法级多样性评估框架
通过惊异度引导的令牌级优势重加权解决GRPO训练中的策略熵坍塌问题
通过token级梯度分析提出WAPO方法,解决RLVR训练不稳定性问题
ADR框架通过原子分解重组生成高质量可验证代码任务,突破RLVR数据瓶颈
自蒸馏策略梯度
👍 28把全词表自蒸馏与RLVR奖励统一为策略梯度,稳定提升LLM推理性能。
在RLVR中引入时间调度维度,按时序从后向前渐进优化轨迹百分位token
12B参数MoE模型,仅激活2.5B参数,实现代码生成和工具调用的IDE部署级效率
把Muon的全谱白化改成高通滤波,专攻VLA与RLVR两类低质量梯度。
把RLVR更新视为token梯度上的线性判别器,用判别式系数重塑正负质心。
RLVR权重更新呈秩-1线性结构,RELEX仅用15%训练步外推未来检查点
语言模型RLVR中的不可学习现象
👍 6揭示RLVR训练中存在反直觉的不可学习样例,代表模型表征的根本性缺陷。
用 9 类任务、9 种奖励的 23K RLVR 数据集和 TMN-Reweight 多任务优化算法,让 30B 模型长上下文能力逼近 R1-0528。
通过动态调整rubric标准的权重,将训练压力导向当前策略可学习的标准,提升多目标强化学习效率
提出'岔路口假说',论证推理模型的覆盖率收缩由微调数据中的决策点驱动,而非算法本身。
用策略级提示诱导多样化推理轨迹,让 RLVR 探索效率提升 8 倍
把失败轨迹转成修正样本,让模型同时学会做对与改对。
用 756 张手绘 Jordan 曲线图测试 VLM 的视觉拓扑层级推理能力。
OmniClean 去偏评测加 OmniBoost 三阶段后训练,3B 模型可比肩 30B