提出ComBench基准测试,评估大语言模型在奥林匹克组合数学中的证明推理和构造实现能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
CPPO通过位置加权阈值和累积前缀预算解决LLM强化学习中自回归生成的不对称性
反馈对齐在自蒸馏中的作用
👍 3研究反馈结构对自蒸馏效果的影响,发现步骤对齐的反馈显著优于二值奖励和参考解
首次将在线蒸馏提升到隐藏状态空间,解决方差瓶颈和信息压缩问题,实现Pareto优势
用 chunk 级语义验证替代 teacher logits,实现黑盒模型蒸馏并超越白盒 OPD
用梯度-激活显著性重加权GRPO的token级优势,提升数学推理。
ESPO: 提前停止近端策略优化
👍 20ESPO通过提前终止失败轨迹节省20%+token并提升LLM推理性能
用现成大模型对固定长度分块打分,生成时引导小模型推理,免训练即可匹敌 PRM
基于信任区域的行为融合用于策略蒸馏
👍 69通过KL信任区域引导早期rollout行为,提升策略蒸馏效果
长存平衡:信息瓶颈驱动的基于树策略优化
👍 23用信息瓶颈理论量化探索-利用平衡,通过IBTree提升在线强化学习效率和稳定性。
提出自适应系数校准方法OCC,解决RL与MTP联合训练的性能下降问题
提出CPT方法,通过搜索时信息共享减少并行TTS的冗余探索
为多奖励GRPO引入方差自适应权重,兼顾训练稳定与目标协同
把RLVR更新视为token梯度上的线性判别器,用判别式系数重塑正负质心。
把难题拆成可验证子问题序列,用子问题级信用分配强化LLM推理
用自生成多解数据做中段训练,显著提升后续强化学习
把失败轨迹转成修正样本,让模型同时学会做对与改对。
仅用128条随机抽取的示范样本,让GRPO+DPO的少样本RLVR超越千条SFT数据方法。
THINC框架让代码本身成为推理主体,4B模型击败235B基线
数学家新创作的439道研究级数学题,前沿模型最高仅30.4%