通过双尺度多样性正则化促进LLM推理中的深度探索
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出10.3万规模的多模态数学数据集,通过三阶段自动清洗管道构建,显著提升视觉推理能力
以草稿进行思考:基于逻辑重建的光学解压
👍 36将视觉推理重构为逻辑解压,通过极简DSL草稿实现确定性视觉验证
GRPO的隐式优势对称性导致探索不足和难度适应差,A-GRAE通过非对称机制解决
Aletheia 数学研究智能体实现自主证明与论文生成
基于在线因果卡尔曼滤波的稳定高效策略优化
👍 18用卡尔曼滤波平滑token级重要性采样比率,提升大语言模型强化学习的稳定性与效果
iGRPO:自我反馈驱动的LLM推理
👍 19通过两阶段迭代自我反馈机制提升LLM数学推理能力的强化学习算法
用多样化推理大纲引导并行路径探索,突破大推理模型并行思维中的信息饱和瓶颈
弱驱动学习:如何让弱智能体使强智能体更强
👍 290复用训练中弱模型作为纠正信号,通过混合logit训练持续增强强模型
通过Focal加权缓解群相对RLVR在中等组大小下的分布锐化问题,无需额外计算
TRIT框架通过翻译与推理的相互强化,无需外部数据即可提升多语言长推理能力。
PMD-MEAN通过均值奖励近似隐式引入KL-χ²混合正则化,提升LLM RL训练稳定性
残差上下文扩散语言模型
👍 37通过回收被丢弃的中间计算信号,显著提升扩散语言模型的推理准确率
自提示语言模型增强强化学习
👍 31通过训练时注入自生成提示解决 GRPO 稀疏奖励下的优势崩塌问题
用 Beta 分布动态建模模型能力,自适应分配 RL rollout 预算以优化探索-利用权衡
Gemini Deep Think 作为研究合作者解决多领域开放问题
提出DAIL自蒸馏方法,通过分布对齐和对比学习将专家解法转化为可学习的推理轨迹
OVD:在策略语言蒸馏
👍 6用离散语言分数替代token级概率匹配,实现内存高效的推理能力蒸馏
测试时课程合成:面向自进化的协同训练框架
👍 35通过合成课程问题与求解器协同进化,实现测试时自适应推理提升
基于频域滑动窗口引导dLLM实现结构到细节的解码策略