用可验证物理奖励和LoRA微调小型推理模型求解梁静力学,发现模型学到程序模板而非物理方程
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用三阶段训练和数据工厂将通用VLM转为OCR专家,OmniDocBench达92.94%
提出RLAD框架,通过信任区域比率蒸馏将教师指导嵌入GRPO更新,实现选择性模仿
DPE 通过诊断-生成-强化闭环迭代,用 1K 种子数据让 8B 多模态模型超越 72B 模型
ACE通过非对称惩罚过自信错误,在不损失Pass@1的前提下显著扩展推理边界
GRPO的隐式优势对称性导致探索不足和难度适应差,A-GRAE通过非对称机制解决
首个端到端视觉强化学习框架,让多模态大模型真正理解图像隐喻
提出一个专为物理AI设计的多模态批评模型,通过自我参照的批评微调来提升物理推理和评估能力。
提出分块优势估计方法,为LLM结构化生成中的不同目标分配独立优势信号,解决奖励干扰问题
通过集中学习+分布式rollout与有界陈旧度控制,将RL训练成本降低36%
通过价值引导解码和树结构优势强化,解决生成式推荐中概率-奖励错配问题
通过按智能体归一化优势值,解决多智能体LLM系统中RL训练的梯度不稳定问题
用多样化推理大纲引导并行路径探索,突破大推理模型并行思维中的信息饱和瓶颈
提出TP-GRPO框架,用增量式步骤奖励和转折点检测缓解Flow-GRPO的奖励稀疏问题
通过动态调整PPO裁剪阈值灵活控制RL训练中的策略熵
通过Focal加权缓解群相对RLVR在中等组大小下的分布锐化问题,无需额外计算
大语言模型强化微调中的熵动力学研究
👍 59从单 token 对数更新出发,建立 RFT 熵变化的理论框架并推导出实用的熵裁剪方法
基于潜在动作的自改进世界建模
👍 32将动作视为潜在变量,通过前向-逆向模型交替优化实现无标注世界建模
ProGRPO通过置信度重加权解决RLVR训练中的熵崩溃问题
解耦用户建模为Profile控制器与角色扮演模型,实现零数据自进化服务对话训练