用显式约束生成高质量交互数据并确定性验证,训练4B小模型匹敌70B大模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
少即是多:在LLM特征空间中合成多样数据
👍 246用稀疏自编码器识别缺失任务特征,覆盖式合成少量高效数据,达到150倍数据量基线的性能
超越教师:基于奖励外推的泛化在线策略蒸馏
👍 68通过奖励外推实现超越教师的在线策略蒸馏框架
弱驱动学习:如何让弱智能体使强智能体更强
👍 290复用训练中弱模型作为纠正信号,通过混合logit训练持续增强强模型
构建百万级科学推理数据集,三阶段后训练提升4B模型科学推理
用RL后训练大幅提升视频世界模型的动作跟随精度和视觉质量
将注意力分布视为策略,用RL优化注意力分配以提升多模态LLM视觉推理能力
多任务GRPO:跨任务的可靠LLM推理
👍 14提出MT-GRPO算法,通过自适应任务加权和比例保持采样实现多任务推理的均衡优化
开源全流程后训练框架,用32B模型在SWE-bench Verified上达到70.8%解决率
通过最优传输对齐文本-视频嵌入空间,实现无需人工标注的视频生成后训练
在学术级算力下,通过轻量级后训练实现主权LLM的采用性与主权能力
训练UMM同时生成深度图和分割图,反向提升视觉理解能力
通过自我蒸馏实现强化学习:SDPO算法
👍 51SDPO用模型自身反馈做自蒸馏,突破RL信用分配瓶颈
你的群组相对优势是有偏的
👍 158揭示GRPO等群组相对RL算法中优势估计的固有偏差,并提出HA-DW自适应修正方案
证明SFT和RL在后训练中相互耦合,顺序执行必然导致一方退化
SOP通过分布式机器人在线经验共享实现VLA模型的高效多任务后训练