通过组合式世界模型在想象空间中进行强化学习,实现机器人策略的自我改进
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
GRPO的隐式优势对称性导致探索不足和难度适应差,A-GRAE通过非对称机制解决
用基础模型生成可执行环境代码来构建课程,让智能体在开放世界中持续学习
首个个性化生成式奖励模型,用原型聚类和双粒度缩放实现精准用户对齐
提出Solver-Verifier协同进化框架,用几何奖励机制在少量标注下提升LLM科学推理能力
首个端到端视觉强化学习框架,让多模态大模型真正理解图像隐喻
利用 RLVR 导致的推理结构塌缩特征,通过 Min-kNN 距离黑盒检测训练数据
196B MoE 模型仅激活 11B 参数,通过架构与 RL 创新达到 GPT-5.2 水平
提出一个专为物理AI设计的多模态批评模型,通过自我参照的批评微调来提升物理推理和评估能力。
通过更新门和退出门解决长上下文推理中的记忆爆炸与冗余计算问题
提出OmniDenseCaptioning任务,生成六维度剧本式视频描述
通过自我蒸馏的元经验增强LLM强化学习的元学习框架
用强化学习自动端到端生成LLM适配的数据处理配方,性能媲美顶级闭源模型。
基于在线因果卡尔曼滤波的稳定高效策略优化
👍 18用卡尔曼滤波平滑token级重要性采样比率,提升大语言模型强化学习的稳定性与效果
用迭代解码替代自回归,让小模型在测试时持续推理远超训练长度
让模型自主管理上下文,从被动预测器转变为状态感知智能体
提出分块优势估计方法,为LLM结构化生成中的不同目标分配独立优势信号,解决奖励干扰问题
通过集中学习+分布式rollout与有界陈旧度控制,将RL训练成本降低36%
提出 RLTR,在 RLVR 中加入跨模型可迁移奖励,提升推理鲁棒性与采样一致性。
将搜索QP子任务统一为生成范式,通过渐进式对齐策略实现工业级部署