提出SeeUPO算法,通过逆序顺序更新解决多轮智能体RL的收敛性问题
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
通过预填充自调优和意图漂移感知强化学习,训练无需外部数据的多轮越狱攻击模型
解耦用户建模为Profile控制器与角色扮演模型,实现零数据自进化服务对话训练
让分割模型像人一样边搜边想,突破 MLLM 内部知识瓶颈
混淆NumPy库构建伪新知识域,诊断LLM智能体的知识内化与自进化能力
通过长度归一化消除GSPO的长度偏差,提升RLVR训练稳定性和性能
将注意力分布视为策略,用RL优化注意力分配以提升多模态LLM视觉推理能力
提出多轮强化学习框架解决内核生成中的奖励作弊和懒惰优化问题
面向语言模型的特权信息蒸馏
👍 28利用训练时特权信息蒸馏前沿模型,无需Chain-of-Thought
面向 LLM 智能体的强化世界模型学习
👍 28用自监督 RL 训练 LLM 成为动作条件的世界模型,提升智能体决策能力
ProAct:交互环境中的智能体前瞻推理
👍 27通过蒸馏MCTS搜索树和蒙特卡洛评论家,让LLM智能体内化准确的前瞻推理能力
通过大规模模仿预训练和强化学习后训练,构建可扩展的物理人-物交互生成控制器
通过可扩展交互式监督引导大语言模型
👍 20将复杂意图分解为递归决策树,让非专家用户有效引导LLM
提出可学习的潜在记忆框架,通过角色感知的潜变量优化解决多智能体记忆同质化和信息过载问题
多任务GRPO:跨任务的可靠LLM推理
👍 14提出MT-GRPO算法,通过自适应任务加权和比例保持采样实现多任务推理的均衡优化
通过多模态交错证据推理和视觉工具调用,实现细粒度多模态检索的智能体框架
PMD-MEAN通过均值奖励近似隐式引入KL-χ²混合正则化,提升LLM RL训练稳定性
用 KL3 估计器替代 GRPO 中的对称裁剪,实现有理论保证的非对称近信赖域约束
首个万亿参数级统一多模态自回归模型,支持文本、图像、视频、音频的理解与生成
用MARL训练的多智能体系统,4B模型匹敌671B单智能体的广域信息检索能力