系统研究多智能体RL训练LLM工作流,揭示IP/SP策略共享的梯度机制与失败模式
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
多模态学习
具身智能
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
多模态大语言模型
可解释性
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
在 on-policy RL 中复用 rollout 的下一观测做辅助世界模型监督,零额外推理开销
自监督强化学习训练多模态大模型做在线心智推理,无需心理状态标注
GrepSeek:训练直接语料库交互的搜索代理
👍 117通过shell命令让LLM直接检索原始文本,bypass传统检索索引实现高效多跳推理
通过搜索代理轨迹构建分层干扰文档,用实体级评分奖励提升长上下文推理能力
面向任务的多模态智能体记忆策略学习
👍 40通过强化学习使多模态智能体学会根据环境任务动态决定记忆内容
首个将数据无关的自我对弈扩展到开放式任务的框架,通过文档锚定的标准分解实现自我评估和持续自我改进
通过动态建模搜索边界来减少代理式搜索中的过度搜索,同时保持推理准确性
通过双流强化学习将视觉定位能力内化到文本推理中,无需显式输出坐标
将dLLMs的RL转化为去噪器自蒸馏,避免ELBO似然度替代的TIM偏差
MCTS+神经网络设计公交网络,Bloomington服务率54.6%-82.1%
通过分析隐藏表示的几何异常检测RL训练中的数据污染
通过差异化处理通用技能内部化与任务特定技能动态利用,提升智能体在OOD场景下的泛化能力。
研究长程交互中LLM的信念管理问题,提出CBM框架和BeliefTrack基准,发现RL可显著改善模型信念追踪能力
零依赖合成终端环境,提升LLM命令行能力
将真实GUI轨迹转换为可控手机环境,支持评估与训练
用Wikipedia共现统计替代神经验证器,实现低成本、高性能的事实性问答过程监督
用于多模态智能体推理的智能体探索策略优化
👍 93通过工具调用重采样解决思考-行动差距,提升智能体推理能力
通过修正策略梯度估计中的长度偏差和方差问题,实现高效的主动推荐路径规划。
使用弱模型的错误轨迹作为训练信号,让强模型学会自我纠错