用策略条件化分组消除开放式智能体RL中跨策略比较偏差
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
PatternEval诊断基准与PatternRL训练对齐混合思考MLLM的响应行为
迈向忠实的用户购物行为模拟
👍 6RecVerse用认知分层记忆与轨迹级强化学习,在真实GUI环境中忠实模拟人类购物行为
用可插拔组件包裹静态环境,按策略弱点自动定制训练环境,显著提升智能体学习
用VLM编排VLA探索采集新任务数据,再经蒸馏与残差RL高效微调
让多个独立模型互为老师:以同伴多数票为奖励,无需标注即可涌现推理能力
单一模型自博弈:既写可执行训练环境又解题,环境难度随能力共同进化,实现持续自我提升。
化学合理性感知的单步逆合成大语言模型训练
👍 33Top-K提示+化学合理性奖励训练出超越传统模型的大语言模型逆合成系统
把技能选择从结果奖励噪声中拆出,用双通道信用分配单独训练
提出harnessed agentic RL范式,RL提升编码智能体14.6个百分点
将原生编码智能体框架桥接到策略梯度训练,SWE-bench解决率最高提升9.4个百分点
MathForm用知识检索与验证迭代构造36.7万条Lean数据,8B形式化模型超越32B对手
按目标剩余提升空间动态重加权组相对优势,把RL优化力度转向未饱和目标
开源27B GUI智能体:环境闭环数据训练+子任务级示范引导,登顶开源计算机操作基准
把黑盒智能体框架当作不透明环境,用沙箱、服务代理与前缀树实现稳定的智能体RL
验证器诱导的在线策略优化支持重塑
👍 5RLVR 在提升当前任务的同时,会把未来任务的成功轨迹挤到固定预算内难以采样
397B 参数科学智能体基础模型:多模态科学理解、可验证强化学习与长程智能体训练的统一
揭示LLM超出能力时产生似是而非的无效推理,CaRL训练模型学会及时认输
让AI编码智能体在6小时固定算力内自主改进世界模型,64次会话63次成功提升
自动合成有状态对抗环境、发现可行注入点并生成可验证攻击,评测并对齐LLM智能体安全性