从少量种子轨迹出发,在 UI 状态变化点分支扩展,生成大规模高质量桌面 GUI 训练数据。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过多智能体环境合成与主动错误注入,训练出媲美专有模型的终端操作智能体
利用GitHub PR链构建长视野训练数据,仅239个样本显著提升智能体性能
通过测试时缩放和强化学习训练生成器,实现可控难度的高质量推理问题合成
通过填空式多选题构造,将不可验证文本转化为可用RL训练数据
一个完全自动化的端到端框架,通过可扩展的数据合成和可验证的强化学习来训练工具增强的语言智能体。
用GitHub PR数据和真实执行轨迹做智能体中期训练,在SWE-Bench上刷新开源方案SOTA。
提出RPE复杂度度量和逆向QA合成框架,生成大规模高难度图表推理训练数据
解锁隐式经验:从文本中合成工具使用轨迹
👍 39提出从文本语料库直接提取多轮工具使用轨迹的新范式,绕过对预定义工具的依赖
面向用户的多轮对话生成与规模化的工具使用
👍 53提出面向用户模拟的多轮工具对话生成框架,显著提升长期任务型智能体的稳健性与一致性。