自演化训练轨迹级守护模型防御计算机操作智能体的多步威胁
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
基于最小充分表征学习的领域特定数据合成
👍 20通过学习最小充分域表示,从少量参考样本生成高质量领域特定数据
零依赖合成终端环境,提升LLM命令行能力
通过统一评分树合成8K任务并配合Mid-Training/SFT/RL三阶段训练,35B模型在8个深度研究基准上逼近闭源系统。
三智能体对抗流水线为电脑操作代理规模化合成带可验证奖励的RLVR数据
把多轮智能体工具调用轨迹重编译成长上下文问答对,训练LLM的长程推理
从5亿YouTube视频自动挖掘GUI轨迹,构建千万级数据集WildGUI
提出可扩展、可验证的规划数据生成框架,用于评测与训练LLM的规划能力。
提出智能图像编辑作为统一模型调优的通用任务,单任务单数据集全面提升理解/生成/编辑
差分渲染构造 82 语言 OCR 数据,DPO 实现稳定跨语言迁移
统一检索与编译器反馈为可训练策略,构建OProofs语料,在五项Lean4基准上取得SOTA
以视觉提示+原生工具调用实现细粒度实例级视频理解
用5B token长文档VQA把Qwen2.5-VL从32K扩到128K并外推至512K。
图像库引用协议+ODE把Qwen3-VL平均提升14.1个百分点
提出 CUActSpot 基准与渲染式数据合成流水线,揭示任务多样性优于单模态数据规模化。
用单次并行「定位+检索」原子动作+双粒度RL,让多实体搜索又快又准。
首个开源多模态深度搜索智能体训练配方,含数据管线、七工具环境与致命感知GRPO
BRIGHT-PRO基准与RTriever-Synth,训出4B推理检索器。
用1万条高难度SFT轨迹训练30B搜索智能体,4个基准全面刷新SOTA。
用3D语义占据把真实场景搬进Minecraft,并配套大规模数据集和VLN导航验证