构建 Claw 风格个人智能体训练数据合成、SFT/RL 训练与基准评测的端到端可扩展框架。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
LLM 智能体闭环合成百万级可执行 CadQuery CAD 序列,无需任何真实历史数据。
解耦探索与任务生成,策略切换采样错误恢复轨迹,让开源数据追平闭源 70% AndroidWorld。
面向指令跟随信息检索的双重视角训练
👍 12极性反转合成对偶指令,305M 模型在 FollowIR 提升 45%。
用师生交替生成解决推理模型SFT中的风格冲突问题
用医学知识库合成可控分布的推理题并通过半监督RL缓解罕见病数据稀缺。
用自我中心上下文投影缓解LLM-LLM对话中的人格漂移与回声现象
以验证为中心的三阶段设计,让 8B 深度研究智能体逼近 30B 级别性能
通过合成多跳视觉-语言推理数据训练VLM,提升长链思维推理的泛化能力
首篇全开源搜索智能体,仅用11.7k合成样本SFT达到前沿水平
证据优先合成智能体任务,扩展多样性以提升工具使用泛化能力
用显式约束生成高质量交互数据并确定性验证,训练4B小模型匹敌70B大模型
ArtiAgent智能体框架自动合成图像伪影数据,训练VLM超越GPT-5的伪影理解能力
基于1M+真实轨迹训练的开放网页世界模型,显著提升智能体性能
提出对话式图像分割任务与基准,用自动数据引擎生成106K训练对,轻量模型超越大模型基线
少即是多:在LLM特征空间中合成多样数据
👍 246用稀疏自编码器识别缺失任务特征,覆盖式合成少量高效数据,达到150倍数据量基线的性能
构建1780个科学工具环境与基准,揭示LLM在长序列科学推理中的瓶颈
利用智能体从健康环境反向构造失败状态,自动生成 1655 个 CLI 任务用于训练编码智能体
构建可执行的终端任务数据管道,在TerminalBench上提升20%性能
从零合成可执行交互环境与可验证任务,通过环境多样性扩展训练通用工具使用智能体