构建 Claw 风格个人智能体训练数据合成、SFT/RL 训练与基准评测的端到端可扩展框架。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过分析基线智能体失败轨迹动态选择专用子智能体子集,在 τ-bench/τ-trait/ACEBench 上为开源 LLM 带来最高 27% 的成功率提升。
通过工具监督强化学习实现视觉推理
👍 4用两阶段RL课程让多模态大模型自主掌握视觉工具调用以解决复杂视觉推理
1978个MCP环境+19822工具,GRPO自演化闭环训练,23个基准全面领先开源基线。
端到端语音模型集成推理与工具调用,任务完成率从34.88%提升至74.57%。
用LLM模拟100个职业场景,跨10大行业测评15个前沿智能体的鲁棒性与行业专长。
评估Computer-Use代理多步执行轨迹级安全性的2,653实例基准
大模型先做决定再找理由
金融场景下LLM调用MCP工具的评测基准,含613样本与65个工具
提出轨迹感知进化方法T-MAP,发现LLM智能体在多步工具执行中的真实攻击漏洞
通过工具调用按需检索高分辨率裁剪区域,实现VLM高效推理
通过筛选高方差轮次和功能等价奖励,将SFT轨迹转化为高效RL训练,实现4倍计算节省同时保持OOD泛化
通过四阶段交互协议和双轨GRPO训练,让LLM自主探索未知数据库并生成准确SQL
4B参数医疗智能体通过行为蒸馏实现离线部署,性能媲美前沿大模型
通过自适应工具加载和基于评分标准的强化微调,让4B小模型逼近前沿大模型的智能体性能
MOSAIC 框架通过显式安全检查和偏好学习,让智能体在多步工具调用中学会安全决策
首个通用Agent系统评测:5架构×5模型×6基准的全因子实验
在不修改模型参数和系统提示的前提下,通过注入外部推理引导对话智能体从错误中恢复
提出GUI-Owl-1.5模型家族,通过混合数据飞轮和多平台RL扩展实现跨设备GUI自动化
通过推理时表征工程提升LLM工具调用的可执行性,无需微调模型