将可复用技能和SOP视为贝叶斯假设,通过验证轨迹证据指导技能演化,显著提升LLM agent任务成功率。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个使用Lean4依赖类型形式化语言统一建模验证LLM智能体工作流与轨迹的框架
通过迭代发现和思维模板从上下文中主动发现多个隐藏问题的框架
EvoDS通过自主技能获取和自适应上下文压缩实现自进化数据科学代理
超长时序闭环优化基准,证明坚持性比初始解更决定最终性能。
用拍卖竞争与财富积累让弱智能体自组织成强群体智能
用进化损失+适配损失的分解框架,结合多智能体进化、分支树路由与人机介入,实现开放式任务流上的持续自改进线束部署。
提出MASA框架,根据模型能力定制技能表述
在 on-policy RL 中复用 rollout 的下一观测做辅助世界模型监督,零额外推理开销
揭示LLM智能体在长时程数据分析任务中严重失败,最高准确率仅48.45%
自进化LLM的进化能力与基础能力解耦
通过差异化处理通用技能内部化与任务特定技能动态利用,提升智能体在OOD场景下的泛化能力。
以技能全生命周期管理为核心,让LLM智能体自主创建、评估、精炼并跨智能体迁移可复用技能
NoisyAgent:在训练中显式注入用户与工具噪声以提升LLM智能体鲁棒性
180任务×10模型基准,揭示智能体难以把单次经验沉淀为可复用过程技能。
SEAL:智能体与学习环境的协同共演化
👍 10提出基于验证器失败诊断的智能体-环境协同共演化框架 SEAL,用同一诊断信号同时驱动训练接口进化与策略梯度更新。
把智能体技能文档当作可训练参数,用带学习率与验证门控的文本空间优化器迭代修订。
跨五个域系统研究模型生成技能全生命周期,揭示评估器能力与执行能力无关,并提出元技能显著提升技能质量。
用蓝图+21视图+FEA 反馈,让 LLM 智能体生成满足工程约束的 STEP 装配体。
用全轨迹后视分析挑选失败步骤,仅在相关动作片段做反馈条件蒸馏。