把智能体调试组织为检测-归因-恢复-重跑闭环,DeepDebug多轮根因诊断刷新归因SOTA
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用智能体搜索可执行的文档表示程序,固定BM25下8个检索任务召回率平均提升8.4%
重评harness演化,发现它不优于测试时扩展且泛化有限
解耦基准×工具链×环境的开源LLM智能体统一评测基础设施
从成功轨迹的流动中追踪智能体失败
👍 18仅在成功轨迹上训练的一类学习模型,用神经受控微分方程定位智能体失败步骤
通过主动记忆干预解决长视界智能体的行为状态衰减问题
提出有界类型化内存契约,用Slay the Spire 2评估长视界智能体的记忆机制。
提出AFTER基准和EVOLUTION框架,研究LLM智能体程序性记忆的泛化能力
提出无需训练的测试平台QVAL,通过Q值对齐直接评估密集监督信号质量
首个系统性评估LLM智能体修复历史代码兼容性的基准测试研究
标准 LLM 智能体的计划是上下文依赖而非内部持久状态,驱逐计划文本会显著降低性能
通过隐藏状态相似性诊断LLM智能体过早承诺问题
为LLM智能体设计符号音乐语法和结构评估框架
提出用预测有效性替代聚合分数,揭示LLM智能体排行榜的排名不稳定问题
提出分层多智能体框架实现端到端个性化具身化教学
提出有审查预算的Arbiter智能体,实时监测多Agent对话中的失准行为
把RL粒度从token拉到step,对齐MDP与信用分配单元。
提出可验证奖励、RTE机制和pass^k指标的多轮对话推荐评测基准
提出使用单个LLM同时扮演Agent和环境两个角色,实现自举式协同进化,在多任务基准中平均提升超过4%
系统综述文本世界模型的构建方法、训练与推理应用及评估挑战