提出生成式记忆策略,让LLM智能体学会何时需要记忆辅助以及如何生成任务相关指导
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
交互式评估需要一门设计科学
👍 14立场论文:把交互式评估从基准格式升级为设计科学,提出E:X→Y框架与两轴分类法。
首个端到端联合优化设计者与执行者的自动多智能体强化学习框架。
用LLM智能体自主设计混合LLM架构,在1B规模上以原创的AIRAformer和AIRAhybrid结构超越Llama 3.2与Nemotron。
提出可量化指标 ECC 与交错训练策略,系统性解决 LLM 智能体在新环境中的过早利用失败。
STALE基准诊断LLM智能体在隐式冲突下识别与更新过时记忆的能力。
把检索基础设施作为可演化的动作空间,LLM 诊断模块自主闭环改进。
LLM驱动的多智能体预测框架,分宏观与微观双视角合成预测
用结构化策略记忆让固定安全护栏在部署期持续学习稀疏用户反馈。
EAPO 教会 LLM 智能体在不确定时才探索,4B 模型在 GUI 任务上击败 GPT-4 级对手。
本地可逆假名化+类型化占位符,让云端记忆系统看不见明文却保留语义
LLM持续改写记忆库反而会损害性能,应把原始episodes当作一等证据并门控抽象过程。
首个智能体价值评测基准,发现价值潮汐受harness与技能深度调控。
面向长会话智能体的记忆评测基准,揭示所有系统依赖推理崩塌。
首个面向已构建RAG知识库的强化学习后精炼框架
面向多轮智能体强化学习的自适应熵调制
👍 23用响应级熵代理实现无监督信用分配与自适应探索-利用切换
Aris:通过对抗式多智能体协作实现自主研究
👍 143异源模型对审的ML研究harness,把长程研究拆成65+可审计技能。
以"编排轨迹"为统一抽象,串联奖励、功劳与编排三轴来梳理LLM-MAS强化学习文献。
用免训练GRPO自动优化LLM智能体技能,平均分提升127%
构建医疗 RL 训练场并提出 TT-OPD 自蒸馏框架解决多轮崩塌问题