通过联合优化记忆提取与管理,构建可泛化的自进化智能体记忆系统
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
显式建模推理延迟,实现秒级VLM推理下的实时机器人导航
通过价值引导解码和树结构优势强化,解决生成式推荐中概率-奖励错配问题
用GRPO+LoRA训练改写策略对抗检测器集成,在4个检测器上实现97.6%攻击成功率
将GUI下一状态预测转化为HTML代码生成,用渲染感知强化学习实现高保真视觉模拟
通过四阶段训练流程(中期训练、离线强化学习、在线强化学习、模型合并)构建统一的GUI智能体,在多个基准测试中达到SOTA
将原始经验蒸馏为层次化技能库,并通过递归进化机制与策略共同优化
首个开源视觉语言模型,在物理奥赛中斩获12枚金牌,排名第3
用代码+数据库自动合成1000个可执行环境,用于大模型智能体的强化学习训练
通过按智能体归一化优势值,解决多智能体LLM系统中RL训练的梯度不稳定问题
在线强化学习框架,在提升代码安全性的同时保持功能完整性
iGRPO:自我反馈驱动的LLM推理
👍 19通过两阶段迭代自我反馈机制提升LLM数学推理能力的强化学习算法
从零合成可执行交互环境与可验证任务,通过环境多样性扩展训练通用工具使用智能体
通过压缩KV缓存和选择性记忆召回实现高效长上下文多跳推理
用树结构组织探索轨迹,高效扩展计算机使用代理的GUI自动化能力
RL训练的推理模型存在最优输出长度,过长或过短都会降低准确率
用多样化推理大纲引导并行路径探索,突破大推理模型并行思维中的信息饱和瓶颈
提出Octopus框架,通过配对推理轨迹实现VLM的可控自我纠正能力学习
引入T2T编辑机制突破扩散语言模型速度-质量权衡瓶颈
将机器人与GPU统一抽象,支持异构多机器人在线策略学习的系统框架