提出MAXS元自适应推理框架,通过前瞻策略和轨迹收敛机制解决LLM智能体的短视推理和路径不稳定问题
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出自适应前瞻机制,让LLM智能体在行动前动态决定想象多远的未来
用组内锦标赛排名替代逐点标量打分,解决开放式任务RL训练中的判别力崩溃问题
揭示工具使用智能体的置信度二分法,提出CAR框架缓解校准偏差
用软件发布工程流程管理LLM智能体迭代,以翻转为中心的门控实现回归感知改进
演化式程序化技能网络
👍 88提出PSN框架,让智能体通过可执行符号程序持续获取、精炼和重用技能
用因果干预揭示LLM推理链是真思考还是事后合理化表演
系统性地连接认知神经科学与LLM驱动智能体的记忆机制研究,提出新的分类框架并全面综述存储、管理、评测与安全问题。