首个系统评估LLM智能体一致性、不确定性和能力边界感知的车载助手基准测试
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过自蒸馏和多样性感知强化学习,解决大推理模型在复杂工具使用中的懒惰推理问题
FISSION-GRPO 框架:将执行错误转化为在线策略纠正性监督,提升工具使用错误恢复能力。
探索面向智能体的推理奖励模型
👍 24提出多维度推理奖励模型Agent-RRM,通过文本批评和标量奖励的统一集成提升智能体性能
基于横向思维谜题的环境回滚,构建评估长上下文智能体动态推理能力的基准
提出DeepPlanning基准评估LLM在多日旅行和购物规划中的长期约束优化能力
美团开源560B MoE推理模型,在智能体搜索与工具使用任务上达到开源SOTA
提出ToolPRMBench基准,系统评估工具使用代理的过程奖励模型,覆盖多种工具环境和错误类型。
AgencyBench评估代理在百万token真实场景中的长时间跨度能力。
面向用户的多轮对话生成与规模化的工具使用
👍 53提出面向用户模拟的多轮工具对话生成框架,显著提升长期任务型智能体的稳健性与一致性。
揭示工具使用智能体的置信度二分法,提出CAR框架缓解校准偏差
自动化合成可执行的工具交互环境,用于训练LLM Agent解决多轮多工具复杂任务
基于树搜索的智能体轮次策略优化
👍 28提出AT2PO框架,通过熵引导树扩展、轮次级信用分配和轮次策略优化解决多轮智能体强化学习三大核心挑战