通过学习识别并省略冗余的思考和观察token,在不损失准确率的前提下大幅降低智能体推理成本
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出首个评估VLM自适应推理模式选择能力的基准,揭示准确率与模式选择能力解耦现象
基于旅行规划场景构建长程多轮交互基准,揭示现有LLM在复杂约束下的严重不足
解锁隐式经验:从文本中合成工具使用轨迹
👍 39提出从文本语料库直接提取多轮工具使用轨迹的新范式,绕过对预定义工具的依赖
提出步骤级工具调用安全检测基准、防护栏模型和反馈驱动推理框架,将有害调用降低65%
用文件系统记忆存储反馈,摊销推理时自我纠错的计算成本
提出双路径框架ATLAS,通过集群路由和强化学习实现动态模型-工具协同编排。