将轨迹级成败转化为动作级批评监督,让8B小模型的多试次可靠性超过120B大模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个评估LLM多轮维护可执行界面的基准:单轮通过率严重高估五轮全流程可靠性
交互式有状态移动沙盒,四维评测移动规划智能体的工具调用与规划能力
用策略条件化分组消除开放式智能体RL中跨策略比较偏差
沙箱+基准揭示:智能体一次成功容易,可靠完成有状态业务工作流仍很难
循环语言模型提升组合式工具调用
👍 17循环语言模型在组合式工具调用上优势显著,自适应推理带来更优的计算-性能权衡
首个3D世界构建智能体的评测+多模态RL训练框架,开源30B模型Pass@1超越GPT-5.5
修复 Nanbeige4.2-3B 的五处部署 bug,分块预填充使其可用上下文扩展 2.7 倍
首个评测LLM移动助手跨应用检索分散个人信息的基准,最强模型准确率仅57.3%
把大教师智能体的成功经验分层蒸馏为工作流/子任务/函数三级记忆,免训练注入 4B-8B 小智能体
首个聚焦 LLM 智能体获取阶段隐私泄露的基准,含 1182 个用例
让单一策略同时扮演行动者与环境,内化世界模型以摆脱外部环境依赖。
首个视频深度研究框架,解耦感知与探索,35B以64.0%刷新SOTA
新增行为推理基准,揭示智能体面对工具映射漂移时迷信穷举搜索而非演绎。
让多模态大模型学会按需调用视觉工具,既不过度也不漏用,真正提升能力。
三阶段框架让VLM先调用专业视觉工具,再把工具能力内化为无工具推理。
用协同进化的技能库协调出题与解题双方自博弈,破解LLM自进化的多样性与验证困境。
多头潜控:大模型智能体决策的统一接口
👍 10给冻结大模型挂两个轻量头,从隐状态读出能力判断与干预决策,大幅降低调用强模型的成本。
发现多教师蒸馏会把工具调用边界推向过度调用,提出 Soft Clamp 局部校准方案
研究发现工具调用与JSON Schema约束同时启用时,多个开源模型完全停止调用工具的现象