让多模态大模型学会按需调用视觉工具,既不过度也不漏用,真正提升能力。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
三阶段框架让VLM先调用专业视觉工具,再把工具能力内化为无工具推理。
把在线自蒸馏视为β=1的KL正则化策略优化特例,借logit插值与回报到当前信贷分配改进推理
用统一策略在行动前依据当前状态重构检索经验,GRPO 端到端训练
构建深度可演化合成环境与协同进化循环,让9B计算机使用智能体逼近前沿模型
用反事实回放为GRPO分配令牌级信用,无需训练评分器即可提升指令跟随RL效果
把游戏求解器的状态价值变化转成逐回合信用信号,注入 RLVR 实现无需 logits 的策略蒸馏
单一策略在任务序列中边解题边整理技能文档,实现端到端的可迁移技能学习。
统一在线蒸馏框架修复三大失效模式,0.5B学生达GSM8K 69.8%
用于代码优化的强化学习
👍 11让RL真正学会写更快的正确代码:从测试、沙箱、奖励到GRPO全链路改造。
系统诊断小模型PPO对齐的三大失效模式,提出工程化稳定框架与能力余量假说
机器人学习中的进度奖励建模:一份全面综述
👍 192统一框架梳理机器人学习进度奖励模型:接口、构造机制、数据与评测
用结构化JSON协议蒸馏专有模型推理能力,提升开源模型智能体搜索
把试穿重新定义成多参考理解驱动生成,靠数据引擎+CPT-SFT-RL达到任意品类SOTA
用可控环境系统揭示长程规划能力在预训练、GRPO/OPD、多教师蒸馏三阶段的获取、塑造与整合规律。
用逐字引用+检索替代坐标框,让VLM证据归因召回率提升数倍
用协同进化的技能库协调出题与解题双方自博弈,破解LLM自进化的多样性与验证困境。
AREX:面向深度研究的递归自我改进智能体
👍 147AREX用内外双循环递归地自我改进,靠验证驱动的研究状态刷新深度搜索水平。
从智能体经验中样本高效地学习
👍 17把智能体交互经验蒸馏进权重,无需额外环境采样即可保留大部分上下文学习增益。
基于前缀重放的多轮在线策略蒸馏
👍 11复用教师轨迹做离线多轮 agent 蒸馏,零工具调用、4倍加速且不掉点。