把视觉感知、文本推理、视觉推理拆成三个独立阶段做后训练,VLM 的视觉推理准确率涨、推理链还变短了。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个面向真实 Excel 的端到端强化学习框架,让开源 4B 模型表格任务通过率近乎翻倍。
训练4B RL编排器动态组合专家模型与层次技能,平均70.1%超越GPT-5
提出工具编排视觉经验蒸馏,让图像生成智能体自我进化。
用工具增强的智能体框架与门控强化学习实现零样本工业异常检测新 SOTA
提出可扩展、可验证的规划数据生成框架,用于评测与训练LLM的规划能力。
基于点互信息的推理强化学习反自蒸馏方法
👍 196AntiSD通过反转自蒸馏梯度方向解决推理RL的捷径偏置问题
用 9 类任务、9 种奖励的 23K RLVR 数据集和 TMN-Reweight 多任务优化算法,让 30B 模型长上下文能力逼近 R1-0528。
KVPO:面向流式自回归视频生成,在ODE原生范式下做KV语义探索的偏好对齐
用在线GRPO+CLIP几何重定向实现零配对数据、零奖励模型的扩散模型安全对齐。
用策略级提示诱导多样化推理轨迹,让 RLVR 探索效率提升 8 倍
用 Hölder 平均统一 GRPO 系列聚合方式,提出动态 p 退火。
首个端到端联合优化设计者与执行者的自动多智能体强化学习框架。
提出可量化指标 ECC 与交错训练策略,系统性解决 LLM 智能体在新环境中的过早利用失败。
把失败轨迹转成修正样本,让模型同时学会做对与改对。
门控自蒸馏 OPSD,稳健提升多轮 LLM 智能体 RL 训练。
用词表里的功能 token 统一 agentic 与 latent 视觉推理。
单策略生成器-求解器合成Python训练环境,让模型自己构造零数据RL的世界
仅用128条随机抽取的示范样本,让GRPO+DPO的少样本RLVR超越千条SFT数据方法。
VLM规划器与VGM模拟器在双相循环中互训,从无标注种子图自演化机器人操作。