三级因果干预显示视觉工具调用的收益集中于少数校准轨迹,多数调用与答案无因果耦合。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用变分后验采样扰动权重替代温度调节,为GRPO注入参数空间探索
GRPO无参考奖励+SFT-RL插值,46语言翻译比肩GPT-5
低分辨率通读全文、按需放大关键区域,让8B模型在长文档问答上同时更准、更快、更少幻觉
三阶段框架让图像编辑对话中的后续建议既契合用户偏好又与当前画面视觉一致
用稀疏位置探测与验证器校准的蒸馏目标,提升小模型数学推理覆盖
用时间戳免费导出的时间距离取代偏好与进度标注,训练出可作稠密奖励的机器人价值基础模型。
把每轮交互意图变成显式控制变量,意图校准GRPO训练出意图准确率86.6%的用户模拟器
视频生成仅作训练信号,推理时丢弃视频分支直接预测轨迹
揭示SFT多阶段训练产生任务冲突而RL可稳定共存,并提出Parallel-RL解耦框架。
多模态环境不能盲目堆量,应从能力多样性与难度结构两维度设计训练分布
演化评分标准作为奖励的音频推理强化学习
👍 13用自演化的音频接地评分标准做过程级奖励,提升音频推理质量
用统一强化学习框架打通情感感知、理解与交互三大层次
跨平台 CUA 轨迹评测基准揭示 VLM 判官普遍的宽容偏差,并开源低成本奖励模型弥合成本鸿沟。
让单一策略同时扮演行动者与环境,内化世界模型以摆脱外部环境依赖。
让推理器从初始检索的失败中学习,生成定向思维链自适应重排或重检索。
用潜在视觉状态重构与隐式过程奖励强化学习,让多模态大模型掌握时序视觉推理。
面向长程终端任务的递归合成框架
👍 231递归地生成已验证的长程终端智能体训练任务,低成本可扩展
用答案反推出的线索给轨迹每一步打分,实现细粒度的SFT与RL训练。
让统一多模态模型自主推理、调用工具并原生生成图像。