RLVR 弱监督泛化由预训练先验与推理忠实性决定,Thinking SFT 可恢复
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
面向情感支持对话的单轮多策略建模
👍 3首次系统证明在情感支持对话中,一个支持者回复可以同时包含多种支持策略,并提出两种生成方法结合认知推理与强化学习。
用PPL空间解耦破解RLVR训练中探索-利用的两难困境
面向高效视觉推理的自适应推理路径学习
👍 10提出 AVR 框架,让视觉推理模型按任务复杂度动态选择直接回答、感知或完整推理三种格式,token 消耗降低 50–90%。
遗忘算法后测 LLM 能否独立重发明 Dijkstra 等基础算法
用扩散生成器采样轨迹、RL判别器在低维打分,再配BEV特征级仿真,把闭环规划的安全性提升56%。
分层动作加密集奖励GRPO,把LVLM改造成统一视觉RAG智能体。
用几何可验证的3D场景,让单VLM自问自答持续提升空间推理。
提出 PreRL 与 DSRL:在预训练空间以 NSR 修剪错误推理路径,再切换到标准 RL 精调。
把组内候选重加权变成闭式目标分布,用交叉熵直接拟合,梯度自动消失。
多响应判别式奖励模型:一次前向同时评N个候选,实现N×加速与SOTA精度。
首个面向近距HRI的VLM,任务感知地定位3D人体关键点
用高斯分布匹配重写GRPO优势函数,破解多任务奖励拓扑不均衡。
提出HDPO强化学习框架,解耦准确率与工具效率奖励,教会多模态智能体Metis“何时不用工具”。
把一致性与视觉接地作为硬约束的GRPO变体,让多模态推理既准又真。
Sol-RL 用 FP4 探索候选池,BF16 再生成关键样本,加速扩散 RL 4.64×。
HiLL:联合训练提示器与推理器,让 GRPO 在难题上找回学习信号。
两阶段RLVR框架联合训练推理和自我改进,无需外部监督信号
LLM 能否在含噪监督下学习鲁棒推理?
👍 43首次系统分析 RLVR 噪声标签机制,提出在线标签精炼方法 OLR。
多智能体RL系统,首次在3场Codeforces现场赛中击败所有人类选手夺冠