首个用强化学习做相机控制视频重拍的框架,用度量3D评估器约束相机轨迹精度。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
多模态学习
具身智能
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
多模态大语言模型
可解释性
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
把视觉感知、文本推理、视觉推理拆成三个独立阶段做后训练,VLM 的视觉推理准确率涨、推理链还变短了。
把RLVR更新视为token梯度上的线性判别器,用判别式系数重塑正负质心。
首个面向真实 Excel 的端到端强化学习框架,让开源 4B 模型表格任务通过率近乎翻倍。
无监督过程奖励模型
👍 27无需标注或真值验证,用LLM下一token概率自蒸馏训练过程奖励模型
训练4B RL编排器动态组合专家模型与层次技能,平均70.1%超越GPT-5
提出工具编排视觉经验蒸馏,让图像生成智能体自我进化。
通过自调节模拟规划实现高效智能体推理
👍 11自调节模拟规划让30B智能体以更少token匹敌1T模型
把难题拆成可验证子问题序列,用子问题级信用分配强化LLM推理
大规模复合声学仿真+双粒度WER门控强化学习实现鲁棒ASR。
用工具增强的智能体框架与门控强化学习实现零样本工业异常检测新 SOTA
RLVR权重更新呈秩-1线性结构,RELEX仅用15%训练步外推未来检查点
提出可扩展、可验证的规划数据生成框架,用于评测与训练LLM的规划能力。
扩散模型对齐的缝合价值模型
👍 12通过缝合技术将像素空间奖励模型高效转移到噪声潜在空间,实现快速准确的扩散对齐
基于变分策略蒸馏的语言反馈学习
👍 12提出变分策略蒸馏(VPD)框架,通过EM算法让教师与学生协同进化,解决RLVR稀疏奖励问题
提出生成式记忆策略,让LLM智能体学会何时需要记忆辅助以及如何生成任务相关指导
语言模型RLVR中的不可学习现象
👍 6揭示RLVR训练中存在反直觉的不可学习样例,代表模型表征的根本性缺陷。
揭示 DPO-RLHF 等价性的隐含假设及其失效模式,提出 CPO 保证偏好对齐
基于点互信息的推理强化学习反自蒸馏方法
👍 196AntiSD通过反转自蒸馏梯度方向解决推理RL的捷径偏置问题
用 9 类任务、9 种奖励的 23K RLVR 数据集和 TMN-Reweight 多任务优化算法,让 30B 模型长上下文能力逼近 R1-0528。