对数概率奖励在可验证和不可验证领域均为CoT训练提供统一信号
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
将多智能体辩论的推理能力蒸馏到单个LLM,提升推理效率
提出950道高难度多轮幻觉基准,揭示前沿LLM仍存在约30%+的幻觉率
视频原生推理重排序器,两阶段训练实现31% nDCG@10提升
首个百万级全合成隐私数据集,4B模型超越GPT-5
多智能体框架+仓库反向翻译自训练+全栈评测基准,解决LLM生成网站缺失后端的问题
评测基准,隔离视觉知识与推理,评估MLLM的实体识别能力
基于MLLM的对象嵌入模型,用对象+IoU双token实现精细视觉理解与检索
通过在预填充阶段裁剪深层网络、在解码阶段保留完整模型,实现 1.37 倍加速且精度几乎无损
SimpleNorm在线性映射后归一化,降低Hessian范数,学习率提升3-10倍。
通过实例级对比学习和分布级最优传输双粒度对齐,弥合大模型语义与推荐ID信号的异质性鸿沟
提出DAIL自蒸馏方法,通过分布对齐和对比学习将专家解法转化为可学习的推理轨迹
多尺度视觉裁剪+长程轨迹RL,突破多模态深度研究瓶颈
通过RMS一致性保留与非对称梯度解耦实现中期宽度扩展,节省35%训练成本
通过闭环优化同时优化环境、策略和奖励模型,实现LLM代理任务的显著提升
提出学生熵引导的多轴选择性知识蒸馏方法SE-KD3X,在保持性能的同时大幅降低计算开销
通过递归压缩轨迹为结构化状态表示,实现跨轮次经验复用,突破ReAct线性框架的探索瓶颈
用强化学习训练LLM进行分治推理,在竞赛级数学任务上超越链式思维推理
轻量级生成式提示预测模型实现跨提示难度泛化,加速RL后训练
将推理链渲染为图像来引导VAE框架下的潜在推理,实现高效压缩且超越显式CoT