剖析OPD/OPSD成败,提出三类失败机制与对应稳定化修复。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
反转自蒸馏信号,放大正确 rollout 中模型自驱推理的 token
用同一模型的双角色自蒸馏,将英语推理能力迁移到17种低资源非洲语言。
让步数蒸馏扩散模型持续学习新概念而保持少步推理能力
为什么微调会诱发幻觉以及如何修复
👍 25把 SFT 幻觉重新解读为事实遗忘,并给出参数冻结与自蒸馏两类缓解方案。
让模型自己当老师,把稀疏二元奖励转成稠密 token 级自监督。
通过样本路由统一组相对和自蒸馏策略优化
👍 32SRPO将正确样本路由到GRPO、失败样本路由到SDPO,实现早期效率和长期稳定性的双重优势
自蒸馏只控更新幅度,环境奖励锚定方向
令人惊讶简单的自蒸馏改进代码生成
👍 56LLM仅通过训练自己的原始输出即可大幅改进代码生成能力
自蒸馏通过压制不确定性表达损害数学推理泛化
训练时用自适应视觉提示引导模型学习时空定位,推理时无需额外工具
用学生通过率作为权重,按 w(p)=p(1−p) 把蒸馏梯度集中到恰能学会的题目上
诊断MLLM图文模态鸿沟根因,提出自蒸馏方法弥合差距
LaSER通过自蒸馏将显式CoT推理内化到LLM检索器潜在空间,兼顾性能与效率。
轨迹自蒸馏+DDO目标函数,让扩散语言模型用更少步骤生成高质量文本
通过自蒸馏和多样性感知强化学习,解决大推理模型在复杂工具使用中的懒惰推理问题
提出DAIL自蒸馏方法,通过分布对齐和对比学习将专家解法转化为可学习的推理轨迹
通过拒绝引导激发模型内生安全知识,无需外部教师实现安全对齐
通过解耦训练和非对称自蒸馏稳定大语言模型自我进化,无需人工标注实现10.9点平均提升