Lean 4 高效开源证明器家族:4B 模型以 167× 参数优势反超 671B 基线
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
世界模型自蒸馏:训练世界模型解决通用任务
👍 15通过自蒸馏和VLM反馈将视频扩散模型转为指令跟随的任务求解器
提出 Feedback Distillation 方法,改进定理证明训练
反馈对齐在自蒸馏中的作用
👍 3研究反馈结构对自蒸馏效果的影响,发现步骤对齐的反馈显著优于二值奖励和参考解
TRD通过轨迹级修正解决OPD前缀失效问题
提出 DistIL 算法,通过前向交叉熵和序列级信用分配解决自蒸馏方法的单调性缺陷
自蒸馏策略梯度
👍 28把全词表自蒸馏与RLVR奖励统一为策略梯度,稳定提升LLM推理性能。
让MLLM学会何时调用、验证、信任世界模型的视频推演来预测未来。
将dLLMs的RL转化为去噪器自蒸馏,避免ELBO似然度替代的TIM偏差
用全轨迹后视分析挑选失败步骤,仅在相关动作片段做反馈条件蒸馏。
RTPurbo 用低维索引与动态 top-p,仅数百步训练把全注意力改造为近无损稀疏注意力。
用两个互补自蒸馏教师逼向效用与隐私的交集,无需外部监督即可兼顾两者
基于变分策略蒸馏的语言反馈学习
👍 12提出变分策略蒸馏(VPD)框架,通过EM算法让教师与学生协同进化,解决RLVR稀疏奖励问题
基于点互信息的推理强化学习反自蒸馏方法
👍 196AntiSD通过反转自蒸馏梯度方向解决推理RL的捷径偏置问题
用正反答案对比信号解决 RLVR 中 token 级信用分配难题
训练后 MoE 可通过自蒸馏跳过一半专家
👍 30通过零专家注入与两阶段自蒸馏把 post-trained MoE 转成 dynamic MoE
通过混合模型自身的专家和朴素条件分布,实现无灾难性遗忘的知识注入方法
门控自蒸馏 OPSD,稳健提升多轮 LLM 智能体 RL 训练。
ATESD:用 Beta 策略控制器把教师暴露比例变成可学习变量,动态调节特权 CoT 的可见量。
OmniClean 去偏评测加 OmniBoost 三阶段后训练,3B 模型可比肩 30B