用参考答案引导的对比概率差作为token级正确性信号来塑形RLVR优势
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
把完成轨迹的事后技能蒸馏回策略,实现自进化密集监督。
揭秘在线策略蒸馏:角色、病理与调控
👍 20系统揭示OPD的探索催化本质,诊断信号失真病理,用零开销信号调控修复训练不稳定
0.8B端到端文档解析模型,靠数据引擎+多组件RL奖励+策略蒸馏刷新多项OCR榜单
用从短到长的在策略自蒸馏恢复结构化剪枝后崩溃的生成能力。
通过直接在策略蒸馏实现由弱到强的泛化
👍 129Direct-OPD:用小模型RL的策略位移当隐式奖励,低成本提升更强的学生模型
信任区域策略蒸馏
👍 32通过动态构造近端教师解决OPD优化不稳定性,零计算开销实现数学推理性能大幅提升
OPSD-V通过真实长视频上下文进行缓存感知的在线策略自蒸馏,提升少步自回归视频生成的长视距稳定性
395次实验揭示地球观测模型缩放规律,蒸馏出高效嵌入产品
TREK:蒸馏以探索、强化以精炼
👍 8TREK扩展GRPO探索支持,提升数学和Agent性能
通过上下文空间和参数空间双重蒸馏,将大模型的过程式记忆能力迁移到小模型,实现边缘设备部署
DOPD:双重在线策略蒸馏
👍 104通过优势感知的动态双蒸馏缓解特权幻觉问题,显著提升LLM和VLM的蒸馏性能
通过多教师在线策略蒸馏实现LLM多领域能力集成
通过扩展智能体视野和领域路由蒸馏,35B模型达到万亿参数性能
异步OPD中陈旧数据影响分析与高效训练流水线
通过全量微调与知识蒸馏结合WISE-FT权重插值,解决时尚检索中领域适应与泛化的权衡问题
DanceOPD:在线策略生成场蒸馏
👍 81通过硬路由和单查询场匹配,实现多能力图像生成模型的统一蒸馏
通过学生-教师概率比识别高价值负样本轨迹,提升 LLM 策略蒸馏效果
首次系统性研究10种非语言声音的说话人识别,提出条件蒸馏和MoE架构解决领域失配问题
用主题元数据引导粗粒度检索,实现高效精准的段落级 RAG 系统