把每篇论文改造成可验证训练环境,双阶段利用评分标准进化科研计划生成能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
把执行轨迹建成状态图,定位首个偏离断点,仅对恢复段做局部监督的自蒸馏框架
让仓库自合成 Issue 并蒸馏项目专属技能,破解 SWE 智能体冷启动
让特权状态按需介入自蒸馏,使编辑后的LLM能拆分新知识并组合多跳推理
用递归贝叶斯信念更新为长程智能体RL做回合级信用分配
首个支持用户与世界内角色进行社交互动的视频世界模型
面向智能体强化学习自蒸馏的持久一致性方法
👍 38按教师信号的局部持久性,为每个 token 分配自适应蒸馏权重。
用工具执行结果构造轮次级多视野事后监督,自适应调制强化学习优势。
将特权偏移重解为反事实敏感度,重分配 GRPO token 信用以提升长链推理。
把在线自蒸馏视为β=1的KL正则化策略优化特例,借logit插值与回报到当前信贷分配改进推理
视觉对比自蒸馏
👍 48用原图与擦除图像的预测对比构造自蒸馏目标,无需外部教师或答案提示。
用持久的世界状态寄存器让多智能体视频世界模型保持跨视角一致性
H2SD:混合后见自蒸馏
👍 7按轨迹正确性分流的混合自蒸馏框架,统一RLSD稳定优化与OPSD方向纠正。
构建可验证的离线维基百科环境,让搜索智能体自蒸馏迭代进化。
用像素对扭曲流场从图像编辑样本实时生成视频编辑训练数据
用理论ground库与自蒸馏让模型在用户母语中做文化适配的道德推理。
dOPSD:扩散语言模型在策略自蒸馏方法
👍 16从扩散解码轨迹中自生成特权信息,实现dLLM的有效在策略自蒸馏
SDPO在专业化任务上表现强劲但持续学习中易遗忘
TAPO通过构建微观反思轨迹,让模型从自己的错误中学习,在数学推理任务上显著提升表现
通过分离感知和推理阶段的教师监督,解决多模态自蒸馏中的答案捷径问题