← 前一天
2026-07-29
后一天 → 今日

在学生推理出错处让老师短暂接管再交还,修复在线策略蒸馏的前缀失败

Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu,...
在线策略蒸馏 大模型训练 推测解码 推理 知识蒸馏

实时相机可控的视频世界模型,支持图像与视频条件的长程交互探索

Jiacong Xu, Hanwen Jiang, Zhixin Shu, Kalyan Sunkavalli, Vishal M. Patel, Yiqun Mei
实时生成 模型蒸馏 相机控制 稀疏注意力记忆 自回归生成

用图像编辑模型改造任务图片,系统提升视频模型视觉推理能力

Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer, Neha Kalibhat, Zi Wang, Mani...
图像编辑 提示工程 测试时扩展 真实感偏差 视觉推理

训练并行解码器,用单次前向同时预测多个去噪步的速度,实现少步、高质、高多样性的扩散与流模型蒸馏。

Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner
图像生成 少步采样 扩散蒸馏 流匹配 视频生成

让RL真正学会写更快的正确代码:从测试、沙箱、奖励到GRPO全链路改造。

Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoit Sagot, Gabriel Synnaeve
GRPO RLVR 代码优化 强化学习 竞赛编程

用模型定向重建目标把预训练LM混合的策略解耦成策略对齐的潜在变量

Awni Altabaa, John Lafferty
变分推断 推理策略 模型可解释性 潜在变量模型 策略发现

用 Stiefel 流形优化与稳健投影追踪绕开 CPCA 协方差秩亏瓶颈。

Yu-Hsi Chen, Abd-Krim Seghouane
Stiefel流形 公共主成分分析 域不变特征 域泛化 投影追踪