← 前一天
2026-07-14
后一天 → 今日

Direct-OPD:用小模型RL的策略位移当隐式奖励,低成本提升更强的学生模型

Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng...
后训练 弱到强泛化 强化学习RLVR 知识蒸馏 策略蒸馏

快慢双系统VLN基础模型,统一五大导航任务并刷新城市级导航SOTA

Ruiyan Gong, Yingnan Guo, Junjun Hu, Jintao Kong, Xiaoxu Leng, Tianlun Li,...
具身智能 导航基础模型 强化学习后训练 快慢双系统 视觉语言导航

解析证明对比学习最优表示是测部分频率并做白化,可用正弦滤波器单层CNN实现。

Antonio Torralba, Yair Weiss
傅里叶分析 可解释性 对比学习 自然图像统计 表示学习理论

在冻结的个性化编码器隐空间中发现编辑方向,实现跨提示词一致的细粒度身份微调

Daniel Garibi, Ronen Kamenetsky, Hadar Averbuch-Elor, Daniel Cohen-Or, Or Patashnik
Q-Former 人脸属性编辑 文生图个性化 身份编辑 隐空间语义控制