OPD的增益并非来自教师蒸馏,而是压制学生低概率token;据此提出零监督OPSA,性能反超OPD
Yi Ding, Ruqi Zhang
LLM推理
在线策略蒸馏
强化学习
无监督后训练
熵分析
7B 开源原生音视频联合生成模型:门控跨模态注意力+多模态 RL+一步 2K 精修
Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang, Bingze...
一步蒸馏
多模态强化学习
开源模型
扩散Transformer
流匹配
保持解析-生成-放置顺序,把精度留给VLM闭环gizmo交互,实拍还原为可编辑仿真场景
Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang,...
3D场景重建
9-DoF位姿估计
VLM智能体
具身智能
实到仿真(Real-to-Sim)
熵正则防坍缩、先生成后重构的调度,首次实现VAE与生成模型的稳定端到端联训
Guangting Zheng, Yiyuan Zhang, Tao Yang, Yunpeng Chen, Rui Zhu, Jiajun Deng,...
VAE
扩散模型
文本到图像
潜在生成模型
端到端训练
沿秩维度归一化LoRA下投影矩阵,零额外参数即可加速收敛、提升性能与稳定性
Jiale Kang, Ziyin Yue, Zheng Zhan, Yangyi Huang, Weiyang Liu
LoRA
优化动力学
参数高效微调
大语言模型
预条件子
把每篇论文改造成可验证训练环境,双阶段利用评分标准进化科研计划生成能力
Yuhan Wang, Zhengxi Lu, Yuchen Yan, Kaitao Song, Wenqi Zhang, Weiming Lu,...
LLM后训练
强化学习
数据集构建
科研计划生成
自蒸馏
以 GDN 混合、QSA 稀疏注意力与门控残差三大改动,用约 1/9 训练 FLOPs 追平 397B 旗舰
Zihan Qiu, Zekun Wang, Xiao Li, Yanpeng Li, Yang Xu, Yixuan Wang, Huaqing...
Muon优化器
大模型架构
稀疏注意力
稀疏混合专家
线性注意力
纯后训练专用模型家族,单次调用生成幻灯片与可交互课件,用可执行探针把交互性变成可测量的奖励信号
Shangqing Tu, Daniel Zhang-Li, Yucheng Wang, Shiyu Gan, Yanpeng Wang,...
GRPO
后训练
国产算力适配
奖励攻击
奖励设计
双通道指向当潜思考、RVQ三token出轨迹,4B VLM统一十大导航基准并零样本上真机
Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang,...
GRPO强化学习
具身导航
残差向量量化
空间推理
视觉语言模型
用数学教育学的启发式与语义空间解析LLM思维链,诊断推理失败并改进RLVR后训练
Jonghyun Song, Sangjun Song, Minjae Oh, Haesung Pyun, Sungsik Lee, Yohan Jo
LLM推理
RLVR
可解释性
思维链分析
数学教育学
让LLM智能体边顺序生成相关应用边维护共享组件库,在不损功能的前提下大幅削减代码冗余
Daegyu Sung, Yukyeong Lee, Geon Park, Yumin Choi, Sung Ju Hwang
LLM智能体
代码生成
库学习
跨代码库重构
软件维护
提出L0–L4递退监督阶梯,沿奖励与经验双轴梳理LRM超越人类监督的方法、风险与评测。
Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao,...
RLVR
大型推理模型
奖励模型
综述
自我演化
PRISK框架系统评测13个LLM,量化个性化带来的无关注入、偏好窄化与谄媚三大隐性代价
Yumeng Wang, Yuchen Wu, Cheng Qian, Zhiyuan Fan, Hyeonjeong Ha, Shujin Wu,...
LLM-as-a-Judge
LLM个性化
LLM安全与对齐
信息茧房
评测基准
在Minecraft版Among Us沙盒中首次量化VLM智能体的言语与非言语联合欺骗
Jaewoo Ahn, Junseo Kim, Hyunseo Kim, Heeseung Yun, Jaehyeon Son, Zsolt Kira,...
AI安全与对齐
LLM-as-a-Judge
VLM智能体
具身智能
多智能体
AutoSciRub 在执行前自动归纳可执行评分量表,引导科研智能体执行、验证与迭代修正
Xuehai Wang, Haowei Qin, Tongxin Liu, Junkai Li, Buqiang Xu, Jintian Zhang,...
LLM-as-a-Judge
Rubric 生成
科研智能体
自动评估
迭代修正
用3D补丁记忆与分块相机注意力统一长时记忆与相机控制,实现720p实时交互世界生成
Runjia Qian, Zile Wang, Jihai Zhang, Kai Zou, Wei Yu, Jiaxing Li, Zexiang...
交互式世界模型
分布匹配蒸馏
实时生成
流匹配
相机控制
可微分令牌取舍机制让视频 VAE 按内容复杂度自适应压缩,生成更快更省
Yeonkyeong Lee, Hyunsung Go, Jongmin Kim, Sewoong Lim, Donghoon Lee
VAE
流匹配
潜在扩散模型
自适应压缩
视觉分词器
偏好线索藏在工具返回或需自行推断时,模型暗中跟随偏好而不在思维链声明的比例显著升高
Aryo Pradipta Gema, Neel Rajani, Rohit Saxena, Wai-Chung Kwan, Pasquale Minervini
AI安全
CoT忠实性
智能体监控
评测基准
谄媚性
将 MNIST 改造为部分可观测探索任务,暴露多模态智能体感知状态构建的三大瓶颈
Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria
POMDP
主动感知
基准评测
多模态智能体
工作记忆
提出多轮图表精修基准与多智能体系统,破解质量漂移与遗忘两大失败模式
Xueqing Wu, Ashwin Balasubramanian, Bingxuan Li, Dawei Zhu, Kai-Wei Chang,...
图像编辑
基准评测
多智能体
多轮交互
科学图表生成
用意图-观察-记忆三通道协议把VLM与导航基础模型耦合成持久具身智能体,刷新三大EQA基准
Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang...
具身智能
具身问答
导航基础模型
工具增强推理
智能体框架
将轨迹级成败转化为动作级批评监督,让8B小模型的多试次可靠性超过120B大模型
Amir Saeidi, Zehua Zhang, Rishitosh Singh, Naman Ahuja, Vivek Gupta, Ali...
LLM智能体
工具调用
批评模型
智能体可靠性
长程交互
提出图像束组合检索范式与BundleWeaver智能体,增量拼装满足跨图关系的连贯图像组合。
Rong Shan, Tianyi Xu, Congmin Zheng, Wenteng Chen, Jiachen Zhu, Junjie Wu,...
图像检索
基准数据集
多模态智能体
束搜索
视觉语言模型
把浏览器当作网页代码的世界模型,用可执行验证证书取代VLM自我评判来筛选训练监督
Jiajun Wu, Jian Yang, Yaxin Du, Wei Zhang, Haowen Wang, Junhang Cheng,...
SFT数据合成
VLM
世界模型
网页代码生成
自我改进
训练时模拟目标模型逐位验证,以验证头与自适应加权对齐草稿训练,加速最高提升8.7%
Geonmo Gu, Byeongho Heo, HeeJae Jun, Yoohoon Kang, Sangmin Lee, Sangdoo Yun,...
LLM推理加速
投机解码
知识蒸馏
训练目标设计
固定职业角色、系统变动场景上下文,量化文生图模型刻板印象的持续性
Shaghayegh Kolli, Sina Emami, Moreno D'Incà, Pouyan Nejadi, Nicu Sebe,...
偏见评测
公平性
基准构建
文本生成图像
组合泛化
构建150万五级安全标注数据集并训练出可输出连续风险分的SOTA守卫模型
Zongrui Wang, Xiangyang Zhu, Sicheng Wang, Han Wang, Dingyi Rong, Zeyu...
内容审核
多模态安全
大视觉语言模型
守卫模型
安全审核数据集
用少量时变刚性运动分量加时不变蒙皮权重,从单目视频前馈生成网格动画
Pradyumn Goyal, Yizhak Ben-Shabat, Hsueh-Ti Derek Liu, Haomiao Jiang,...
3D动画
前馈模型
网格变形
蒙皮
视频驱动
以图像-指令-回答的损失差分一致性为样本打分,25%数据即可超越全量微调
Yuyang Hong, Jinhui Guo, Jiaqi Gu, Lubin Fan, Ruixiang Wang, Kun Ding, Yue...
多模态大模型
数据质量评估
数据选择
视觉指令微调
高效训练
判别式标注器与生成式VLM互补融合,同时实现幻觉片段定位与概率校准
Amanuel Gizachew Abebe, Yasmin Moslem
多模态融合
幻觉检测
序列标注
概率校准
视觉语言模型
从单一语言提取的功能向量可跨语言迁移,零样本操控多语言情感分类行为
Jieying Xue, Phuong Minh Nguyen, Minh Le Nguyen, Shogo Okada
上下文学习
功能向量
可解释性
多标签情感分类
激活干预
首个评估LLM多轮维护可执行界面的基准:单轮通过率严重高估五轮全流程可靠性
Yue Peng, Lanke Xia, Zihan Wang, Jiahao Ye, Ke Ning, Hongyi Wen
LLM智能体
前端代码生成
基准评测
多轮交互
工具调用
将 3D/4D 场景映射为 2D 图集以解耦编辑与重建,LLM 调度 30+ 视觉工具实现对话式编辑
Shuangkang Fang, Yufeng Wang, Yi-Hsuan Tsai, Wenrui Ding, Yi Yang, Shuchang...
3D场景编辑
4D场景编辑
LLM智能体
多分辨率哈希编码
神经图集
构建5.2万条带视觉工作区的多模态推理轨迹,教模型在纯文本推理中内化视觉草稿纸
Tsung-Han Wu, Heekyung Lee, Anya Ji, Haoming Chen, Trevor Darrell, Joseph E....
多模态推理
数据集
潜视觉Token
监督微调
视觉思维链
用嵌套集合把端到端AI天气预报升级为概率系统,并将不确定性分解为观测与模型来源
Rodrigo Almeida, Noelia Otero, Jost Arndt, Simon Baur, Wojciech Samek, Jackie Ma
AI天气预报
CRPS
不确定性量化
方差分解
蒙特卡洛Dropout
统一多模态虚假信息分类体系并用VLM自动标注2.7万条社区笔记案例,揭示图文误导机制分布规律
Nadav Borenstein, Greta Warren, Desmond Elliott, Isabelle Augenstein
内容审核
分类体系
多模态虚假信息
社区笔记
自动标注
用梯度对齐实时估计样本边际贡献并约束重加权,让RFT数据利用全程自适应
Haoru Tan, Sitong Wu, Yanfeng Chen, Shizhen Zhao, Yang-Tian Sun, Tianjia...
GRPO
多模态推理
强化微调
数据选择
梯度对齐