在固定 GPU 预算下让 GRPO 训练跑到 2M+ token 上下文
Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang,...
GRPO
MoE
分布式训练
强化学习后训练
显存优化
全开源4B视频大模型,以3D视觉编码与自适应帧分辨率实现高效通用理解
Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang,...
全开源
指令微调
时序定位
流式视频理解
视频多模态大模型
把完成轨迹的事后技能蒸馏回策略,实现自进化密集监督。
Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran...
事后学习
强化学习
智能体
知识蒸馏
自进化
将长程搜索状态外化为系统级共享状态,多智能体在两大基准全F1指标领先
Yuyao Zhang, Junjie Gao, Zhengxian Wu, Jiaming Fan, Jin Zhang, Shihan Ma,...
Agent基础设施
信息检索智能体
多智能体系统
工具集成LLM
搜索状态管理
提出世界-动作漂移攻击,让机器人想象正常却执行失败动作
Qi Li, Xingyi Yang, Xinchao Wang
世界-动作模型
具身智能
对抗攻击
机器人安全
黑盒攻击
首个多关键帧条件视频生成评测基准,含386样本、6项关键帧指标与4维质量评估。
Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su,...
关键帧条件生成
基准测试
多模态大模型评判
视频生成评测
音频-视频联合评估
首个面向多参考条件音视频生成的综合评测基准,含 350 个样本、四大维度十四项子指标
Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao,...
MLLM-as-a-Judge
参考一致性
多模态生成
视频生成评测
音频视频对齐
以游戏引擎的动作-状态-观测循环为框架重审交互式世界模型,并发布90小时悟空数据集
Zhen Li, Zian Meng, Shuwei Shi, Mingliang Zhai, Jiaming Tan, Chuanhao Li,...
交互式世界模型
数据集
游戏引擎
综述调研
视频生成
首个让文本与图像在同一步内互相纠正的并发扩散采样器
Minh-Quan Le, Armand Comas, Alexandros Lattas, Stylianos Moschoglou, Pedro...
remasking
图像编辑
多模态生成
离散扩散
视觉推理
首个无需语言监督、直接在视觉空间学习异构推理任务并配套 VR-X 基准的框架
Zhongwei Ren, Yunchao Wei, Yao Zhao, Weibo Gong, Xiao Liu, Anran Wang,...
GRPO
世界模型
多模态理解
强化学习
统一生成模型
统一语言推理与视觉想象,单模型端到端生成具身规划
Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu, Xiangli...
Mixture-of-Transformers
世界模型
具身智能
多模态基础模型
流匹配
将RL更新投影到预训练SVD谱子空间,提取紧凑推理核心并改善探索与跨域融合
Zhilong Zhang, Hongli Yu, Huan-ang Gao, Hanlin Wu, Yuxuan Song, Wei-Ying Ma,...
SVD
参数高效
强化学习后训练
推理增强
模型融合
Wan-Streamer v0.3 将视频分解为世界与事件流,实现通用预训练可迁移的实时音视频交互。
Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu,...
VLA
世界模型
多模态
实时音视觉
流式交互
系统揭示OPD的探索催化本质,诊断信号失真病理,用零开销信号调控修复训练不稳定
Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong
在线策略蒸馏
大模型后训练
强化学习
知识蒸馏
训练动力学
将测试时训练引入机器人策略,把视觉运动上下文扩展到8K时间步,解锁长程任务新能力。
Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy...
Fast Weights
Imitation Learning
Long-Context Policies
Robot Foundation Models
Test-Time Training
纯扩散端到端模型,单次生成5分钟多语种歌曲并直接分离人声与伴奏双轨
Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou
MMDit
双轨建模
强化学习对齐
扩散模型
流匹配
首个MeanFlow前向过程强化学习,用诱导瞬时速度预测器优化平均速度生成器。
Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang
MeanFlow
前向过程RL
少步生成
强化学习
扩散模型
为循环 Transformer 设计 p=1/2 的残差缩放规则,稳定权重共享下的深层训练
Shuzhen Li, Yifan Zhang, Jiacheng Guo, Quanquan Gu, Mengdi Wang
DeepNorm
初始化理论
循环Transformer
权重共享
残差缩放
用字节精确的 KV 状态嫁接,让冻结 12B 模型同时变强又变便宜
Sietse Schelpe
KV缓存复用
成本优化
推理时学习
旋转位置编码
无损状态嫁接
首个由盲人实拍、覆盖主动提醒/问答/交互三大任务的在线视频评测基准
Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu...
TPAD
在线视频
基准评测
多模态大模型
自我中心视频
用全概率公式检验 LLM 估计的统计自洽性,发现宏观谬误等系统性违反
Patrik Wolf, Thomas Kleine Buening, Andreas Krause, Celestine Mendler-Dünner
人格提示
全概率公式
分布对齐
大语言模型
条件推断
用非对称双分支解耦几何与外观,参数减30%、训练提速30%且零样本性能领先
Yingji Zhong, Dave Zhenyu Chen, Fuzhao Ou, Youyu Chen, Zhihao Li, Lanqing...
3D高斯泼溅
Mamba状态空间模型
可泛化前馈模型
新视角合成
稀疏注意力
为每个 token 分配独立的去噪进度时间,连续扩散在高加速比下超越离散方法。
Parikshit Bansal, Sujay Sanghavi
Diffusion LM
去噪策略
扩散语言模型
流匹配
蒸馏
重评harness演化,发现它不优于测试时扩展且泛化有限
Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen, Shakti...
LLM智能体
Terminal-Bench
harness演化
测试时扩展
评估方法
用强化学习训练智能体 RAG 协调语义检索、关键词检索与段落读取三类工具。
Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi,...
Agentic RAG
GRPO
上下文粒度
多跳问答
强化学习
弱监督大规模NOC特征学习+几何一致匹配,零样本CAD对齐首次超越全监督。
Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis...
CAD对齐
三维视觉
归一化物体坐标
机器人感知
特征学习
首个迭代式组件级 RAG 框架,将法规描述转为可执行 Scenic 场景脚本
Yuan Gao, Wenting Miao, Mattia Piccinini, Haoyu Wang, Qunying Song, Johannes Betz
CARLA仿真
DSL代码生成
RAG
Scenic语言
场景生成
用树状层级潜变量实现粗到细推理,兼顾多步规划与低延迟流式生成。
Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan...
Flow Matching
世界模型
多步视觉推理
层级去噪
机器人
局部感知加循环计算让视觉模型获得长度泛化能力
Pulkit Madan, Sanjay Haresh, Reza Ebrahimi, Sunny Panchal, Apratim...
OOD泛化
中央凹视觉
循环神经网络
状态跟踪
视觉推理