键盘可控、单卡实时的视频世界模型,可连续推演数十小时
Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang, Yunpeng Zhang,...
世界模型
交互式仿真
动作控制
实时推理
扩散蒸馏
引导智能体构建平台原生可编辑 DAG 数据流水线,弥合 NL2Pipeline 鸿沟。
Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen, Xiaochen Ma,...
Claude Code
DAG
LLM Agent
MCP
工作流合成
把离线扩散渲染器蒸馏成4步自回归流式模型,实现30FPS实时交互渲染。
Guixu Lin, Zheng-Hui Huang, Siqi Yang, Ming-Hsuan Yang, Kaipeng Zhang, Zhixiang Wang
G-buffer渲染
世界模型
实时推理
扩散蒸馏
生成式渲染
Chat模板token是DiT的隐式语义寄存器:语义走S→I→R间接回路,据此剪枝省20%注意力算力
Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi, Chao Xu, Cuifeng...
可解释性
扩散模型
文本到图像生成
模型加速
注意力机制
4B 紧凑栈协同设计 tokenizer、骨干与系统,达成原生分辨率文生图与指令编辑的高效折中。
Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia, Yifei...
VAE
原生分辨率
图像编辑
强化学习对齐
扩散Transformer
基于15B扩散Transformer的交互式长时程世界模型,蒸馏至4步实现低延迟生成
AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge,...
3D记忆
世界模型
扩散Transformer
自回归生成
蒸馏加速
扩散语言模型内部潜藏去噪进度信号,可被探针读取与因果引导
Maximo Eduardo Rulli, Thomas Vaitses Fontanari, Simone Petruzzi, Federico...
扩散语言模型
机制可解释性
潜在引导
激活探针
表示几何
SAT让PPO裁剪半径按批次内陈旧度自适应收缩,稳定异步RL训练
Junyao Yang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Ruhan Wang, Xiangxin...
MoE训练
PPO裁剪
信赖域
大模型RL
异步强化学习
把智能体调试组织为检测-归因-恢复-重跑闭环,DeepDebug多轮根因诊断刷新归因SOTA
Kunlun Zhu, Xuyan Ye, Zhiguang Han, Yuchen Zhao, Bingxuan Li, Weijia Zhang,...
LLM智能体
开源工具
故障归因与调试
智能体可靠性
三轴解构+联合偏好优化,让开源模型逼近商用图模型
Yuxuan Luo, Peng Zhang, Xinjie Zhang, Xun Guo, Zhouhui Lian, Yan Lu
偏好优化(DPO)
图文渲染
扩散模型后训练
科学图像生成
结构保真
用层级并行解码范式重构文档解析,吞吐量达4752 TPS。
Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan,...
vLLM
多token预测
并行解码
推理加速
文档解析
用结构化元评分准则自动编译成二元检查表,评测长文本生成的事实完整性
Xilun Chen, Zhaleh Feizollahi, Ross Goodwin, Seungwhan Moon, Scott Yih,...
LLM-as-a-Judge
事实性评测
多模态基准
评分准则评估
长文本生成
用智能体搜索可执行的文档表示程序,固定BM25下8个检索任务召回率平均提升8.4%
Sam O'Nuallain, Nithya Rajkumar, Ramya Narayanasamy, Hanna Jiang, Shreyas...
LLM智能体
RAG
信息检索
程序合成
自动优化
复用基模型权重奇异谱、仅优化奇异框架的 RLVR 原生优化栈
Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David...
RLVR
优化器
奇异值分解
强化学习
推理能力
用像素空间掩码轨迹作为视频模型动作接口,单模型兼顾正/逆世界模型。
Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang,...
LoRA微调
世界模型
掩码条件生成
机器人操控
模型规划
按轨迹正确性分流的混合自蒸馏框架,统一RLSD稳定优化与OPSD方向纠正。
Qiye Cai, Yichuan Ma, Linyang Li, Peiji Li, Yongkang Chen, Qipeng Guo,...
信用分配
可验证奖励RLVR
大语言模型推理
强化学习
自蒸馏
用轨迹几何调制统一视频/文本跨视角地理定位,引入SeqGeo-VL数据集。
Tianyi Gao, Jiayu Lin, Danielle Beaulieu, Nathan Jacobs
CLIP
VLM标注
跨模态检索
跨视角地理定位
轨迹几何
按参数角色分层分配优化器状态,省 97% 显存且不掉精度
Nuemaan Malik
Adam
优化器
大模型训练
显存优化
混合专家模型
用模式标签把转录风格变成显式可控参数,零样本激活逐字转录能力
Laurin Wagner, Mario Zusag, Bernhard Thallinger
Whisper
不流利检测
交叉注意力对齐
词级时间戳
语音识别
以数据治理标签噪声的全球农田边界勾绘基础模型,性能翻倍。
Mykola Lavreniuk, Nataliia Kussul, Andrii Shelestov, Yevhenii Salii,...
农田边界勾绘
地理空间AI
实例分割
数据驱动学习
标签噪声治理
在开源Gemma模型中读出材料科学概念、追踪本构取向的状态变换并因果调控工程决策
Markus J. Buehler
Gemma
Jacobian lens
因果干预
大语言模型
机制可解释性
多模态三智能体评判器,结合学习者画像评估教学视频,达专家水平并辅助审校
Jia-Kai Dong, Yi-Cheng Lin, Hung-yi Lee
LLM-as-Judge
人机协作
多智能体系统
多模态评估
教育评估
用紧凑指针 token 把图文条件精确路由到 DiT 的指定空间区域
Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha
Diffusion Transformer
FLUX
可控图像生成
图像编辑
多模态区域控制
系统综述多模态幽默理解的能力层级框架与三大建模范式,揭示识别到解释的能力鸿沟。
Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin
MLLM
多模态幽默
梗图理解
综述
跨模态推理
以几何一致性组织视频证据并自监督强化跨视角稳定性,平均提升12.6分
Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang
LoRA微调
VGGT
几何一致性
几何记忆
多模态大模型