把游戏开发变成“引擎检查+人类验收”的可验证奖励环境,驱动世界模型自我改进
Pengfei Zhou, Hexin Wang, Zhengfeiyang Zhang, Yixing Ma, Zhenglin Wan,...
世界模型
具身智能
可验证奖励
强化学习
智能体
视频模型能生成合理的单条未来,却难以复现同一条件下可能未来的正确分布。
Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević,...
世界模型
分布对齐
概率校准
视频生成
评测基准
把真实香港搬进物理仿真沙盒,测出多模态智能体“认得出却走不到”的城市行动能力断层。
Tianjie Ju, Zheng Wu, Yueqing Sun, Yuhan Cui, Bobo Li, Shengqiong Wu,...
具身智能
城市导航
基准与评测环境
多模态大语言模型
智能体评估
利用伪标签错误的非对称性,无标签地将自蒸馏与RL惩罚结合于测试时训练
Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun...
LLM推理
在线策略自蒸馏
强化学习
无标签学习
测试时训练
用学生自身SDE分支探索替代教师目标,免教师实现流匹配模型的密集逐步蒸馏对齐
Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou, Jinlong Liu,...
在线策略蒸馏
多目标优化
强化学习对齐
文本到图像生成
流匹配
用统一数据对象 (E,q,τ,v) 与 ACE 框架把智能体数据生成重构为受限分布设计
Xingshan Zeng, Zishan Xu, Boju Zhang, Yuzhou Wu, Lingzhi Wang, Jianghao Lin,...
LLM智能体
后训练
数据生成
数据质量
综述
提出HAT训练法,让紧凑模型学会理解不断演化的Harness配置,兼顾低延迟与业务敏捷迭代。
TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu,...
Agentic RL
Agent训练
低延迟部署
在线策略蒸馏
数字人直播
首个统一生成未来画面与键鼠动作的游戏世界动作模型,并发现LASI失效模式
Yuncheng Guo, Zhanqiu Zhang, Yiwen Guo, Weijia Li
LASI
世界动作模型
流匹配
游戏智能体
生成式动作生成
监督者-工作者架构让智能体在执行中实时纠偏并把经验沉淀为可复用技能
Yang Xiao, Yusong Sun, Haoyi Wu, Wenyang Hui, Wen Da, Zhaokai Luo, Mu Chuan,...
智能体
监督者-工作者架构
自我改进
长程任务
把智能体经验编译进永不回滚的Wiki知识库,与技能协同进化,全面超越现有技能进化方法
Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan, Tu Vu
技能进化
持久知识库
智能体
经验复用
自我改进
以人类视频为上下文提示,让机器人零样本完成训练中从未见过的操作任务
Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang,...
上下文学习
世界动作模型
机器人操作
机器人数据集
视频生成
进化策略比GRPO推理覆盖更广:升Pass@1同时保住Pass@K,大参数漂移不等于灾难性遗忘
Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong,...
GRPO
LLM推理
Pass@K
后训练
强化学习
体素化多模态PBR高斯+整流流Transformer,单图生成可重光照3D资产
Mayank Singh, Michele Stoppa, Alvise Memo, Rui Yu, Harsha Kalli, Srimanth...
3D高斯泼溅
PBR材质
图像转3D
整流流
生成式3D
让冻结LLM把3D物体写成带类型化配合的程序化装配代码,无需3D训练
Youtian Lin, Yikang Yang, Zhanpeng Hu, Mengqi Zhou, Feihu Zhang, Xun Cao,...
3D生成
CAD
LLM智能体
代码生成
程序化建模
游戏引擎管规则与状态,生成模型只管画面,白盒帧驱动的实时游戏渲染系统
Xiaoyu Zhan, Xinyu Wang, Xiaohong Zhang, Huanjie Zhu, Tengjiao Sun,...
交互式世界模型
实时视频生成
扩散模型蒸馏
游戏渲染
生成式渲染
把小模型的结构化失败模式做成批判式示例库,单次生成即提升大模型推理
Yufan Wu, Yinghui He, Zhengyi Hu, Lang Wei, Ruichen Li, Qifan Yang, Ting Zhu
LLM推理
上下文学习
失败模式
弱到强泛化
推理时扩展
让VLM先生成因果推理图代码再作答,幽默理解提升1-20%
Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin...
因果推理
多模态
幽默理解
提示工程
视觉语言模型
让VLA逐块流式生成动作并实时注入触觉反馈,消除执行中的触觉时间错配
Jianbo Zhou, Boyuan Zhao, Yuzheng Zhang, Yiyang Chen, Wenxin Chen, Qiuyue...
Flow Matching
VLA
机器人操作
流式生成
触觉感知
提出MMLVE任务,用全局记忆卡与正负反馈智能体实现多指令多镜头长视频无幻觉编辑
Chenyang Wu, Fuchen Long, Binyuan Huang, Xinlong Sun, Xi Chen, Chun-Le Guo,...
LLM-VLM协同
多智能体
视频编辑
跨镜头一致性
长视频
用删除/替换/重排三个反事实探针在检索前校准技能图边置信度,让智能体拿到可执行的技能包
Zhiyuan Li, Linyuan Gao, Xuechun Ding, Hongwei Chen, Yuan Wu, Yi Chang
LLM智能体
反事实推理
因果校准
图检索
技能检索
把图像动画模型改造成实时流式角色视频编辑器,两步采样实现14.47 FPS直播级编辑
Zhiyuan Li, Chi-Man Pun, Peng-Tao Jiang, Bo Li, Xiaodong Cun
实时流式生成
扩散蒸馏
视频编辑
角色动画
用直接推理、实际编辑、理想参考三条件对照,测出图像编辑中间态在20个任务上的效用边界
Hengyuan Xu, Wei Cheng, Yumeng Ji, Xuanyang Zhang, Xianfang Zeng, Gang Yu, Xingjun Ma
多模态大语言模型
指令图像编辑
智能体自动化
生成式推理
视觉思维链
对124个Inspect评测做声明重放普查:110个显式停止,14个可重放,胜者常比排名更稳健。
Xi Qin
元科学
可复现性
基准测试
敏感性分析
评测方法