300个程序化视觉推理任务+可验证奖励评分器,让视觉生成成为可训练、可验证、可优化的推理媒介
Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou,...
交错生成
原生视觉推理
可验证奖励
基准测试
强化学习
27任务810实例的过程敏感基准:最强视频模型Seedance 2.0推理也仅51.0分
Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao...
VLM-as-Judge
基准评测
扩散模型
视觉推理
视频生成
左脑存事实右脑存情感,134毫秒流式检索让语音助手又快又懂你
Zhifei Xie, Jiaqi Lang, Ze An, Yifan Zhao, Dongchao Yang, Kai Li, Ziyang Ma,...
RAG
实时语音对话
情感计算
模型蒸馏
流式检索
300项端到端科学工作流基准,最强模型完整交付率仅20.6%
Liangcai Su, Zhaopeng Feng, Zhuo Chen, Zhen Zhang, Xiang Lin, Ruilin Li,...
AI Agent
基准
智能体评测
科学工作流
按数据体制匹配稳定器:SWD 全局启用,数据稀缺保留归一化与双Q,数据丰沛则移除二者。
Zihao Wu, Hongyao Tang, Yi Ma, Huizhong Song, Pengyi Li, Yifu Yuan, Fei Ni,...
GPU并行仿真
Sim-to-Real
可扩展训练
强化学习
机器人控制
训练一个元智能体,为每个任务即时生成、修复并进化专属 Agent 脚手架,显著放大固定底座模型能力
Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie,...
DPO
元智能体
强化学习
智能体脚手架
智能体评测
编程智能体用代码维护世界状态,代理视频驱动视频模型渲染高保真开放世界
Yiwen Chen, Guosheng Lin, Chi Zhang
世界模型
可控视频生成
开放世界
编程智能体
视频生成
把提示深度从单一标量改为在线估计的高斯分布,零额外采样实现每任务自适应引导
Zixuan Wang, Yanrui Miao, Zhengxi Lu, Teng Pan, Yiwen Qiu, Hongxing Li, Peng...
GRPO
奖励稀疏
智能体强化学习
课程学习
长视野任务
把训练中现成的逐域反向KL信号变成动态数据配比,零开销让多教师蒸馏更快更强
Zechen Sun, Zhiwei Zhang, Fei Zhao, Juntao Li, Mu Chuan, Huayu Deng, Guojian...
多教师蒸馏
大模型后训练
数据调度
知识蒸馏
定位多教师蒸馏的预算错配根因,三个机制把能力恢复率从35.6%提到83.4%
Huan-ang Gao, Haohan Chi, Yong Yan, Shiyuan Feng, Hanlin Wu, Zheng Jiang,...
LLM后训练
在线策略蒸馏
多教师蒸馏
强化学习
能力整合
混合SFT以不到1/60的算力在RLVR后全面超越下一块推理RL
Yinhao Tang, Youqing Fang, Yanan Sun, Jiangning Liu, Ziyi Wang, Xun Zhao,...
LLM推理
RLVR
SFT
强化学习
无CoT数据
以跨镜头音视频记忆、6-DoF轨迹控制与自展开蒸馏训练,把音视频生成扩展为持久故事与可交互世界
Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun...
6-DoF相机控制
世界模型
分布匹配蒸馏
自回归流式生成
记忆机制
指令锚定的流式时序建模让单帧VLA获得时序记忆,零新增参数全面超越π0.5
Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo,...
π0.5
时序建模
机器人操作
流式推理
视觉-语言-动作
首个系统评测视频指令遵循的基准:20余模型中最强者仅得54.5分
Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng,...
LLM-as-Judge
多模态大模型
指令遵循
视频理解
评测基准
把参考答案拆成原子量规条目,为VLM后训练提供细粒度、前缀定位的RL奖励
Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao,...
GRPO
后训练
多模态大模型
奖励设计
强化学习
用迁移审计+行为测试+智能体验证三阶段协议评估编码智能体的全仓库迁移能力
Deyao Hong, Yizhe Chi, Wenyi Li, Xiaoqiu Wang, Mingju Gao, Kaisen Yang,...
仓库迁移
代码智能体
基准评测
智能体验证
软件工程
编码智能体中途换模需缴交接税:升级收不回一半质量差距且常不如重启,降档反而划算
Roy Ganz, Mor Shpigel Nacson, Adi Kalyanpur, Ron Litman
LLM智能体
SWE-bench
实证研究
成本-质量权衡
模型切换与交接
把效应与余效应提升为运行时机制,为动态组件组合提供可逆撤销与响应式依赖的形式基础
Yifan Shi, Wei Zhang, Tianyi Cui
AI智能体框架
动态组合
形式化方法
插件架构
效应系统
AnTrap 基准动态注入四层十类陷阱,揭示 16 个 GUI 智能体对运行时异常普遍脆弱
Guo Gan, Yilun Zhao, Cong Chen, Jinbiao Wei, Tingyu Song, Zheyuan Yang, Lin...
Android
GRPO强化学习
GUI智能体
动态对抗环境
鲁棒性评测
把视觉反馈变成结构化、可积累的评分细则修复上下文,让 UI 转代码自演化更稳更高
Tianyi Xiong, Zhengyuan Yang, Xiaofei Wang, Chung-Ching Lin, Ruichun Ma,...
UI-to-Code
测试时自演化
视觉修复耦合
视觉语言模型
评分细则
用GRU式门控让单个共享层块在每次循环中特化,以约37%参数量匹配稠密基线质量
Amr Hegazy, Amr Alanwar, Mostafa Elhoushi
Transformer架构
参数效率
循环深度
权重共享
自适应计算
把指令拆成原子动作分给各臂,用臂洗牌训练实现未见协作模式的组合泛化
Zaibin Zhang, Junlan Xiao, Zhongbo Zhang, Yifan Wang, Li Kang, Yiran Qin,...
VLA模型
多臂协作
机器人学习
模仿学习
组合泛化
994 项最小对比对诊断揭示:GUI 定位失败主因是候选定位而非关系理解
Md Abrar Jahin, Md Rizwan Parvez
GUI智能体
基准测试
最小对比对
空间推理
视觉定位
用4D高斯泼溅重建奖励取代静态3D奖励,修复流式视频生成的几何漂移而不冻结运动。
Yuanhao Ban, Jiaqi Feng, Hengguang Zhou, Xiaohuan Pei, Justin Cui, Cho-Jui Hsieh
4D重建
奖励设计
强化学习
自回归扩散模型
视频生成
推理时只保留提示前缀加滑动窗口,让长思维链成本恒定,免训练提速3倍
Niklas Muennighoff, Zhengyang Wang, Zeyi Chen, Weijia Shi, Binyuan Hui, John...
强化学习
测试时扩展
滑动窗口注意力
长上下文
高效推理
以因果自回归建模实现流式语音驱动的低延迟实时共语手势生成与自进化
Wentao Jiang, Youchen Xie, Haidi Fan, Yajing Chen, Xin Wang, Ye Shi, Jingya Wang
在线共语手势生成
数字人
流式实时交互
自回归动作生成
自进化数据闭环
用逐变量超分辨率合成0.1°数据,证明高分辨率预报瓶颈在数据,性能超越IFS-HRES
Yang Zhao, Peisong Niu, Tian Zhou, Ziqing Ma, Guanlong Ma, Rong Jin, Huiling...
AI天气预报
ERA5
数据缩放定律
超分辨率
高分辨率预报
同一模型经不同语言接口自博弈对打,实力与策略系统性偏移,英语最强、希伯来语最弱。
Bobby Cheng, Adam Gaber, Zhengyuan Liu, Catherine Arnett, Omer Goldman,...
LLM评估
多语言NLP
文本博弈环境
智能体评测
自博弈
清单驱动先核查后打分,蒸馏出与人类判断最一致的端到端视频奖励模型
Peiyuan Zhang, Xiangyu Zhao, Hongbo Liu, Xiaoxing Hu, Mingxin Liu, Shuran...
奖励模型
数据构造
文本到视频
清单验证
视频评估
仅凭查询文本为每个查询选择检索管线,比最强静态管线准确率高2.5%、速度快12.4倍
Emre Kuru, Mehmet Onur Keskin, Reza Farahbakhsh, Noel Crespi
RAG
信息检索
多模态检索
效率优化
检索路由
百小时MEG数据集:80小时单被试深度+32人广度,刷新非侵入式语音解码纪录
Francesco Mantegna, Dulhan Jayalath, Gereon Elvers, Tasha Kim, Benjamin...
MEG
数据集与基准
脑机接口
语音解码
迁移学习
用YOLO定位加确定性几何验证取代VLM直接预测,CT空间问答准确率达94.1%
Simon Vincent Abel, Heiko Hillenhagen, Michael Götz, Timo Ropinski, Ayhan...
CT
医学影像AI
可解释性
智能体
空间推理
发布多模态土耳其语对话语料库,用遗传算法学可解释规则预测话轮转换,F1达57.0%
Ahmet Tuğrul Bayrak, Fatma Nur Korkmaz, Bekir Berker Türker, Mustafa Sertaç...
会话分析
可解释机器学习
土耳其语NLP
多模态对话
话轮转换预测