三尺度具身基础模型,新增3D接地与接触点预测,统一动作空间跨本体VLA。
Kehan Li, Bohan Hou, Minghao Zhu, Tianyi Zhang, Zesen Cheng, Zhikai Wang,...
3D接地
MoE
VLA
具身智能
基础模型
把时序证据当区间集,从数据验证到 Wasserstein 奖励全程对齐,小模型全面超越超大模型。
Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li,...
Wasserstein距离
合成数据验证
多模态大模型
强化学习奖励设计
视频时序定位
构建可验证的离线维基百科环境,让搜索智能体自蒸馏迭代进化。
Xinyu Geng, Xuanhua He, Sixiang Chen, Yanjing Xiao, Fan Zhang, Shijue Huang,...
工具使用
强化学习
智能体
深度搜索
自蒸馏
开放模式驱动角色与世界在长程文学互动中持续协同演化
Qing Zong, Yue Guo, Mengxin Yang, Yiwen Guo, Yangqiu Song
LLM-as-Judge
世界模型
开放模式
文学世界
角色扮演智能体
轻量级头从冻结骨干隐状态直接读取逐行剪枝信号,省去外部评分模型。
Yuhang Wang, Yuling Shi, Shaoqiu Zhang, Jialiang Liang, Shilin He, Siyu Ye,...
上下文压缩
提示压缩
智能体上下文管理
编码智能体
隐状态探针
开源2000小时手机采集的第一人称操作数据集及端到端工具链
Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan,...
VLA策略
世界模型
人机迁移
具身智能
开源工具链
统一处理主体间与主体内参考的HOCVP框架,借助MLLM推理实现SOTA人-物交互视频生成
Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen,...
主体一致性
人-物交互生成
多模态大模型
扩散Transformer
视频个性化
用像素对扭曲流场从图像编辑样本实时生成视频编辑训练数据
Dingyun Zhang, Lixue Gong, Wei Liu
扩散模型
指代表达分割
数据合成
模态对齐
流匹配
首个将视频物理推理锚定到物理定律并分阶段诊断的基准
Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao,...
世界模型
基准测试
思维链
物理推理
物理智能
提出GigaChat Audio,支持120分钟长音频的时间锚定问答与摘要
Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov, Alexandr Maximenko,...
合成数据
时间接地
混合专家模型
长音频理解
音频语言模型
用簇级数据平衡预训练和域感知采样微调,为中亚低资源语言构建ASR基础模型
Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov,...
Conformer
低资源语言
多语言ASR
自监督学习
语音识别
用群组熵引导的非对称优势塑形,缓解GRPO多任务训练的探索-利用失衡
Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen
GRPO
多任务强化学习
大语言模型对齐
强化学习
策略熵控制
实体导向的多模态长期记忆系统,感知流并围绕实体组织记忆,六项基准全部最优
Xiaokang Ma, Yifan Sun, Zhihong Jin, Jie Gu, Yudong Luo, Shenyi Shao, Chu...
多模态记忆
实体识别
流式感知
视频理解
长期记忆
用世界模型预测动作后果,在执行前拦截移动端高风险操作。
Xue Yu, Bo Yuan, Pengshuai Yang, Kailin Zhao, Hong Hu, Junlan Feng
世界模型
动作风险评估
智能体安全
移动GUI智能体
视觉语言模型
仅凭API规格,用LLM模拟环境生成训练API调用智能体的轨迹数据
Seanie Lee, Sanjoy Chowdhury, Chao Jiang, Cheng-Yu Hsieh, Ting-Yao Hu,...
API调用智能体
LLM世界模型
合成数据生成
监督微调
知识蒸馏
可微几何图像:用连续TSDF把薄壳3D生成压入32×32潜空间,消费级硬件实时运行。
Eungjune Shim, Hansol Lee, Eunjung Ju
3D生成
TSDF
几何图像
可微Marching Squares
潜在扩散模型
提出3D-Fit基准,评测LLM在多重3D空间约束下的分子生成能力
Thomas MacDougall, Maksim Kuznetsov, Roman Schutski, Rim Shayakhmetov, Maxim...
三维空间约束
分子生成
基准测试
大语言模型
扩散模型
需求驱动的智能体训练数据合成框架,跨领域规模化生成可执行任务与专家轨迹。
Jiarong Zhao, Zhikai Lei, Zhiheng Xi, Rui Zheng, Hang Yan, Jie Zhou, Qin...
LLM 智能体
SFT 蒸馏
任务分布建模
智能体后训练
终端智能体
把 LLM 裁判升级为教练,用可迁移经验知识替代标量奖励训练模型。
Tianzhu Ye, Li Dong, Guanheng Chen, He Zhu, Xun Wu, Shaohan Huang, Furu Wei
后训练
大语言模型
强化学习
指令遵循
知识蒸馏
首个单图驱动的多视角手物交互视频与3D运动联合扩散生成框架
Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An, Wei Min,...
3D运动生成
几何感知生成
多视角视频生成
手物交互
扩散Transformer
将教师监督直接融入强化学习目标,通过反向重要性采样实现选择性知识迁移
Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue Wang
GRPO
大语言模型后训练
强化学习
知识蒸馏
策略优化
将VLA后训练重构为多租户服务,解耦训练/推理/环境并组批调度,GPU时间降28%
Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei...
GPU调度
VLA模型
后训练
多租户服务
强化学习
按临床工作流分 20 个细粒度任务,分层评估 MLLM 从视觉感知到临床推理的 OCT 理解能力
Baochen Fu, Wenzhi Deng, Baihao Jin, Yang Li, Zihan Nie, Kailin Jiang,...
OCT医学影像
临床推理
基准测试
多模态大模型评测
视网膜疾病
用 MDLM 双向去噪打造可控文本世界模型,零样本提升 RL agent 达 47%
Darshan Deshpande
GRPO
agentic RL
bidirectional denoising
masked diffusion models
synthetic data generation
把后训练重构为token级正确性二元分类,提升分布外事实忠实度
Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu, Robin Jia
LoRA
事实性
后训练
机制可解释性
条件转向
用编码智能体把简单参考实现自动转化为高效多 GPU 部署的实时多模态服务框架
Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen
NP难调度
多GPU部署
多模态服务系统
实时系统
智能体编排
免训练框架,借历史预测构造卡尔曼式时序共识校正扩散采样,零额外 NFE。
Shigui Li, Delu Zeng
flow matching
免训练推理
卡尔曼滤波
序贯状态估计
扩散模型
证明长流程人机协作中,最优人类监督的间隔应非递减(前密后疏)
An Luo, Jie Ding
Agentic AI
人机协作
可扩展监督
智能体工作流
调度优化
用流形上的微分几何与热力学重写Transformer,给出六个可证伪实验
Zhihua Liang
Attention Sink
Transformer理论
微分几何
神经ODE
纤维丛
形式化“自状态攻击”并系统量化操作系统层防御的能力边界。
Yimeng Chen, Nathanaël Denis, Roberto Di Pietro, Jürgen Schmidhuber
AI智能体安全
异常检测
提示注入
操作系统防御
自状态攻击
用2026世界杯104场比赛,细粒度评测大模型与智能体的赛前足球预测能力。
Zhaokai Wang, Tianlin Gui, Jiayuan Rao, Shangzhe Di, Yihong Tang, Dingli Liang
体育预测
动态基准
大语言模型
深度研究智能体
评测基准
用可学习规划Token与分数旋转位置编码实现帧级可控多镜头视频生成
Su Guo, Guangce Liu, Haosen Yang, Jiepeng Wang, Cong Liu, Junqi Liu, Haibin...
多镜头视频
扩散Transformer
旋转位置编码
电影级生成
视频生成
发现多教师蒸馏会把工具调用边界推向过度调用,提出 Soft Clamp 局部校准方案
Jiabin Shen, Guang Chen, Chengjun Mao
在线策略蒸馏
大模型智能体
工具调用
知识蒸馏
行为校准
测量被赋予权力的 AI 会不会自发胁迫甚至欺骗下属 AI 的基准。
Jasmine Brazilek, Maheep Chaudhary, Zoe Lu, Miles Tidmarsh
AI 安全
LLM-as-Judge
多智能体系统
欺骗
胁迫
统一生成式Transformer,从单段第一人称RGB视频同时重建人体、手、视线、相机轨迹与深度
Xiaozhong Lyu, Gen Li, Zhiyin Qian, Xucong Zhang, Marc Pollefeys, Siyu Tang
4D重建
Transformer
VQ-VAE
人体运动估计
多模态基础模型
用扩散模型把单目长尾驾驶视频补全为多视角训练数据。
Lulin Liu, Nuo Chen, Yan Wang, Bangya Liu, Wenyan Cong, Hezhen Hu, Boris...
Plücker射线
VLA
外推式视角合成
多视角生成
自动驾驶
首个评估VLM从纯截图推断Web应用交互行为的基准,揭示视觉保真度不等于交互推理能力
Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu,...
Web应用生成
交互推断
基准测试
截图转代码
视觉语言模型