用管理-执行-审计循环把长时序执行重构为任务状态管理问题,跨轮次保持可验证进展
Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang, Shidong Yang, Yiming Hu, Fei...
任务状态管理
智能体审计
智能体框架
计算机使用
长时序任务
单一模型同时支持自然语言设计声音与参考音频克隆声音的多模态语音音频生成系统
Yu Zhang, Ruiqi Li, Changhao Pan, Ke Lei, Xiang Yin, Cheng Yang
多模态
强化学习后训练
指令式TTS
流匹配
混合专家MoE
把自动驾驶规划变成轨迹选择题,先推理后揭示候选,治好教师的锚定偏置
Zixuan Huang, Yang Zhou, Kaixuan Wang, Guli Zhang, Hongyan Xie, Yakun Zhu,...
强化学习
自动驾驶
视觉语言模型
轨迹预测
链式思维推理
用信息匹配的锚点修复在线自蒸馏中师生信息不对称导致的特权幻觉。
Jianyu Wu, Yizhou Wang, Encheng Su, Chen Tang, Shixiang Tang
信息不对称
后训练
大语言模型
推理模型
特权幻觉
几何引导采样加隐式解码,把单图3D高斯从像素对齐推向表面对齐
Jiawei Wang, Hao Yu, Yongzhen Hu, Xinyi Yang, Tao Ni, Xin Zhan, Junbo Chen,...
3D高斯泼溅
几何引导采样
前馈3D重建
单图新视图合成
隐式神经表示
把技能生成建模为顺序编辑过程,用回滚奖励训练技能编辑策略
Junhao Shen, Zhanqiu Zhang, Yiwen Guo, Hong Cheng
Agent技能生成
GRPO
LLM Agent
强化学习
技能编辑
在解码器模型中一次前向同时生成稀疏与稠密多模态向量
Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie...
多模态嵌入
检索增强生成
稀疏检索
稠密检索
解码器模型
用反事实视觉干预分离教师修正中由视觉解释的部分并重构学生监督目标
Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao,...
反事实推理
多模态大模型
知识蒸馏
细粒度视觉感知
视觉归因
逐步执行CAD操作并对比几何反馈,重建可编辑参数化程序
Soslan Kabisov, Gennadiy Savrasov, Maksim Elistratov, Antonio Rodriguez,...
CAD逆向工程
三维重建
基准评测
强化学习
视觉语言模型
把 Gemma 4 微调成开源离散扩散模型,单 H100 上约 1500 tokens/s。
DiffusionGemma Team, Adrien Ali Taïga, James Assiene, Daniele Calandriello,...
开源大模型
强化学习对齐
推理加速
文本扩散
混合专家MoE
分层诊断视频世界模型:外观、控制、空间一致性与内在反应性
Yuxue Yang, Shuyao Shang, Jiahe Wang, Zitong Zhou, Liang Tan, Junhan Zeng,...
世界反应性
可控视频生成
基准测试
物理仿真
视频世界模型
三阶段验证合成流水线,用2000技能生成2.7万轨迹训练LLM用好技能
Zelin Tan, Yiqun Zhang, Hao Li, Zhiyao Cui, Hejia Geng, Shao Zhang, Hangfan...
Agent技能
数据合成
智能体训练
监督微调
验证流水线
统一世界预测与价值估计的VLA强化学习评论家模型,149任务达SOTA
Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu
世界模型
价值估计
强化学习
机器人操作
视觉-语言-动作模型
SWE-Touch 注入用户冲突编辑评测编码智能体共享工作空间的鲁棒性。
Yuqiao Tan, Jinxiang Meng, Fangyu Lei, Minzheng Wang, Shizhu He, Jun Zhao, Kang Liu
SWE-bench
人机协作
基准评测
编码智能体
软件工程
在Transformer中间层插入可优化潜在态,借自注意力直接回传奖励梯度优化测试时推理。
Zhaoxin Yu, Qi Shen, Hengli Li, Zhaowei Zhang, Song-Chun Zhu, Chi Zhang, Zilong Zheng
信用分配
可解释性
梯度流
测试时扩展
测试时推理
冻结骨干LLM,用可复用的外部参数化记忆+逐token路由器实现零代价领域专精。
Jiarui Wang, Xiang Shi, Jiaqi Cao, Rubin Wei, Xiquan Wang, Hao Sun, Jingzhi...
Qwen3
SFT
kNN-LM蒸馏
参数化记忆
对齐税
用抽象运动视图自举跨类别配对,再内化为端到端视频运动迁移。
Zhixue Fang, Zhimin Zhang, Bi'an Du, Zijie Meng, Yan Zhou, Wei Hu, Guoxin...
MMDiT
图像到视频生成
扩散模型
自举学习
视频运动迁移
揭示 LLM 系统性回避删除代码的偏差,构建 CanItDelete 基准并证明训练可缓解。
Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia, Gopi Krishnan...
LLM 智能体
代码编辑
后训练
基准测试
程序修复
将双侧矩阵舍入从四次方时间降到立方时间,且结果与向量化舍入完全等价。
Jiale Chen, Torsten Hoefler, Dan Alistarh
GPTQ
Kronecker积
模型量化
矩阵分解
神经网络压缩
用结构先于语言的事件图数据,让视觉证据真正驱动多轮搜索。
Huanyao Zhang, Jiepeng Zhou, Runhao Zhao, Yanzhe Shan, Jiaoyang Chen, Bowen...
MLLM
事件图
多模态深度搜索
数据合成
智能体
三阶段压缩3D VLM的token,仅用128个token保留94.7%性能并加速1.92倍
Changwoo Baek, Kyeongbo Kong
3D视觉语言模型
3D问答
Token压缩
体素化
决定性点过程
把布局残缺陷转为对象级局部修复,验证门控只提交安全编辑。
Lingwei Dang, Ziyan Qiu, Jiajia Cheng, Shishuo Shang, Zhenhao Zhang, Yufei...
3D-FRONT
3D室内布局合成
反思式修复
室内场景修复
对象接地推理
用布朗桥桥接+异构蒸馏实现1步200FPS实时说话人头生成。
Rongxiang Zhang, Songhua Liu
分布匹配蒸馏
实时生成
布朗桥
流匹配
说话人头生成
仅用一张RGB图与指令,从冻结视频扩散中间特征直接读出6-DoF物体轨迹。
Tongsheng Ding, Zhen Luo, Yixuan Yang, Boyu Wang, Luyang Xie, Jinyu Yang, Feng Zheng
6-DoF物体轨迹预测
egocentric操作数据集
具身智能
扩散模型可解释性
流匹配
用动态超图场和反事实马氏能量在固定布局下选家具,实现场景级风格一致。
Lingwei Dang, Shishuo Shang, Pan Liu, Jiajia Cheng, Ziyan Qiu, Zhenhao...
3D资产检索
反事实推理
室内场景合成
家具风格化
测试时训练
统一流式评估框架揭示自演化智能体收益受场景、模型与方法的共同制约。
Dong Yan, Jian Liang, Dapeng Hu, Ran He, Nicholas Jing Yuan, Qi Zhang, Tieniu Tan
Agent
LLM智能体
基准评测
持续学习
流式评估
新增行为推理基准,揭示智能体面对工具映射漂移时迷信穷举搜索而非演绎。
Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria
LLM推理
基准测试
工具调用
智能体评测
行为推理
用多臂老虎机路由与LLM推理解耦,在有限trial预算下稳定优化推荐模型
Haoran Ling, Yuecheng Li, Zeyu Song, Jing Yao, Shuwen Kang, Chi Lu, Wenjin...
LLM智能体
Thompson采样
多臂老虎机
推荐系统优化
自动化机器学习
保留原始交互痕迹,用实体-上下文图与时序层次做零LLM调用的记忆检索
Yilin Xiao, Zhehan Zhu, Yujing Zhang, Jin Chen, Zijin Hong, Luyao Zhuang,...
LLM智能体记忆
实体-上下文图
时序层次检索
证据校准
零token记忆操作
可复现的指定-渲染-检查流水线构建 9401 张人物图像数据集 Poplar-9K
Zhishan Zou
人物中心图像合成
可复现性
合成数据集构建
图像质量审查
扩散模型
用交互边与责任端将41种智能体故障可操作地归因到具体组件
Harsh Raj, Vipul Gupta, Anas Mahmoud, Razvan-Gabriel Dumitru, Darvin Yi,...
LLM-as-Judge
分类体系
可复现性
故障诊断
智能体评估
0.9B小模型自引导预测未来状态并注入几何监督,登顶LIBERO与LIBERO-Plus
Ruiteng Zhao, Zhengshen Zhang, Yue Su, Wenshuo Wang, Jiahui Li, Zhiyuan...
世界动作模型
机器人操作
流匹配
潜在世界模型
视觉-语言-动作模型
ReBA通过分离图文负载、每张图作为等权路由实例,解决VLMoE在不同token比例下的负载失衡。
Ziang Wu, Peng Jin, Qishen Yin, Munan Ning, Hao Li, Peizhen Zhang, Li Yuan
动态分辨率
混合专家模型
稀疏路由
视觉语言模型
负载均衡
三阶段后训练流水线把企业问答可接受率从52.76%提升到91.51%。
Xiaofeng Shi, Xiaosong Qiu, Wenxin Ma, Qian Kou, Yiming Pan, Longbin Yu,...
GRPO强化学习
企业知识问答
后训练
残差数据选择
闭卷问答
首个 ALD/E 科学图表理解基准与竞赛,揭示多模态模型在数据抽取与推理上的瓶颈
Fahad Ahmed, Sören Auer, Jennifer D'Souza
ALD/ALE
信息抽取
基准数据集
多模态大模型
科学图表理解
模型无关框架,归因多模态临床AI的逐模态失效并区分显性与隐性失效
Quang Bui, Shlok Jaiswal, Samuel Paik-Heintz, Kevin Zhou, Kaushik Madapati,...
临床AI
可解释性
多模态融合
失效分析
心脏基础模型
证明稀疏 KV 服务中被保留的下游事件行能携带已丢弃源事件的状态,可编程但仅限紧凑状态
Zefeng Cai, Zerui Cai
KV 缓存
因果注意力
大模型推理
稀疏服务
记忆系统
冻结像素扩散主干,用合成样本训练轻量适配器,靠中间与最终预测之差自我引导采样。
Zixuan Fu, Chong Wang, Lanqing Guo, Kailai Zhou, Jiahao Nie, Bihan Wen
ImageNet
adapter
像素空间扩散模型
合成数据
扩散Transformer
揭示MLLM视觉失败多为"利用"而非"感知",并找到可控旋钮
Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie,...
反事实评估基准
多模态大语言模型
机制可解释性
激活修补
知识冲突
大规模多模态洪水分割基准GEOID-Flood,证明训练设计比编码器更关键。
Gaetano Chiriaco, Luca Barco, Andrea Bragagnolo, Claudio Rossi, Edoardo Arnaudo
Sentinel-1/2
合成孔径雷达SAR
地理空间基础模型
多模态融合
洪水分割