外置相机位姿索引的几何记忆,配合长时程教师蒸馏,实现三步生成、小时级不间断的交互世界模型
Yuanyang Yin, Gongxuan Wang, Yifan Zhan, Chuanhao Li, Kaipeng Zhang, Feng Zhao
世界模型
交互式生成
几何记忆
少步蒸馏
自回归生成
把各类LLM路由统一为序列决策过程,并配套自动监督构建流水线、多场景基准与开源库
Tao Feng, Fangxu Yu, Haozhen Zhang, Zhongjie Dai, Liangqi Yuan, Zijie Lei,...
LLM路由
个性化路由
基准评测
多智能体系统
开源基础设施
冻结模型权重,用种群级自然选择进化智能体支架,四大基准平均提升约17分。
Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur, Thai Hoang,...
LLM Agent
智能体支架搜索
智能体评测
种群进化
自进化智能体
SE(3) 几何感知的动作条件视频世界模型,登顶 WorldArena 2.0 预测赛道
DreamX Team, Rui Chen, Xiangxiang Chu, Geng Li, Jifan Li, Qingfeng Shi,...
SE(3)几何
世界模型
动作条件控制
扩散模型
机器人操作
直接感知原始多模态证据,端到端自动完成从数据到可验证论文的科研闭环
Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu
AI Scientist
LLM Agent
多智能体系统
多模态智能体
科学发现
397B 参数科学智能体基础模型:多模态科学理解、可验证强化学习与长程智能体训练的统一
Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng,...
后训练
基础模型
多模态
强化学习
时间序列
让智能体递归优化自身设计Harness,40分钟自动产出人类偏好最高的学术海报
Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li,...
代码智能体
元Harness优化
多模态设计
智能体自进化
论文转海报
保持科学内容不变仅改修辞,就能让AI审稿分数大幅波动,且效应高度依赖维度与模型配置。
Ming Li, Chenguang Wang, Xirui Li, Xinyue Zeng, Dianqi Li, Peng Shi, Dawei...
AI同行评审
LLM-as-a-Judge
修辞敏感性
可控改写实验
奖励劫持
用多模态智能体模拟真人玩家,围绕长时程目标闭环评测九个视频世界模型
Kaixin Ding, Xi Chen, Minghong Cai, Zhiyuan Xu, Yiyang Wang, Yuxiang Lu,...
VLM-as-Judge
世界模型
基准评测
多模态智能体
视频生成
冻结VLM用可迁移教训记忆与迁移可靠性校准,实现免训练的空间推理自进化
Haokai Zhang, Yuhang Ding, Yunshu Zhou, Xinze Du, Shengtao Zhang, Zhiyue...
免训练
智能体记忆
检索增强
空间智能
自进化
把电影编码为可编辑的电影知识图谱,用重构残差驱动双环文本梯度自进化
Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang, Bingnan Li,...
文本梯度优化
智能体
知识图谱
视频生成
视频表示学习
首次揭示混合线性注意力LLM中巨激活的前尖峰与平台形态,并用取消时机统一解释
Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao, Jing Xiong,...
可解释性
大语言模型
巨激活
机制分析
注意力沉降
首个14B级实时流式人体动画系统,19.63 FPS且3分钟质量几乎零漂移
Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan...
KV缓存
人体动画
扩散蒸馏
流式推理
视频生成
首个流式音视频联合身份替换框架:单一扩散模型同步换脸换声,3步采样13.6 FPS
Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu,...
LoRA
扩散模型蒸馏
流式自回归生成
视频生成
语音转换
将顶层隐状态门控融合为下一步输入,以约1%推理开销换取约2倍训练数据量的效果
Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan, Gustavo de Rosa, Tim...
LLM预训练
数据效率
测试时计算
潜在反馈
递归计算
首个系统评估视频世界模型能否把人类第一人称演示跨具身转写为机器人操作视频的基准
Dingyi Rong, Yue Shi, Chaofan Ma, Jiezhang Cao, Zongrui Wang, Zeyu Zhang,...
MLLM评委
人至机器人迁移
基准评测
机器人操作数据
视频世界模型
用因果教师与前缀评分对齐师生信息集,实现低延迟可控长视频生成
Hmrishav Bandyopadhyay, Xuanchi Ren, Zijian Huang, Jay Zhangjie Wu, Tianshi...
世界模型
扩散蒸馏
相机控制
自回归模型
视频生成
用LLM在残差式DSL空间中自动搜索视觉token剪枝策略,94.4%剪枝下保留99%以上性能
Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu
AI4AI
LLM驱动算法设计
多模态大模型
推理加速
视觉Token剪枝
强模型充当演员与评论家,以自然语言强化学习迭代优化技能文本,让9B/4B小模型媲美闭源大模型。
Chenhao Dang, Siyuan Xiong, Conghui He, Weijia Li
Agent Skills
LLM 智能体
小语言模型
技能自动生成
语言级强化学习
把测试时推理重构为思维级束搜索:零和剪枝并从高分前缀分支,同硬件下精度与效率双升。
Lijie Yang, Hongyin Luo, Jiawei Zhao, Tri Dao, Ravi Netravali
LLM推理加速
推理系统
束搜索
测试时计算扩展
解码策略
将逐轮记忆整合改为语义分段批量编码,准确率与构建成本双优
Dongfang Li, Zixuan Liu, Junmai Wang, Jiahe Huang, Fuhao Li, Bonian Jia,...
LLM智能体
成本效率
检索增强生成
长期记忆
揭示LLM超出能力时产生似是而非的无效推理,CaRL训练模型学会及时认输
Xinyan Guan, Jiali Zeng, Chunlei Xin, Yaojie Lu, Hongyu Lin, Xianpei Han, Le...
GRPO
强化学习
无效推理
能力边界校准
诚实性
用并行预填充器生成记忆目标,一致性损失训练滑窗解码器,实现可并行预训练的固定内存循环语言模型
Bo Liu, Qiang Liu
Transformer
一致性损失
循环记忆
语言模型预训练
高效注意力
指令微调令模型更自信但准确率未必提升,推理文本多样性变化方向不一
Irina Proskurina, Mayank Kumar, Oyindolapo O. Komolafe
大语言模型
指令微调
文本多样性
模型校准
置信度估计
让特权状态按需介入自蒸馏,使编辑后的LLM能拆分新知识并组合多跳推理
Tianci Liu, Zihan Dong, Tianchun Li, Yi-Chung Chen, Qiming Cao, Xingchen...
LLM
可组合性
知识编辑
自蒸馏
非结构化知识编辑
AI 智能体经 31 轮审计、修正 201 处缺陷,无人工审查完成 189 文件大重构
Joel Abenhaim
AI编码智能体
大规模重构
案例研究
规范驱动开发
软件维护
潜空间SDS伪影源于VAE欠约束的像素漂移,解码前瞻步即可轻量修复梯度
Vsevolod Skorokhodov
VAE
分数蒸馏采样
图像质量修复
扩散模型
文本到3D生成
用人耳不可闻的低频波形黑盒攻击音频大模型,准确率最多降67个百分点,并提出DRG防御
Yuanhe Zhang, Weiliu Wang, Jie Ren, Liang Lin, Zhenhong Zhou, Haoran Gao,...
低频信号
大型音频语言模型
对抗攻击
红队测试
音频安全
分阶段诊断证明双平面肋骨骨折3D重建的瓶颈在跨视图对应,侧位检测器质量是关键杠杆
Kabila Haile Soboka
3D重建
医学影像
肋骨骨折检测
诊断性研究
选择性预测
用LLM性别分类加标签感知翻译模型的混合流水线,把英译罗性别准确率提升40个百分点以上
Ioana Grigore, Sergiu Nisioi
LoRA微调
低资源语言
大语言模型
性别偏见
机器翻译
用一次留出前向测量教师置信集可靠性,自动在严格阈值与自适应下限间切换
Ebenezer Tarubinga
DINOv2基础模型
伪标签选择
半监督语义分割
置信度校准
自训练
双层异常检测夹住TVAE生成,产出运行有效的极值航班数据,极值预测MAE最多降57%
Karim Aly, Alexei Sharpanskykh, Jacco Hoekstra
变分自编码器
合成数据生成
异常检测
极值增强
航空数据分析