对照实验与配对轨迹分析揭示:技能靠程序锚定而非知识注入起效,检索与调用是失效边界。
Zhiyuan Jiang, Fangrui Huang, Hanwen Xing, Xander Wu, Yipeng Gao, Rui Cao,...
Agent Skills
LLM Agent
实证评测
检索与调用
程序记忆
用进化策略替代反传式RL,以推理级显存全参数微调长程智能体,且horizon越长优势越大
Zhi Zheng, Rongsheng Chen, Yunpeng Ba, Zhenkun Wang, Yee Whye Teh, Wee Sun Lee
Agentic RL
LLM智能体
全参数微调
测试时计算
进化策略
把消费级电脑当统一推理平台,让 8GB 笔记本交互式跑 35B 模型
Shuo Yang, Xiaoze Fan, Melissa Pan, Haocheng Xi, Zhe Wang, Shanlin Sun, Kurt...
CPU-GPU 协同执行
LLM 推理系统
MoE 推理服务
缓存与调度
边缘计算
首个逐级撤除人类方法指导、评测AI自主科研能力的跨领域项目级基准
Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang,...
AI for Science
基准测试
大模型评测
智能体框架
自主科研智能体
以2D像素指点替代3D坐标回归,用选择性推理与双层GRPO对齐刷新具身导航SOTA
Hongyan Feng, Sunlai Chen, Xuanyu Liu, Miao Pan, Yangfan Xie, Yuxiang Cui,...
GRPO强化学习
VLM
sim-to-real
具身导航
视觉语言导航
提出harnessed agentic RL范式,RL提升编码智能体14.6个百分点
Zhiyuan He, Siwei Zhang, Zhiwen Zhou, Yuqing Yang, Yu Kang, Yuge Zhang, Luna...
LLM后训练
代码智能体
强化学习
智能体训练
系统设计
以冻结视觉基础模型特征构建语义潜空间,视频重建与生成双优、收敛快至6倍
Minghui Guo, Shengqiong Wu, Hao Fei
扩散模型
潜在空间
表征学习
视频生成
视频自编码器
将原生编码智能体框架桥接到策略梯度训练,SWE-bench解决率最高提升9.4个百分点
Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen,...
MoE
SWE-bench
强化学习
智能体训练框架
编码智能体
扩散桥加先验引导稀疏注意力,让图像编辑忠实高效地冲上4K
Jiayi Song, Shijie Huang, Fangtai Wu, Yubo Huang, Zhenxiong Tan, Songhua...
DiT
图像编辑
扩散桥
稀疏注意力
超分辨率
黑盒免训练提示级防御DiSCO,将攻击成功率从23.6%降至2.4%
Tong Zhang, Motasem Alfarra, Carlos Hinojosa, Christos Louizos, Bernard Ghanem
对抗防御
文本到图像生成
用边界感知的LCA掩码让层级字节模型单头并行预测多字节,加速推理且性能基本不掉。
Abraham Toluwase Owodunni, Chibuzor Okocha, Christan Grant, Tomasz...
多Token预测
字节级语言模型
层级架构
投机解码
推理加速
构建20万条组合指令视频编辑数据集,并用区域感知注意力训练22B编辑模型
Fuchen Long, Cong Wang, Zitao Gao, Wenhao Zhong, Yu Cheng, Xiaolu Hou, Yan...
多模态大模型
扩散Transformer
指令引导生成
数据集
视频编辑
受控评估11种记忆基底:无单一基底全胜,需按任务体制动态路由
Wei-Chieh Huang, Weizhi Zhang, Yuchen Wu, Yankai Chen, Eric Hanchen Jiang,...
LLM智能体
实证分析
检索增强
记忆系统
评估基准
细粒度MoE+核优化+防遗忘视频微调,稀疏CLIP视觉编码器追平1.7倍大的SOTA稠密模型
Bonan Zhang, Shiyu Dong, Quan Hung Tran, Katharina Gschwind, Shuqi Yang,...
CLIP
模型缩放
混合专家(MoE)
知识蒸馏
视觉编码器
以能力为单位组织440M文生图、120M编辑与27M知识数据,按依赖顺序编排课程训练通用图像生成模型
Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou,...
图像生成
多模态扩散模型
指令图像编辑
数据策展
文本到图像
用随图像频谱演化的移动低通终点替换固定终点,让像素级流匹配按粗到细轨迹生成
Haoyang Tong, Yu He, Fang Li, Lichen Ma, Jingling Fu, Dong Chen, Zhen Chen,...
像素空间生成
图像生成
流匹配
粗到细生成
频谱先验
让仓库自合成 Issue 并蒸馏项目专属技能,破解 SWE 智能体冷启动
Silin Chen, Han Li, Xiaodong Gu, Yuling Shi, Haibing Guan
Issue解决
LLM Agent
技能库
自蒸馏
软件工程智能体
扩散文生图模型需约200图像token/参数才达计算最优,是LLM的10倍,且过训练几乎无代价。
Kyle Chickering, Wei-An Lin, Swayam Bhanded, Dan Saunders, Akshat Tripathi,...
DiT
扩散模型
文生图
流匹配
缩放定律
从市场验证的AI创业产品工作流构建97任务基准,最强模型严格完成率仅约30%
Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang, Jingzhe Ding, Qingshui...
Agent-as-a-Judge
基准构建
智能体评测
真实用户需求
端到端工作流
首个按六阶段评估智能体Harness安全的基准:128个沙箱案例揭示高效用不等于安全
Yajing Bai, Jinhao Duan, Jie Peng, Xianfeng Wu, Sijia Liu, Song Wang, Tianlong Chen
Agent Harness
基准评测
提示注入
智能体安全
MathForm用知识检索与验证迭代构造36.7万条Lean数据,8B形式化模型超越32B对手
Lushi Pu, Weiming Zhang, Xinheng Xie, Zixuan Fu, Bingxiang He, Hengyu Zhao,...
Lean 4
强化学习
数学推理
数据构造
自动形式化
把智能体执行轨迹建模为依赖图并传播不确定性,实现长程任务失败的早期检测。
Zhengzhao Ma. Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun
LLM智能体
不确定性量化
可信AI
失败检测
轨迹图建模
对DeepSeek Harness执行1.4万余次间接提示注入测试,量化代理从内容到动作的攻击面
Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong...
Agent安全
红队评估
腾讯朱雀实验室
间接提示注入
冻结的外部哈希记忆可跨模型复用,成败关键在目标侧读取器的提取与对齐能力
Mingyuan Li, Guangsheng Yu, Xu Wang, Shaoxiong Ji
Engram
参数高效适配
外部记忆
知识注入
跨模型迁移
提出个性化自动科研问题,让AI科研系统全程感知并适配研究者个体
Bo Ni, Franck Dernoncourt, Hongjie Chen, Yu Wang, Nesreen K. Ahmed,...
LLM智能体
个性化
图表示学习
立场论文
自动科研
联合设计面向LLM的DSL与多智能体系统,用空间关系算子取代脆弱坐标,实现可靠3D创作
Rui-Huan Wang, Si-Tong Wei, Jia-Qi He, Heng-Yi Wei, Baoquan Chen, Peng-Shuai Wang
3D内容生成
LLM智能体
多智能体系统
程序合成
领域特定语言
提出七个组件的统一层方程,把两百余种GNN架构纳入同一坐标,使比较、归因与架构生成成为可能
Sai Karthik Navuluru, Siddhartha Shankar Das, Bo Ni, Hongjie Chen, Yu Wang,...
图神经网络
架构生成
统一框架
表达能力
谱图理论
免拟合将预优化3DGS转为稀疏体素潜变量,单张卫星图生成千米级航拍3D场景
Ming Qian, Zijian Wang, Minchao Sun, Jincheng Xiong, Hang Zhang, Mu Xu, Chi...
3D生成
3D高斯泼溅
大规模场景生成
流匹配
把人的输入从『选一个问题』升级为『定一个方向』:FAR级联自动挖猜想、批量求解并推荐评审
Zeyu Zheng, Shengtong Zhang, Jeremy Avigad, Prasad Tetali, Sean Welleck
AI for Math
人机协作
开放猜想挖掘
搜索与推荐系统
算力分配
评估并微调 LLM 用架构专属 PTX 生成真正执行目标指令、比肩前沿库的高性能 GPU 内核
Genghan Zhang, Yixin Dong, Chengze Fan, Zhichen Zeng, Yueming Yuan, Shaowei...
GPU内核优化
LLM
PTX
体系结构
基准测试
免VAE像素扩散Transformer统一修复八种图像退化,单步推理仅44ms
Lingchen Sun, Rongyuan Wu, Xiangtao Kong, Jixin Zhao, Qiaosi Yi, Yujing Sun,...
DINO
Diffusion Transformer
扩散模型
流匹配
统一图像修复
让ECG、PPG、PCG在潜在心脏时间轴上互相监督,一个编码器统一心脏表征
Hamza Shafiq, Hung Manh Pham, Bin Zhu, Pan Zhou, Jun Hu, Aaqib Saeed
JEPA
基础模型
多模态学习
时序表征
生理信号