用可插拔组件包裹静态环境,按策略弱点自动定制训练环境,显著提升智能体学习
Chengsong Huang, Zifeng Wang, Rujun Han, Jun Yan, Yanfei Chen, Zoey CuiZhu,...
LLM智能体
强化学习
智能体学习
环境定制
自动化课程
重构技能场景并以真实容器状态对齐工件,合成高密度可验证终端任务
Kou Shi, Zun Wang, Qisheng Su, Shiting Huang, Ziao Zhang, Zhen Fang, Qingnan...
任务合成
可执行验证
后训练
数据合成
终端智能体
以 RCP 打包与 TCR 路由破解多视角扩散的上下文瓶颈,从单目视频重建 4D 人体
Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun...
4D Gaussian Splatting
4D 人体重建
多视角视频生成
相机控制
视频扩散模型
119项任务、98个仓库、20个科学领域的基准,揭示编码智能体修复科学软件的失败机理
Zhipeng Xu, Jiahao Lu, Yining Zheng, Yuxin Wang, Xipeng Qiu
基准评测
失败机理分析
科学计算
编码智能体
软件工程
把身份选择、布局规划与生成统一进一个模型,让5–10人合影既保真又不重脸
Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong, Wei Cheng,...
图像生成
多主体定制
布局规划
统一多模态模型
身份保持生成
记忆并非总是有益:正确且相关的记忆也会诱发认知陷阱,使模型推理固着、信念扭曲、性能大跌
Mengru Wang, Haozhe Luo, Zhenqian Xu, Zhixiang Cui, Haoming Xu, Qu Yang,...
AI安全
LLM记忆
信念扭曲
基准评测
推理固着
多轮用户模拟持续再生演化梯度,治理层主动修复结构退化,生产技能 TSR 提升 51.8 分
Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu
Agent Skills
多轮用户模拟
技能自演化
智能体评估
知识库治理
四阶段渐进因果训练将双向生成器蒸馏为1/2/4步世界模型,支持草稿重放精修
Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li,...
一致性蒸馏
交互式生成
分布匹配蒸馏
因果蒸馏
流匹配
把成功工作流在线编译为可调用技能库,以直接复用与上下文引导双路径实现训练无关的智能体自进化
Zeyu Ren, Ling Yue, Ran Li, Yishu Wang, Shengxiang Xu, Hanmo Liu, Shaowu...
LLM智能体
工作流优化
技能库
自进化
训练无关适应
用双DAG表示仓库架构状态,以模块度指标引导结构持续演化,从自然语言需求直接生成完整代码库
Silin Chen, Haoyi Teng, Xiaodong Gu, Yuling Shi, Jiale Huang, Yongpan Wang,...
LLM智能体
仓库级代码生成
模块化设计
测试驱动开发
软件架构
均值校正+FA3/4级稀疏内核,长上下文prefill最高加速47倍并落地SGLang
Qihang Fan, Huaibo Huang, Zhiying Wu, Bingning Wang, Ran He
GPU内核优化
LLM推理加速
推理服务系统
稀疏注意力
长上下文
SFT 让模型改用希腊语推理,RLVR 修好格式缺陷,而准确率基准被 7.7 分种子噪声淹没
Ayoub Kirouane, Christos Petrocheilos
LoRA
MoE
RLVR
低资源语言
实验方法论
用VLM编排VLA探索采集新任务数据,再经蒸馏与残差RL高效微调
Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch,...
VLA
强化学习
机器人操作
模仿学习
高层子任务决策按需触发世界模型束搜索,用测试时算力换长程操作成功率。
Xiaowei Cai, Yunuo Cai, Bingao Chen, Jingxiao Chen, Zhi Chen, Siyuan Feng,...
VLA
世界模型
分层策略
机器人基础模型
测试时计算
LLM 与嵌入模型在 37 项任务上整体打平,但成本最高 1431 倍、吞吐低 2.5–736 倍
Adnan El Assadi, Niklas Muennighoff, Jinhyuk Lee
LLM
基准评测
成本效益分析
文本嵌入
检索
三阶段后训练把文档语料内化为参数知识,免检索答题同时保住通用能力。
Qian Kou, Xiaofeng Shi, Xiaosong Qiu, Hua Zhou
LLM-as-a-Judge
免检索问答
后训练
文档知识内化
模型合并
提出三类行为探测与因果干预,量化并揭示ASR模型对公开基准的过拟合
Theo Lebryk, David Ayllon, Alice Baird, Jakub Piotr Cłapa, Jens Madsen,...
可解释性
基准优化
模型评估
语音识别
冻结大模型通过三层自指改写自身 Harness 与进化策略,实现持续自我提升
Tailin Zhou
Agent Harness
Gödel Machine
LLM Agent
冻结模型
智能体自我改进
把领域政策编译成工作流图,在用户轮次边界持久追踪进度并主动修复智能体的流程违规
Seongjae Kang, Taehyung Yu, Sung Ju Hwang
LLM智能体
工作流引导
智能体安全
策略合规
运行时监控
让LLM在测试时通过迭代反馈积累经验,无需训练即可持续提升
Haoqin Tu, Yunhao Fang, Yizhong Wang, Cihang Xie, Shen Yan
反馈学习
大语言模型
测试时计算
自我改进
14.6万参数零样本概率预测器:免参数频谱检测周期,纯卷积可跑在MCU上
Armin Steinhauser
基础模型
时间序列预测
概率预测
边缘部署
零样本学习
155个日本长视频、1481道选择题,联合评测长视频叙事追踪与文化隐含义推理
Yuheng Huang, Jianlang Chen, Jiayang Song, Hua Qi, Aza Kai, Vincent Markert,...
基准评测
多模态大模型
文化理解
视频问答
长视频理解
固定回复重放把匹配分数分解为传输损伤与契约补偿,揭示命令路径如何颠覆模型排名
Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang
LLM智能体
Shell命令生成
基准评测
评测方法论
鲁棒性
只用夹爪几何训练CVAE学习接触分布,推理时才见物体,零样本生成灵巧抓取
Julien Merand, Boris Meden, Mathieu Grossard, Liming Chen
CVAE
机器人操作
灵巧抓取
点云
物体无关学习
以夹爪为中心学习接触流形,按人类抓取拓扑零样本合成灵巧抓取
Julien Merand, Boris Meden, Liming Chen, Mathieu Grossard
具身智能
机器人学习
灵巧抓取
生成模型
因果Transformer预测下一音频补丁嵌入,仅凭掩码加停梯度实现极简SOTA音频自监督
Umberto Cappellazzo, Xubo Liu, Stavros Petridis, Maja Pantic
Transformer
自回归预测
自监督学习
表征学习
音频表示学习