面向真实设备的统一 GUI+CLI 基础智能体,在移动端全面 SOTA。
Hanzhang Zhou, Panrong Tong, Xu Zhang, Quyu Kong, Chenglin Cai, Tianyu Xia,...
GUI Agent
Sim-to-Real
在线强化学习
多模态大模型
强化学习
将论文分解为可溯源的原子声明,重构化学跨论文检索的基础设施
Bing Yan, Gregory Wolfe, Stefano Martiniani, Kyunghyun Cho
化学信息学
声明抽取
检索增强生成
知识图谱
科学文献检索
首个把记忆能力内化进基础模型参数与前向计算的模型原型
Zeyu Zhang, Ziliang Guo, Yihang Sun, Xichong Zhang, Xixuan Hao, Zehao Lin,...
AI智能体
中期训练
原生记忆
参数化记忆
快权重编程
开源全栈OpenMLE训练元进化智能体,MLE-Bench Lite奖牌率达71.21%。
Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren, Weizhi Wang, Kaikai...
AI4AI
RLVR
代码智能体
强化学习
机器学习工程
从野外视频自监督学习离散'物理语言',先推理后渲染的物理世界模型。
Shuyao Shang, Yuqi Wang, Ruopeng Gao, Xu Chen, Tieniu Tan, Lue Fan, Zhaoxiang Zhang
世界模型
扩散模型
物理世界
自监督学习
视觉语言模型
用可执行 Blender 代码充当过程级思维链,双引擎系统生成物理一致视频。
Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He,...
Blender
代码智能体
思维链
扩散模型
物理仿真
把长期记忆做成可独立预训练的参数化模块,410M+6.9B记忆超过12B模型
Rubin Wei, Jiaqi Cao, Jiarui Wang, Junming Zhang, Qipeng Guo, Bowen Zhou, Zhouhan Lin
kNN语言模型
分布式检索
参数化记忆
模型缩放
长期记忆
让多模态大模型学会按需调用视觉工具,既不过度也不漏用,真正提升能力。
Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi...
RLVR
多模态大语言模型
工具调用
强化学习
智能体视觉推理
RAG 范式规模化研究:BM25 在大语料上反超 Agent 与图检索
Pengyu Wang, Benfeng Xu, Shaohan Wang, Xin Zeng, Huarui Wu, Lei Zhang, Licheng Zhang
BM25
企业知识库
图检索
智能体检索
检索增强生成
通过反向KL分解,把演化上下文作为在线监督信号注入蒸馏目标。
Yuran Wang, Zekun Wang, Bohan Zeng, Ruixu Zhang, Wenxuan Liu, Liu Yang,...
上下文蒸馏
医学问答
反向KL分解
在线策略蒸馏
大语言模型
把真实家庭改造成同步多模态录制棚,构建具身AI的长时程人-物交互数据引擎
Yukang Cao, Haozhe Xie, Beichen Wen, Runmao Yao, Yinghao Liu, Yue Huang,...
人-物交互
具身智能
动作捕捉
基准评测
多模态数据集
用冻结3D人体网格重建量化多人交互编辑的解剖与接触几何,揭示VLM裁判的饱和盲区
Jiajia Lin, Mingxuan Du, Tuowen Zhou, Benfeng Xu, Hongtao Xie
人体网格重建
图像编辑
基准测试
多人交互
接触几何
用真实用户历史训练用户模拟器,对角色扮演智能体做人格对齐的自由多轮评测。
Yuhang Zhu, Mingxuan Du, Benfeng Xu, Jie Gao, Lingyun Yu, Hongtao Xie
LLM评判
LoRA微调
个性化评测
基准评测
多轮对话
提出多参考图锚定的视频描述新任务,用两阶段后训练实现短语级图像标签绑定。
Tengfei Liu, Yang Shi, Yuran Wang, Xiaohan Zhang, Yuqing Wen, Yuqi Tang,...
GRPO强化学习
参考图锚定
多模态大模型
视觉定位
视频描述
提出含1.2K基准与VAoT协议的See2Think框架,分离视觉状态效用与行为依赖。
Siyu Yan, Zhuoran Yan, Haiying Xu, Panhao Zhou, Jingyu Chen, Chenhao Ji,...
可解释性诊断
基准评测
多模态推理
视觉动作
视觉思维链
三阶段框架让VLM先调用专业视觉工具,再把工具能力内化为无工具推理。
Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen,...
具身智能
工具调用
强化学习
空间推理
视觉语言模型
把在线自蒸馏视为β=1的KL正则化策略优化特例,借logit插值与回报到当前信贷分配改进推理
Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang
RLHF
强化学习
推理大模型
知识蒸馏
策略优化
用同一动力学的两次重渲染构造影子对,让世界模型实现任意动作的帧级控制
Jin Cao, Zian Meng, Kaipeng Zhang
动作迁移
可识别性理论
潜在动作模型
自监督表征学习
视频世界模型
混合线性/全局注意力的视觉扩散 Transformer,以模块级扩展律实现 7.3 倍算力效率
Chongjian Ge, Hanwen Jiang, Tianyu Wang, Jiuxiang Gu, Yiran Xu, Ziwen Chen,...
扩展律
混合架构
稀疏专家MoE
线性注意力
视觉扩散模型
首个用大模型做母单执行的层次化框架PACE,分长期规划与短期执行,超TWAP基线1.02bps
Zane Shen, Xinli Xu, Guangyi Zhang, Jialong Chen, Jinsong Zhou, Cong Chen,...
TWAP
大语言模型智能体
层次化规划
母单执行
算法交易
训练时探索K个候选并训练最优者,为生成模型新增缩放轴并实现端到端生成
Alexi Gladstone, Heng Ji, Yilun Du
best-of-K
多模态分布
扩散模型
生成模型
端到端训练
在线可靠性记忆,记录对等体历史能力与关系证据,稳定指导多智能体协调
Peilin Feng, Suorong Yang, Soujanya Poria
LLM智能体
可靠性记忆
多智能体系统
对等体选择
残差引导
用统一策略在行动前依据当前状态重构检索经验,GRPO 端到端训练
Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei,...
GRPO
LLM智能体
POMDP
强化学习
经验重构
用单一共享动作算子把JEPA世界模型变成免搜索、可直接部署的意图到动作接口
Junhan Sun, Hao Zhao, Guofeng Zhang
JEPA
model-based RL
世界模型
免搜索控制
意图到动作
用结构化证据账本约束多模态智能体推理,让每条结论都有溯源、可审计、不越改越错。
Enjun Du, Hange Zhou, Chenxu Du, Siyi Liu, Zirong Chen, Ziyu Zheng, Yongqi Zhang
可溯源推理
多模态智能体
幻觉检测
智能体轨迹审计
证据账本
构建深度可演化合成环境与协同进化循环,让9B计算机使用智能体逼近前沿模型
Yash Pandya, Sahil Gupta, Sarthak Harne, Archana Yadav, Kavyansh Chourasia,...
协同进化
合成训练环境
强化学习
智能体评测
计算机使用智能体
系统刻画智能体文件系统记忆的组织价值、成本与可持续性
Sizhe Zhou, Sheldon Yu, Hui Wei, Junda Wu, Siru Ouyang, Yizhu Jiao, Shijia...
LLM智能体记忆
实证研究
工具组合
技能学习
文件系统记忆
把注意力残差的单查询路由多头化,零参数零额外计算即提升跨层信息读取
Cheng Luo, Zefan Cai, Junjie Hu
Transformer架构
Triton内核
多头注意力
持续预训练
残差连接
训练单个可学习令牌在值空间检索,让VLM精准定位长视觉上下文中的相关帧。
Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem
值空间检索
可学习令牌
注意力机制
视觉语言模型
视频理解
系统剖析推测解码有损验证,揭示截断式与协作式两大范式及其失败模式。
Tianyu Wang, Yuxuan Zhou, Wenbin Wang, Heng Li, Zikai Xiao, Junyuan Shang
EAGLE-3
协作解码
大模型推理加速
截断采样
推测解码
免训练的模态解耦Token压缩框架,共享查询但独立估计各模态显著性,实现3.53倍预填充加速
Jinsen Su, Yongdong Luo, Yuexiao Ma, Yibo Hu, Meiguang Jin, Xiaowu Zheng
Token压缩
全模态大语言模型
推理加速
视频理解
跨模态对齐
用有限动作菜单重构检索接口,解决检索等价坍缩
Yanning Hou, Haoyuan Chen, Sihang Zhou, Xiaoshu Chen, Xirui Liu, Duanyang...
信用分配
图检索
多跳问答
强化学习智能体
检索增强生成
多个人格化 LLM 智能体通过对话与投票协同商定群体旅行行程
Daisuke Kikuta
LLM智能体
多智能体系统
旅行规划
模拟框架
群体决策
用2×2因子实验拆解MoE路由,发现专家子空间重叠却仍各自有功能价值
Huiyuan Tian, Bonan Xu, Shijian Li
专家子空间几何
因子实验设计
机制分析
模型可解释性
混合专家模型
构建误导知识评测框架MisKnow-Agent,单篇假文档即令54.7%的研究报告采信虚假结论。
Pengyu Zhu, Lijun Li, Longju Yang, Sen Su
Deep Research Agent
LLM Agent
RAG鲁棒性
可靠性评估
红队测试
用差分激活定位偏见神经元,零化至多40个即可解耦偏见与能力
Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López
GLU架构
人口偏见消除
大语言模型
机制可解释性
神经元剪枝
自适应多教师蒸馏框架,用单类SVM加权与关系相似矩阵损失压缩语音情感模型到边缘设备
Yuqi Li, Yi-Cheng Lin, Xianglong Wang, Kuo Yang, Xiaoqin Feng, Yixuan Wang,...
多教师学习
情感计算
知识蒸馏
自监督学习
语音情感识别
在原12种原型基础上新增7种危险行人原型,扩大AV安全测试覆盖范围。
Taorui Huang, Namita Gaidhani, Ritvik Bansal, S M Jubaer, Regina Lim, Rhett...
仿真测试
安全测试
自动驾驶
行为本体
行人原型分类