AREX用内外双循环递归地自我改进,靠验证驱动的研究状态刷新深度搜索水平。
Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Zheng...
MoE
上下文管理
强化学习
智能体训练
深度研究智能体
从人教版教材抽取课程知识图谱,统一支撑教育大模型的评测与微调。
Hao Liang, Qihan Lin, Zhaoyang Han, Xiaochen Ma, Zhen Hao Wong, Meiyi Qiang,...
K12教育
基准测试
多模态
指令微调数据
教育大模型
将目标识别建模为索引候选框的单token选择,结合TVBI时序记忆实现单目具身跟踪
Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang, Weisi Situ,...
具身视觉跟踪
思维链推理
机器人导航
目标指代
视觉-语言-动作模型
用原图与擦除图像的预测对比构造自蒸馏目标,无需外部教师或答案提示。
Yijun Liang, Yunjie Tian, Yijiang Li, Yuqi Jia, Furong Huang, Tianyi Zhou, Di Fu
多模态后训练
对比学习
知识蒸馏
自蒸馏
视觉语言模型
混合线性与softmax注意力,单卡生成比全softmax视频DiT快3.2倍
Junsong Chen, Jincheng Yu, Yitong Li, Shuchen Xue, Haozhe Liu, Jingyu Xin,...
扩散Transformer
注意力残差
混合注意力
线性注意力
视频生成
提出 ProVisE 与 SpatialGen-Bench,让文生图模型在像素空间作答并公平评测。
Xu Wang, Kaixiang Yao, Miao Pan, Xiaohe Zhou, Xuanyu Liu, Wenqi Zhang, Xuhong Zhang
Benchmark
文生图模型
空间推理
空间认知评测
视觉语言模型
把智能体做成 Python 类:方法即动作、字段即状态、类型即契约的 Agent 框架。
Paul Furgale, Severin Klingler, James Nolan, Matt Staats, Gaia Di Lorenzo,...
AI Agent 框架
LLM 编程
Python 面向对象
上下文工程
代码即动作(CodeAct)
覆盖代码/前端/办公/安全四领域的开放代码智能体评测套件,通过构造抗 prompt 污染
Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen, Xiang Fei, Yong Mao,...
LLM-as-Judge
代码智能体
前端开发
办公自动化
基准测试
把单轮基准升级为意图演变多轮对话,揭示前沿LLM难以跟踪变化的用户意图
Jihoon Tack, Philippe Laban, Jennifer Neville
LLM智能体
多轮对话评估
对话建模
智能体基准
用户意图跟踪
将手机摄像头与屏幕视为耦合系统,端到端学习校正以还原真实场景色彩
Ruikang Li, Molin Li, Jiarui Wu, Zhe Wei, Pengpeng Liu, Tianfan Xue
图像处理
相机-显示耦合
神经网络
计算摄影学
颜色复现
在冻结图像骨干特征上学习主/残差结构化运动 token,自监督分离相机与物体动态
Lukas Knobel, Andrew Zisserman, Yuki M. Asano
冻结骨干
自监督学习
视觉Transformer
视频表示学习
运动分解
把智能体交互经验蒸馏进权重,无需额外环境采样即可保留大部分上下文学习增益。
Chenhui Gou, Haoqin Tu, Yunhao Fang, Jianfei Cai, Hamid Rezatofighi
上下文学习
强化学习
智能体学习
样本效率
知识蒸馏
用持久的世界状态寄存器让多智能体视频世界模型保持跨视角一致性
Sicheng Mo, Yuheng Li, Ziyang Leng, Krishna Kumar Singh, Bolei Zhou
Minecraft
Mixture-of-Transformers
世界模型
多智能体
扩散模型
复用教师轨迹做离线多轮 agent 蒸馏,零工具调用、4倍加速且不掉点。
Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong, Furu Wei
多轮交互
强化学习
智能体
模型压缩
知识蒸馏
用散度方向导数重定义信任域方向判据,改进LLM强化学习稳定性。
Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang,...
PPO
信任域
大语言模型
强化学习
策略优化
仅用单目RGB即达具身导航SOTA的8B视觉语言模型
Arjun Majumdar, Avinash Sooriyarachchi, Benjamin Tibi, Chris Bamford, Elliot...
具身导航
强化学习
机器人
视觉语言模型
高效训练
用共享正弦块递归展开替代加深网络,以更少参数和迭代实现高保真信号表示
Hyunmin Cho, Jaejun Yoo, Kyong Hwan Jin
图像拟合
谐波频谱分析
递归网络
隐式神经表示
频谱偏置
面向工业级金融文档的双语智能体推理基准,揭示当前系统的推理与布局短板。
Xianfu Cheng, Shiwei Zhang, Jiyu Zhao, Jian Yang, Xinyuan Wang, Ming Zhou,...
基准测试
多跳推理
文档布局理解
智能体推理
检索增强生成
用可编辑的有向交互图取代轨迹控制,冻结视频DiT加LoRA实现多物体可控生成
Vedant Shah, Onkar Susladkar, Tushar Prakash, Kiet Nguyen, Tianjio Yu,...
参数高效微调
可控视频生成
图神经网络
场景图
扩散模型
用轻量代理与容器编排解耦训练与推理,让任意 harness 和环境直接接标准 RL 训练
Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao,...
GRPO
GUI 智能体
容器编排
工具调用智能体
强化学习
真实图像自动重建十万个物理一致的桌面仿真场景与抓取轨迹
Boyuan Wang, Yue Zhang, Xutao Xue, Xueyu Song, Yu Sun
Real2Sim
仿真数据集
场景重建
抓取与运动规划
机器人操作
提出可微影响估计器,让合成数据对最终模型参数的影响直接匹配全量数据
Haoru Tan, Wang Wang, Sitong Wu, Xiuzhe Wu, Yangtian Sun, Chirui Chang,...
影响函数
数据集蒸馏
视觉-语言
训练动力学