混合线性注意力+KPop RL+异步流水线,构建开放高效万亿智能体模型家族
Ang Li, Ben Liu, Bin Han, Bin Hu, Bin Jing, Binbin Hu, Bing Li, Cai Chen,...
2026-06-16
大语言模型
强化学习
智能体
模型架构
线性注意力
系统阐述LLM从对话助手到持久工作AI的演进路径,提出Workspace+Skill核心范式
Yongheng Zhang, Ziang Liu, Jiaxuan Zhu, Shuai Wang, Xiangqi Chen, Haojing...
2026-06-15
AI系统架构
大语言模型
工作空间
技能学习
推理模型
TreeSeeker将深度搜索组织为树结构的分支-返回搜索,通过文本UCB控制试验-错误过程,在有限预算下有效分配搜索资源。
Zhuofan Shi, Mingzhe Ma, Lu Wang, Fangkai Yang, Pu Zhao, Yiming Guan,...
2026-06-12
多步推理
探索-利用
智能体
树搜索
深度搜索
首个支持256K上下文的开源MoE多模态大模型,专注于长视频理解和智能体能力
Kwai Keye Team, Bin Wen, Changyi Liu, Chengru Song, Chongling Rao, Guowang...
2026-06-10
RLHF
多模态大模型
智能体
混合专家
稀疏注意力
提出分层图记忆与智能检索机制,将长视频理解转化为多步智能探索任务,实现感知与推理解耦
Cong Chen, Guo Gan, Kaixiang Ji, ChaoYang Zhang, Zhen Yang, Guangming Yao,...
2026-06-10
分层记忆
多模态
智能体
视频理解
长视频
通过构建场景记忆和技能库,学习场景感知的工具使用技能,解决 MLLM 智能体在 3D 空间推理中的工具误用问题
Haoyuan Li, Zhengdong Hu, Jun Wang, Hehe Fan, Yi Yang
2026-06-09
3D 空间推理
多模态大模型
工具使用
技能学习
智能体
首个系统性评测工具集成推理智能体在工具失败场景下动态重规划与异常恢复能力的基准
Dongsheng Zhu, Xuchen Ma, Yucheng Shen, Xiang Li, Yukun Zhao, Shuaiqiang...
2026-06-08
基准评测
工具使用
智能体
错误恢复
鲁棒性
Astra让VLM通过调用世界模拟器生成想象观测,学习何时、何地、如何想象以提升空间推理能力
Chenming Zhu, Jingli Lin, Yilin Long, Peizhou Cao, Tai Wang, Jiangmiao Pang,...
2026-06-08
世界模拟
强化学习
智能体
空间推理
视觉语言模型
提出被动注入、时序图谱和写入失效的交互式知识框架,将金融认知复杂性从用户转移到系统
Ailiya Borjigin, Igor Stadnyk, Ben Bilski, Maksym Chikita, Dmytro Kyrylenko,...
2026-06-05
RAG
智能体
知识图谱
金融AI
长期记忆
在冻结骨干上加验证驱动智能体,把车道地图自动化率推到95%+
Deguo Xia, Zihan Li, Haochen Zhao, Dong Xie, Yuyao Kong, Xiyan Liu, Jizhou...
2026-06-04
地图自动化
强化学习
智能体
自动驾驶
视觉语言模型
用团队体育作动态微观世界,构建覆盖感知到智能体合成的战略视频智能基准
Yulu Pan, Han Yi, Seongsu Ha, Md Mohaiminul Islam, Benjamin Zhang, Lorenzo...
2026-06-02
体育视频
因果推理
多模态大模型
战略推理
智能体
用代码作为画笔,将图像生成分解为概念化、草图和着色三阶段
Junyan Ye, Jun He, Zilong Huang, Dongzhi Jiang, Xuan Yang, Rui Chen, Weijia Li
2026-05-29
代码驱动
可解释性
图像生成
控制性
智能体
将长时程智能体的记忆管理建模为状态自适应问题,通过线索-页面架构实现意图驱动的记忆检索
Yuyang Hu, Hongjin Qian, Shuting Wang, Jiongnan Liu, Ziliang Zhao, Jiejun...
2026-05-27
强化学习
智能体
记忆管理
长时程推理
三智能体对抗流水线为电脑操作代理规模化合成带可验证奖励的RLVR数据
Bowen Wang, Dunjie Lu, Junli Wang, Tianyi Bai, Shixuan Liu, Zhipeng Zhang,...
2026-05-26
可验证奖励
强化学习
数据合成
智能体
计算机使用
首个支持单轮并行多工具调用的视频智能体RL框架PARA-GRPO,破解工具先验悖论。
Zuhao Yang, Kaichen Zhang, Sudong Wang, Keming Wu, Zhongyu Yang, Bo Li,...
2026-05-26
多模态大模型
工具调用
强化学习
智能体
长视频理解
用 L0–L4 五级自主性谱系与五维评估框架,重新定义 AI 在科研工作流中的角色与边界
Guiyao Tie, Jiawen Shi, Dingjie Song, Yixiao Huang, Ziji Sheng, Xueyang...
2026-05-26
AI for Science
工作流自动化
智能体
科研自动化
综述
检索增强的智能体框架,通过带元数据的策略库实现多目标Lean证明优化。
Jialin Lu, Soonho Kong, Rodrigo Stehling, Kaiyu Yang, Zhangyang Wang, Weiran...
2026-05-22
代码重构
形式化验证
数学定理证明
智能体
检索增强生成
用工具增强的智能体框架与门控强化学习实现零样本工业异常检测新 SOTA
Rongbin Tan, Fangfang Lin, Zhenlong Yuan, Min Qiu, Kejin Cui, Mengmeng Wang,...
2026-05-21
GRPO
多模态大模型
工业异常检测
工具增强
强化学习
预填充用FP4量化、解码保BF16精度,加速智能体LLM推理
Haiquan Lu, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang
2026-05-21
Blackwell
LLM推理加速
NVFP4
智能体
模型量化
工具增强VLM智能体+统一视频DiT,解决视频编辑请求欠指定难题
Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong,...
2026-05-20
工具调用
扩散模型
智能体
视觉语言模型
视频编辑