用环境扩展与智能体协作扩展两条路线,把推理模型变成能完成长周期复杂工作的系统。
Apodex Team, B. An, B. Li, B. Wang, B. Zhang, B. L. Wang, C. Feng, C. Wei,...
AgentOS
多智能体协作
强化学习
技术报告
智能体
以相机意图为统一接口,边导航边联合生成720p视频、环境音与语音的可进入世界模型
Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang, Xin Lu,...
世界模型
交互式生成媒体
全模态生成
相机轨迹控制
自回归扩散
阿里开源的电商直播全模态理解模型,用音视频时间对齐与忠实强化微调实现多项直播任务开源最佳。
Yibo Hu, Yu Qian, Mao Gu, Yingfan Tao, Yuhao Chen, Yongdong Luo, Zhuoqun...
GRPO
全模态大模型
强化学习后训练
数据引擎
电商直播
用千级细粒度概念库与组合式密集监督,刷新图像编辑SOTA并压缩训练样本需求1.5倍。
Long Cui, Xiaoqian Liu, Qi Qin, Yi Xin, Tao Lin, Jianguo Li, Linfeng Zhang
图像编辑
密集监督
扩散模型
指令跟随
数据合成
开源长程智能体框架,以持久REPL与递归子智能体将ARC-AGI-3成绩从30%提升至95.5%
Seth Karten, Alex L. Zhang, Kevin Thomas, Sebastian Müller, Elie Bakouch,...
上下文管理
多智能体协作
智能体框架
递归语言模型
长程任务
交互式有状态移动沙盒,四维评测移动规划智能体的工具调用与规划能力
Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen,...
LLM智能体
基准评测
多智能体协作
工具调用
移动AI
把3D形状码的逐token自回归解码改为块间因果、块内并行去噪加置信度修正,提速5.15倍
Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu...
3D网格生成
块级扩散
文本到3D生成
离散去噪
自回归生成
两次前向传播即可定位自回归模型的因果泄露层,并在Zamba2与Nemotron-H中发现真实缺陷
Taebong Kim, Youngsik Hong, Minsik Kim, Sunyoung Choi, Jaewon Jang, Minseo Kim
前缀不变性
因果泄露
模型审计
混合架构
状态空间模型
发现原始行为数据扩展的饱和墙,提出行为致密化定律与自适应分词ALGN
Bin Dou, Junru Zhang, Zhaoyi Yuan, Wuliang Huang, Letian Gong, Baokun Wang,...
RQ-VAE
工业大规模
推荐系统
用户表征学习
缩放定律
按预期规划收益逐步决定想象深浅,让世界动作模型在质量与算力间自适应权衡。
Hongbo Lu, Liang Yao, Chenghao He, Hao Han, Fan Liu, Wenlong Liao, Tao He, Pai Peng
世界动作模型
反事实数据
端到端规划
自动驾驶
自适应计算
用窗口分离训练与位姿地标库,让交互式世界模型兼得精准控制、长时记忆与实时流式生成
Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu,...
KV缓存压缩
交互式世界模型
扩散蒸馏
流式视频生成
相机控制
用策略条件化分组消除开放式智能体RL中跨策略比较偏差
Yongqi Tong, Tan Li Hui Faith, Choy Zhen Wen Marcus, Zhou Jin, Kewei Fu,...
LLM智能体
人机交互
优势估计
奖励模型
工具调用
把KL正则从响应侧移到查询侧,稳住训练环境漂移又不牺牲探索
Xianlei Zhou, Xiangdi Meng, Yu He, Tianyu Qi, Shuyan Guan, Xianli Zhang,...
GRPO
LLM强化学习
RLVR
正则化
训练稳定性
首个贯通游戏生成、缺陷修复与多轮优化的编码智能体全生命周期游戏开发评测基准
Kun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie,...
多轮交互优化
执行落地评估
游戏开发
程序修复
编码智能体
首个长轨迹失败归因基准:1140条真实失败轨迹,定位责任角色与最早根因步
Yunfei Zhang, Boyu Feng, Changhua Pei, Zexin Wang, Zhihuang Peng, Xinlong...
多智能体系统
失败归因
智能体评测基准
根因分析
长程轨迹
沙箱+基准揭示:智能体一次成功容易,可靠完成有状态业务工作流仍很难
Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez...
MCP
可靠性基准
工具调用
智能体评测
有状态工作流
验证任务集随harness共同进化,用20%评测预算达到全量搜索效果
Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki
Harness优化
LLM智能体
评测效率
采样估计
从原始未压缩模型蒸馏修复压缩+4bit量化LLM,比QAT快7倍且无需早停
Bakbergen Ryskulov, Iker García-Ferrero, David Montero, David Jansen, Ali...
LLM高效推理
模型压缩
知识蒸馏
量化
双阶段自主科研系统:机制洞见接地选题,独立证据评审杜绝幻觉结论
Yiming Ren, Xiang Liu, Qumeng Sun, Xiao Zhang, Jiahao Li, Haoyang Zhang, Junjie Wang
LLM智能体
多智能体
科研自动化
自主科研
证据验证
用独立估计的推理进展排序检测并屏蔽误导性蒸馏监督,显著提升 OPD 推理能力
Chen Yang, Haiyuan Wan, Rengrong Xiong, Yize Chen, Danny H. K. Tsang
后训练
在策略蒸馏
大语言模型推理
奖励过滤
过程奖励
结构更复杂的多跳RAG反而放大上游语音识别错误,查询实体损坏占失败案例的87–96%
Zhenghua Bao
口音偏差
多跳问答
实证评测
检索增强生成
语音识别
778个机器可验证长工作流任务证明验证器确认的执行经验Gene显著优于Skill
Xiao Zhang, Qumeng Sun, Jihao Li, Yiming Ren, Xiang Liu, Haoyang Zhang, Junjie Wang
LLM智能体
基准评测
经验复用
长工作流
FORGE基准揭示:单条被污染网页即可让12个主流LLM推荐假品牌,中招率最高73.8%
Minghao Luo, Liang Chen
GEO网页污染
LLM安全
基准构建
推荐系统
检索增强生成
用OCR抽取加五场景RAG问答合成流水线,把906份松下工业文档变成13.6k条微调与评测数据。
Parsa Bakhtiari, Hassan Bashiri, Alireza Khalilipour, Masoud Nasiripour,...
合成数据生成
小语言模型
工业问答
指令微调
数据集构建
在融合注意力内核内按分数Tile组路由FP16/INT8精度,稠密全连接下加速长上下文预填充
Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng
GPU算子融合
LLM推理加速
Triton
注意力内核
混合精度量化
用有标准答案的星系基础模型校准 LLM 可解释性:概念按物理难度依次涌现,探针几何复原已知物理关系
UniverseTBD, Kshitij Duraphe, Aman Kumar, Michael J. Smith, Shashwat Sourav
AstroPT
天文基础模型
机制可解释性
涌现动力学
线性探针
语料扩容能让固定的RAG系统答案系统性漂移,而总准确率几乎纹丝不动。
Jingjie Ning, Xueqi Li
LLM-as-a-Judge
RAG评估
向后兼容
回归测试
检索增强生成
因果探针证明宽上下文是陷阱,多轮窄窗口生成带来最高约20个百分点的召回跃升
Peiyang Liu, Xi Wang, Di Liang, Wei Ye
RAG
上下文归因
因果测量
推理时扩展
搜索多样化
以传统仿真器八项能力为标尺审计200篇文献,指出状态反馈与物理引擎是结构性缺口
Tong Wang, Huan Deng, Mucheng Yang, Yang He, Xiaohui Kuang, Gang Zhao
世界模型
仿真器
具身智能
综述
自动驾驶
以执行轨迹联合诊断“模型+运行时”配置的能力、可靠性与运行时敏感性
YuanHang Xiao
可靠性分析
基准测试
安全门控
智能体评测
轨迹评分
首个原生10240核苷酸上下文的十亿级双向RNA基础模型,统一长RNA表征学习与全长mRNA设计
Ziyuan Wang, Bohao Tang, Fei Zhang, Shuo Han, Pengfei Liu
RNA基础模型
mRNA设计
双向Transformer
掩码语言建模
离散扩散
混合量子启发KAN以更少参数与通信量在联邦ECG分类上稳定超越MLP
Chun-Hua Lin, Samuel Yen-Chi Chen, Yu-Chao Hsu, Kuo-Chung Peng, Jiun-Cheng...
ECG分类
Kolmogorov-Arnold网络
参数效率
联邦学习
量子机器学习
仅用蔬菜训练的活体检测器在人脸基准达92.7% AUC,证明PAD学的是采集伪影而非人脸
Guray Ozgur, Fadi Boutros, Naser Damer
人脸活体检测
参数高效微调
基准数据集
跨数据集泛化
隐私保护
每时间步压缩为一个世界token、以物理时间为轴的因果序列机器人模仿学习策略
Chunkai Yang, Andong Yang, Chao Gao
Transformer
序列建模
扩散策略
机器人模仿学习
缩放定律
轻量适配器把冻结视觉-语言模型对齐到冻结人脸识别空间,提示词变语义锚点,无标注完成解释与审计。
Guray Ozgur, Mustafa Efe Tamyapar, Naser Damer, Fadi Boutros
事后对齐
人脸识别
可解释性
模型审计
视觉-语言模型