固定编码智能体,专测模型的循环调度指挥能力,全任务最佳成功率仅24.69%
Yi Wang, Haopeng Zhang, Chengxiang Huang, Rui Dai, Kaikui Liu, Piotr...
Agent Orchestration
Coding Agent
Evaluation Methodology
LLM Benchmark
Loop Engineering
把执行轨迹建成状态图,定位首个偏离断点,仅对恢复段做局部监督的自蒸馏框架
Hangrui Xu, Jiarui Wang, Yang Yang, Chuanbo Zhu, Fangda Chen, Ziqi Wu,...
LLM智能体
后训练
图结构建模
多轮工具调用
自蒸馏
以表征为中心的持续预训练,用开源数据加16卡算力训出可迁移的VLA骨干
Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun...
VLA
多任务监督
持续预训练
机器人学习
表征学习
以交付工件为分析单元,用状态化构建框架统揽259项智能体创作研究与评估
Tianfu Wang, Zhezheng Hao, Xilin Xia, Lixin Liu, Mengkang Hu, Hongzhang Liu,...
LLM智能体
人机协同
多智能体
工件创作
综述
将物理世界表示为可执行代码,用智能体闭环发现世界并为VLM提供可扩展物理监督
Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun, Qiyu Dai,...
世界模型
可执行代码表示
强化学习
智能体
物理推理
三方自博弈让裁判与解题者共同进化,突破固定裁判的自改进上限
Gyouk Chu, Myeongho Jeon, Eunho Yang
奖励模型
强化学习
自博弈
自进化
零数据
冻结模型权重,自动演化智能体框架,三大企业基准提升20-35个百分点
Esakkivel Esakkiraja, Denis Akhiyarov, Vikas Yadav, Sai Rajeswar, Patrice...
LLM智能体
企业自动化
智能体框架演化
自动提示工程
跨模型迁移
消费级 RTX 5090 上以 $6.9K 从零预训练 2B 模型,逼近 Qwen2.5-1.5B
Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang...
FP8低精度训练
Muon优化器
Scaling Law
低成本预训练
开源复现
仅用12帧局部上下文与可组合的局部预测,实现超长视频流式3D重建与低漂移位姿估计
Jiarong Han, Jincheng Xiong, Yuzhou Liu, Linzhe Shi, Changjie Wu, Ning Guo,...
SLAM
因果Transformer
流式3D重建
视觉里程计
长视频理解
用冻结教师VLM把已执行行为的语义目标蒸馏进VLA动作解码器,大幅提升操作成功率与泛化
Sangoh Lee, Sangwoo Mo, Wook-Shin Han
具身智能
意图蒸馏
机器人操作
知识蒸馏
行为克隆
剖析DiT层间记忆偏好,让有界内存的自回归视频模型按状态检索远期历史并只注入敏感层
Yixuan Ding, Jiahao Kong, Wei Huang, Ruijie Quan, Yi Yang
扩散Transformer
注意力分析
知识蒸馏
视频生成
记忆机制
把循环状态视为读后写语义下的在线学习器,导出归一化 Falcon 更新族,提升长度外推
Yifan Zhang, Steve Ta, Jasper Zhang, Jichen Feng, Shuzhen Li, Yongxin Zhang,...
序列建模
快速权重
持续学习
状态空间模型
线性注意力
扩展上下文管理工具集,用细粒度强化学习教智能体主动管理自身工作上下文
Zhuoshi Pan, Qizhi Pei, Junru Lu, Honglin Lin, H. Vicky Zhao, Di Yin, Xing Sun
上下文管理
信用分配
强化学习
智能体
长上下文
把时空管解码深度压到固定1+1轮,延迟降79倍、吞吐升92倍且精度更优。
Hanoona Rasheed, Haania Siddiqui, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan
多模态大模型
强化学习
时空定位
视频理解
高效推理
ElephantBench闭卷探针揭示:最强模型对长尾分歧事实也仅能完整回忆52.4%
Zhuoshi Pan, Junru Lu, Yan Qian, H. Vicky Zhao, Di Yin, Xing Sun
参数化记忆
基准评测
知识冲突
长尾知识
闭卷问答
提出EASEL基准,以参考引导绘画评测多模态智能体的闭环参数化视觉动作能力
Shudong Liu, Dongyang Chen, Enci Zhang, Jinwei Liang, Zheng Ma, Lewei Lu
基准测试
多模态智能体
视觉工具使用
轨迹监督
闭环控制
4B步骤级护栏模型,以前缀对齐数据与Balance-GRPO校正防御偏置,ASR降77.3%
Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao,...
Agent安全
GRPO
合成数据
强化学习
护栏模型
零训练的带槽滑窗注意力在短长上下文任务上追平甚至碾压昂贵的后训练线性注意力
Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais
KV缓存
LLM推理效率
注意力机制
滑窗注意力
线性注意力
环形数据构造强制模型检索远期历史,实现分钟级长视频与客体永久性
Bowen Xue, Brandon Y. Feng, Chenguo Lin, Yuchen Lin, Yujia Zeng, Lvmin...
客体永久性
扩散模型
自回归生成
视频生成
长期记忆
复用预训练MLLM原生上下文作机器人记忆,以异步连续认知令牌驱动VLA控制器
Suhwan Choi, Jaeyoon Jung, Sungkyung Kim, Yunsung Lee, Youngjae Yu
VLA
双系统架构
异步推理
情景记忆
机器人操作
把视频扩散模型的下一帧预测改造成深度与法线联合估计,数据效率提升近百倍
Haosen Yang, Jifei Song, Zhensong Zhang, Xiatian Zhu, Jiankang Deng
Stable Video Diffusion
深度估计
统一几何估计
表面法线估计
视频扩散模型
给LLM智能体自我修改配可验证撤销方案,分离寻址与表达力两类恢复瓶颈。
Tanmay Sah, Dolly Sah, Harshul Jain, Tanya Sah
LLM智能体
可恢复性验证
形式化方法
智能体安全
自演化
RCCA把评分规则级功能反馈定位到代码片段,转化为GRPO的token级优化权重。
Rui Jin, Jikai Chen, Yihan Chen, Hao Zhou, Demin Zhu, Kaichen Yang, Dong...
GRPO
Web应用生成
代码生成
信用分配
奖励设计
把英语偏好知识当锚点,将跨语言对齐改造成层级排序问题,同时优化语言一致性与回答质量
Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim
DPO
低资源语言
偏好优化
多语言对齐
学习排序
把LSM的调解-策略-执行分离搬进LLM推理服务,让可解释性信号变成可运行的输出门禁。
XiuYu Zhang, Bonan Ruan, Junfeng Fang, An Zhang, Tat-Seng Chua, Zhenkai Liang
LLM安全
可解释性
推理服务
系统安全
运行时防御
用生成事实图统一训练、学习与推理动力学,二阶预测器达91.43%边界预测准确率
Mian Wang
nanoGPT
可解释性
溯源与生成事实
神经网络动力学
训练可预测性
免重训地在单位球面上做偏差感知的测地引导,大幅降低生成式VLM人口学偏见且不损通用能力
Yiqun Sun, Junyu Chen, Pengfei Wei, Lawrence B. Hsieh
公平性与去偏
推理时干预
激活引导
球面几何
视觉语言模型
广覆盖SFT获取参与,回合级DPO修复可验证错误,权重缩放保留通用能力
Nan Li
DPO
LoRA
偏好优化
后训练配方
对话博弈智能体
用“提问的未来收益减去交互成本”的决策奖励训练LLM策略,学会何时追问、何时纠正。
Xiaoying Song, Anirban Saha Anik, Jinyu Liu, Qitao Tan, Geng Yuan, Lingzi Hong
GRPO
LLM用户模拟
健康错误信息干预
决策框架
多轮对话
一套离散扩散框架身兼三职:合成配对数据、从噪声补全、一步修正冻结模型,达38.8% mIoU
Shi Chen, Weifeng Ge
LiDAR
合成数据
模型修正
流匹配
离散扩散
英语监督的提示压缩器在非英语语言上失效,根源在训练监督而非架构
Mantas Lukauskas
大语言模型
提示压缩
评估审计
跨语言迁移