摒弃LLM中转,用轻量编码器与双向跨注意力直接预测动作,实现32Hz实时控制
Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang, Di Xu,...
实时推理
效率优化
机器人操作
行为克隆
视觉-语言-动作模型
用分布对齐视角重做自回归视频蒸馏,联合DMD与CD损失。
Jiaxing Li, Kai Zou, Cindy Zhou, Kaichen Huang, Junyao Gao, Zile Wang, Yang...
Flow Matching
V-JEPA2
一致性蒸馏
分布匹配蒸馏
模型蒸馏
用反事实回放为GRPO分配令牌级信用,无需训练评分器即可提升指令跟随RL效果
Bo-Wen Zhang, Junwei He, Wen Wang, Song-Lin Lv, Wentao Ma, Rongyi Lin,...
GRPO
信用分配
反事实推理
大语言模型后训练
强化学习
冻结 VLM 通过原子技能控制人形身体,瓶颈不在感知而在具身自意识。
Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng...
人形动作生成
具身智能
具身评测基准
动作决策
半物理仿真
解耦评分目标,让求解器与评分量规在文本空间协同进化
Jiangwang Chen, Zixin Song, Junlin Liu, Shuaiyu Zhou, Haiyan Wu, Haihan Shi,...
LLM评判
协同进化
技能进化
文本空间优化
评分量规
提出多模态上下文学习三级能力评测基准,最强模型总分仅0.28
Lai Wei, Chengqi Li, Jiapeng Li, Ruina Hu, Yue Wang, Weiran Huang
上下文学习
基准评测
多模态大模型
视觉问答
长文档理解
把游戏求解器的状态价值变化转成逐回合信用信号,注入 RLVR 实现无需 logits 的策略蒸馏
Yu Wang, Yi-Kai Zhang, Wentao Shi, Ziang Ye, Yuchun Miao, Yueqing Sun, Qi...
GRPO
LLM 智能体
RLVR
信用分配
强化学习
单一策略在任务序列中边解题边整理技能文档,实现端到端的可迁移技能学习。
Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo,...
大语言模型
强化学习
技能学习
智能体
跨任务迁移
用无源程序合成轨迹蒸馏27B模型,逼近前沿大模型的编程能力
Yihao Chen, Shi Chang, Khaled Chawa, Feng Lin, Boyuan Chen, Shaowei Wang,...
代码合成
小语言模型
无源逆向工程
知识蒸馏
训练数据生成
专门的规格代理先黑盒探针抽取行为规约,再交给代码合成代理实现
Yihao Chen, Shi Chang, Feng Lin, Khaled Chawa, Boyuan Chen, Shaowei Wang,...
LLM代理
ProgramBench
代码智能
程序合成
规格抽取
联合预测游戏内部状态与视觉帧,让世界模型遵守血量/技能条等规则
Zijun Lin, Zeqing Wang, Cheston Tan, Bihan Wen, Yeying Jin
机制一致性
格斗游戏AI
流匹配视频生成
混合Transformer
游戏世界模型
提出影子评估法,测试前沿智能体能否独立完成开放式 AI 研究并写出顶会论文
Peter Kirgis, Sayash Kapoor, Andrew Schwartz, Stephan Rabanser, David...
AI智能体
AI研究自动化
前沿模型
同行评审
影子评估
首个联合评测遥感类别广度与查询多样性的开放词汇基准
Kaiyu Li, Zepeng Xin, Zixuan Jiang, Jing Fu, Lanxuan Xue, Lingyu Zhang, Xiangyong Cao
多模态大模型
开放词汇遥感
目标检测
评测基准
语义分割
以表示、更新动态、持久性三轴统一梳理大语言模型的记忆架构设计空间
Sining Zhoubian, Dan Zhang, Evgeny Kharlamov, Jie Tang
LLM记忆机制
架构综述
测试时训练
混合专家
状态空间模型
首个为长周期办公套件任务提供任务级经济标注的LLM智能体评测基准
Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao,...
LLM智能体
交付物质量评测
代码化验证
办公套件自动化
经济价值评估
用一份可编辑文本记忆让冻结ASR纠错器学会何时纠正、何时克制,无需任何训练。
Chao-Han Huck Yang, Zih-Ching Chen, Piotr Zelasko, Zhehuai Chen, Jagadeesh...
ASR纠错
噪声鲁棒性
文本空间优化
智能体语音识别
测试时自适应
提出TriLayer三元组数据集与双分支扩散框架,实现视频物体的显式分层插入与分解。
Kyujin Han, Seungjoo Shin, Sunghyun Cho
图层分解
扩散模型
数据集构建
视频生成
视频编辑
通过大规模自博弈训练的自动化红队智能体,提示注入攻击能力超越人类红队
Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal, Sam Toyer,...
GPT-5
LLM安全
对抗训练
指令层级
提示注入
统一在线蒸馏框架修复三大失效模式,0.5B学生达GSM8K 69.8%
Satyam Kumar, Saurabh Jha
在线策略蒸馏
大模型推理
小模型高效训练
强化学习
知识蒸馏
首个衡量攻击型智能体操作隐蔽性(OPSEC)的基准,发现所有模型都有系统性隐蔽失败。
Ads Dawson, Adrian Wood
LLM-as-Judge
安全智能体评估
操作安全(OPSEC)
攻击型AI
红队/漏洞赏金
把圣训学传述链评级法迁移到多智能体知识系统的声明级溯源。
Ali Zahid Raja
信任传播
圣训学
声明级溯源
多智能体系统
弱链聚合
首个评估LLM智能体在主机被攻陷后进行取证调查与修复的基准
Lehan Wang, Boli Chen, Ruixue Ding, Pengjun Xie, Jinwei Huang, Zhendong Liu,...
LLM智能体
入侵取证
基准测试
应急响应
网络安全
让大规模VLA流匹配策略实时闭环,重规划提速约4倍,成功率提升最高30%
Sungjae Park, Shubham Tulsiani
反应式控制
扩散强制
机器人操作
模仿学习
流匹配