递归地生成已验证的长程终端智能体训练任务,低成本可扩展
Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang,...
任务进化
合成数据
强化学习
监督微调
终端智能体
用答案反推出的线索给轨迹每一步打分,实现细粒度的SFT与RL训练。
Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng Chen
GRPO
ReAct
信用分配
强化学习
搜索智能体
系统解构统一多模态预训练机制,提出高效不对称训练配方
Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos...
多模态预训练
早期融合
混合专家MoE
知识流动
统一模型
让统一多模态模型自主推理、调用工具并原生生成图像。
Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin...
Emu3.5
GRPO
后训练
开放世界生成
强化学习
首个量化个性化LLM过度推断的基准,揭示自我监控信号跨模型时反向失效。
Yushi Sun, Yanjie Zhang, Rui Sheng
个性化LLM
元认知
幻觉
用户画像
自我审计
首个支持用户与世界内角色进行社交互动的视频世界模型
Liangyang Ouyang, Ruicong Liu, Xuangeng Chu, Kaipeng Zhang, Yoichi Sato
DiT注意力控制
扩散模型
社交交互
自蒸馏
视频世界模型
通过任务分解、执行记忆与验证修复,构建可跨后端迁移的长时程智能体框架
Jingsheng Zheng, Xinyuan Fang, Jintian Zhang, Zhengke Gui, Huajun Chen, Ningyu Zhang
AgentIF-OneDay
LLM Agent
任务分解
执行记忆
跨后端迁移
用技能熵度量技能切换难度,构建Skill2-Bench基准并用Skill-Entropy RL训练
Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu,...
GRPO
基准测试
大语言模型
强化学习
技能切换
首个面向GDP业务工作流的智能体自我进化基准,用规则混合使测试增益可归因
Leijun Zhou, Zhihao Liu, Xiang Qu, Chenxu Liu, Yifei Liu, Yanke Yu, Jingzhe...
业务工作流
可归因泛化
抗数据污染
智能体自我进化
规则混合
把第一人称人手操作视频转成1.86万小时机器人训练数据,提升VLA跨分布泛化。
Ye Wang, Pei Lin, Xiong-Hui Chen, Haoqi Yuan, Zhixuan Liang, Yiyang Huang,...
具身智能
动作重定向
数据合成
机器人学习
第一人称视频
过滤在线蒸馏中既不依赖输入又高影响的虚假教师信号
Yinuo Jiang, Yongjie Ye, Zhou Tao, Xiang Zhuang, Qiang Zhang, Huajun Chen, Tiankai Li
在线策略蒸馏
大语言模型
梯度信噪比
知识蒸馏
视觉语言模型
LG 升级再造 K-EXAONE,构建 750B 总参/37B 激活的 MoE 多语言基础模型。
Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin...
MoE混合专家
大语言模型
技术报告
推测解码
模型升级再造
用过程生成、难度校准的英韩谜题基准,定位韩国语写作系统与文化瓶颈。
Dasol Choi, Joonyong Park, Daegon Yu, Soo Yong Kim, Youngsook Song, Seunghyeok Hong
LLM推理诊断
基准构建
多语言评测
过程生成基准
韩语NLP
提出音视频协同编辑评测基准AVE-Compass,并配套规划式智能体AVE-Agent。
Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu,...
MLLM评判
多模态大模型
智能体
自动化评测
视频编辑
RSTG在负零方差样本上选择性施加自适应蒸馏,恢复GRPO丢失的梯度信号
Zhuowen Han, Jinwei Xiao, Zhengxi Lu, Renren Jin, Zhiyuan Yao, Yuxin Liu,...
GRPO
LLM后训练
RLVR
反向KL散度
强化学习
VLM智能体的空间记忆会过时,盲目信任比无记忆更致命
Yushi Sun, Yanjie Zhang
FrozenLake
VLM智能体
安全AI
实证研究
空间记忆
Brevis把无损张量压缩建模为程序合成,逐位还原且全面超越通用与专用基线。
Jieke Shi, Junda He, Wenjia Jiang, Weifeng Sun, Shidong Pan, Zhensu Sun,...
A*搜索
DSL
IEEE 754
张量压缩
无损压缩
把潜空间 GUI 记忆拆成内容、读出、信任三职责,冻结策略下五个基准平均涨近 20 点。
Zhuoran Zhang, Bowen Li, Jingcheng Ju, Yang Shi, Qixun Wang, Haotian Wang,...
GUI 智能体
信任门控
冻结策略训练
潜空间记忆
状态条件读出
用可逆动作闭环构造免标注长程监督,状态漂移最多降44%
Bohai Gu, Yueyang Yuan, Taiyi Wu, Dazhao Du, Jian Liu, Xiaoyi Pang, Jie...
CycleBench
动作一致性
可逆动力学
强化学习后训练
自监督
对比师生轨迹差异,把行为差距蒸馏成可验证的文本技能,增强冻结的弱学生智能体
Qiming Shi, Yibo Dou, Jiawen Zhu, Yulong Tao, Linbo Jin, Zhaolu Kang, Yunfan...
LLM智能体
师生对比
技能学习
提示工程
知识蒸馏
用像素桥接与可切换适配器把异构教师能力蒸馏进单一学生
Siming Fu, Haojun Xu, Ruizhe He, Zheming Fu, Hualiang Wang, Jie Huang,...
LoRA
多教师学习
扩散模型
文本生成图像
流匹配
把模态平衡本身作为在线自蒸馏的特权信息,用正负双教师提升多模态推理
Aniri, Jinhe Bi, Peng Liao, Zengjie Jin, Volker Tresp, Fei Shen, Yunpu Ma,...
MLLM
后训练
在线自蒸馏
多模态大模型
模态平衡
金融深度研究基准FinanceGym+框架FinanceHarness,时点隔离分离前后截止评测
Yijia Xiao, Rujun Han, Yanfei Chen, Zifeng Wang, Ke Jiang, Zhongying CuiZhu,...
强化学习微调
智能体评测基准
检索增强生成
点对时搜索沙盒
金融深度研究
用统一时空记忆把3D VLA扩展为同时高效、可泛化且支持记忆推理的操作框架
Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan,...
3D机器人操作
双臂操作
样本高效
正交投影
热力图动作预测
用遮挡感知点云渲染加双流视频扩散,从单目输入实现大基线可控新视角合成与4D重建
Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan
3D高斯泼溅
4D重建
世界模型
新视角合成
点云渲染
用图表-表格-代码三表征一致性作为自监督信号协同优化多模态跨表征理解
Xuehang Guo, Pengyuan Li, Tom Hope, Tirthankar Ghosal, Manling Li, Qingyun Wang
一致性约束
代码生成
协同训练
图表理解
强化学习
PIMiner 用分层记忆把攻击经验沉淀为可迁移策略库,让搜索式红队媲美 RL 方法。
Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia
Claude Code
LLM 智能体
分层记忆
提示注入
策略迁移
系统综述让代码智能体从软件反馈中持续自我进化的方法与分类框架
Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang
LLM Agent
代码智能体
强化学习
综述
自我进化
生物启发框架,同时生成分子胶并组装三元复合物。
Yuliang Yan, Shuo Yan, Haochun Tang, Yiqin Sun, Enyan Dai
SE(3)等变性
三元复合物
分子胶设计
流匹配
生成模型
首例测试时对抗补丁攻击流匹配VLA,仅攻击首步去噪即近乎100%攻破π0
Hoseong Tae, Jong-Seok Lee
π0
去噪轨迹
对抗攻击
对抗补丁
机器人安全
用闭式公式精确界定红队基准能证明安全到何种程度
Bandana Kaur
AI 安全
基准测试
红队评估
统计功效
证据理论
用视觉地理定位评测多模态大模型在图文冲突中如何取舍的对照事实基准
Sirun Li, Minghao Liu, Ling Dai, Yong Li, Haoxin Lyu, Junting Zhou, Fan Zhang
图文冲突
场景文字
多模态大模型
对照事实基准
视觉地理定位
提出六属性恢复契约,用TLA+与确定性测试揭示主流Agent框架在崩溃与中断恢复时的语义缺陷
Sajjad Khan
Agent框架
一致性测试
崩溃恢复
工作流持久化
形式化验证
用层次化JEPA编码器与像素空间流匹配,打造CPU实时可运行的音乐协作智能体
Scott H. Hawley
JEPA
MIDI
世界模型
流匹配
符号音乐