365天电商模拟基准,揭示LLM智能体长期连贯性的巨大短板
Qiming Shi, Yulong Tao, Linbo Jin, Zhaolu Kang, Yibo Dou, Jiawen Zhu,...
LLM智能体
电商运营
评测基准
部分可观测决策
长期连贯性
16B自回归扩散模型实现单卡B200上30FPS实时720p流式视频编辑
Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang, Hang Xu,...
实时推理
扩散Transformer
流式生成
自回归扩散
蒸馏加速
一个架构统一3D理解、生成、编辑与部件生成,87M数据驱动协同
Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang,...
3D生成
3D编辑
合成数据
扩散Transformer
统一多模态模型
用高容量、可解码的连续文本潜变量桥接扩散生成与离散解码
Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li, Wende Tan,...
扩散语言模型
文本生成
流匹配
潜在扩散
自编码器
首个视频深度研究框架,解耦感知与探索,35B以64.0%刷新SOTA
Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren,...
GRPO强化学习
多模态智能体
工具调用
模态偏置
视觉问答
解耦预训练知识与任务几何的所有权,让编码器每日刷新而不破坏迁移
Zixuan Wang, Yuhong Chen, Yuxuan Zhu, Guidong Lei, Zhiluohan Guo, Yu Zhao,...
Transformer
分布漂移
序列推荐
推荐系统
流式学习
按教师信号的局部持久性,为每个 token 分配自适应蒸馏权重。
Chunji Lv, Yangguang Wei, Junlin Liu, Yang Gao, Ming Liu, Xinming Wang,...
GRPO
信用分配
智能体强化学习
知识蒸馏
稀疏奖励
把世界模型重构为面向智能体的信息转移代理,提出6类功能×3层赋能的设计空间。
Yu Yang, Xuemeng Yang, Licheng Wen, Lingdong Kong, Xiaobin Hu, Dongyue Lu,...
世界代理
世界模型
强化学习
持续进化
智能体
评测个人智能体跨会话复用经验是否真正带来提升的归因基准
Shuhan Xue, Zixin Ding, Yichen Shen, Yinjie Wang, Zhenfei Yin, Yingcheng Wu,...
Agent框架
个人智能体
性能归因
持久化记忆
经验复用
系统刻画MoE扩散语言模型的缩放规律,据此训出30B-A3B模型逼近Qwen3
Fengqi Zhu, Shaoxuan Xu, Jingyang Ou, Zebin You, Yipeng Xing, Huabin Liu,...
LLaDA
扩散语言模型
混合专家MoE
缩放定律
预训练
无需训练的两阶段全模态Token压缩,极致压缩下仍保持95%性能
Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun...
Token压缩
免训练
全模态大语言模型
音视频理解
高效推理
首个在任意异构流匹配模型间实现跨族在策略蒸馏的通用框架
Siming Fu, Zheming Fu, Ruizhe He, Hualiang Wang, Jie Huang, Xiaoxiao Ma,...
DINOv2
在策略蒸馏
异构模型蒸馏
文生图
流匹配模型
解耦图像描述的覆盖率与精度,发现理解靠覆盖、生成靠精度
Zhipeng Liu, Haochen Wang, Zhaoxiang Zhang
图像描述评估
基准测试
数据质量分析
文生图
视觉语言模型
首个借智能体自身经验转技能流水线植入持久后门的攻击
Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong...
后门攻击
技能提取
智能体安全
自进化智能体
记忆投毒
用语义RGBA图层作为生成、理解与编辑的原子单元。
Zongjian Li, Zhiyuan Yan, Chenxu Bai, Chen Chen, Haoxiang Sun, Shaodong...
DiffusionNFT后训练
Flow Matching
Image-to-Layer
MMDiT
PSD文档
用工具执行结果构造轮次级多视野事后监督,自适应调制强化学习优势。
Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu
GRPO
LLM智能体
信用分配
工具集成推理
强化学习
轻量可复现的流式视频世界模型框架,单机8卡数日即可从零训练
Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen
KV缓存
扩散模型
流匹配
自回归生成
视频世界模型
让连续视频长成时序分层记忆,同一份记忆既能答问也能主动服务。
Sitong Gong, Caixin Kang, Tianyu Yan, Guo Chen, Bo Zheng, Kaipeng Zhang,...
Agent
主动式AI助手
多模态大模型
时序分层记忆
检索增强生成
构建CGV儿童步态数据集,提出ChildGait-Video从RGB视频自动评估EVGS
Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin,...
儿童步态分析
医学影像AI
基础模型微调
数据集构建
视觉步态评估
提出评估智能体在长任务流中持续学习与技能演化的动态基准
Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi...
LLM Agent
上下文学习
基准评测
持续学习
智能体技能学习
用全长度财务报表测出 LLM 金融推理的知识与结构两大瓶颈
Xinke Tong, Xuanming Zhang, Tianyi Tang, An Yang, Jiatu Hu, Guojie Lin,...
对抗性基准
推理瓶颈诊断
财务报表分析
金融大模型评测
长上下文表格推理
用问答得分度量代理代码解释可信度,并用差分测试自动改进
Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf, Abhik Roychoudhury
LLM代理
基准测试
属性测试
差分测试
解释可信度
用8个可学习恢复token生成上下文条件化紧凑缓存,弥补KV驱逐损失。
Changwoo Baek, Seungjun Shin, Kyeongbo Kong
KV缓存压缩
LoRA微调
大语言模型推理
知识蒸馏
长上下文
首个端到端评估人格技能隐私泄露与冒充风险的基准,揭示防御的局限。
Yongli Xiang, Zhifang Zhang, Bojun Yang, Ziming Hong, Lei Feng, Miao Xu,...
Agent Skills
Persona Skills
后门防御
安全基准
身份冒充
将黏性污渍清洁重定义为拓扑聚合问题,用扩散策略生成分段推动实现零样本泛化
Renhao Lu, Mingxin Wang, Chenyang Cao, Yang Yang, Guoping Pan, Kangkang...
力位混合控制
扩散策略
机器人操作
机器人清洁
模仿学习
发现 ALiBi 线性偏置在长上下文中数值下溢,使注意力头变盲。
Christopher Schröder, Lukas Gienapp, Ferdinand Schlatt, Martin Potthast,...
ALiBi
位置编码
数值精度
注意力机制
长上下文
用DINOv3语义表示从未来预测和历史检索双向增强WAM的操作鲁棒性。
Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen...
DINOv3
Flow Matching
Mixture-of-Transformers
世界动作模型
机器人操作
模板先行的多智能体流水线,输出可编辑、可印刷、设计可控的学术海报。
Haojie Hu, Chenhao Dang, Yaojia Liu, Hengrui Kang, Conghui He, Weijia Li
VLM评审
多智能体系统
文档版面生成
模板驱动生成
论文转海报
DASH通过检测答案漂移为推理段落分配信用,在减少过度思考的同时提升准确率。
Chia-Hsuan Lee, Sihui Dai, Mingyang Zhou, Isha Slavin, Hsuan Su, Shi-Xiong...
GRPO
信用分配
强化学习
推理语言模型
答案漂移
压缩大模型量化后残留的BF16输出头,存储降3.7-3.9倍且几乎无损
Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kamer Ali Yuksel
LM头压缩
低秩近似
大语言模型部署
模型量化
激活感知量化
提出结构化全掩码预测,单次前向传播完成多目标分割,破解三难困境
Jiazhen Liu, Mingkuan Feng, Long Chen
图像分割
多模态大模型
多目标分割
开放词汇分割
遥感分割
欧盟法院多层次法律检索数据集,缓解查询泄漏并纳入全段落语料
Theresia Veronika Rampisela, Henrik Palmer Olsen, Giovanni Colavizza
信息检索
引用检索
数据泄漏
数据集
法律AI
用专家失败轨迹做反思学习,提升LLM推理能力
Jinhe Bi, Chennan Zhou, Zengjie Jin, Aniri, Shuo Lu, Wenke Huang, Hu Cao,...
反思学习
大模型训练
强化学习
推理增强
策略优化
用跨编码器对齐五种议会语言,量化两百年语言变化的幅度与方向
Gagan Bhatia, Julian Schlenker, Simone Paolo Ponzetto, Steffen Eger
历时语言变化
可解释性
多语言表示
稀疏自编码器
跨编码器
课程学习框架让多模态模型内化视觉接地推理,图表问答性能提升高达20.5%
Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng...
图表问答
多模态大语言模型
思维链推理
视觉接地
视觉推理
首个完整视觉钢琴转写系统,联合预测起音、释音、按键保持与力度。
Yonghyun Kim, Hoyeol Sohn, Juhan Nam, Alexander Lerch
Conformer
多任务学习
自动音乐转写
视觉钢琴转写
音乐信息检索
用因果图公理逐条核验采样轨迹,绕开投票选出有效答案。
Omatharv Bharat Vaidya, Connor Thomas Jerzak, Zayne Rea Sprague, Fangcong...
因果图
因果推理
测试时计算
神经符号系统
符号验证
用字段化布尔检索保留网页结构,智能体检视后只抓取相关章节,更准且更省token。
Shuai Wang, Haodong Chen, Yu Yin, Shengyao Zhuang, Bevan Koopman, Guido Zuccon
RAG
信息检索
布尔检索
深度研究智能体
网页结构检索