用并行框解码让VLM一次性输出整个边界框,速度提升2.5倍同时精度反超SOTA。
Shihao Wang, Shilong Liu, Yuanguo Kuang, Xinyu Wei, Yangzhou Liu, Zhiqi Li,...
VLM
多Token预测
并行解码
数据引擎
目标检测
将影视制作流程数字化为评估分类体系,用 34 位专家标注蒸馏出专业级思维链评分器
Songlin Yang, Haobin Zhong, Ruilin Zhang, Xiaotong Zhao, Shuai Li, Kai...
VLM 微调
多模态基准
奖励模型
影视质量度量
思维链推理
跨范式确定性空间基础模型评测基准,配套DA-Next-5M与DA-Next。
Haosong Peng, Hao Li, Jiaqi Chen, Yuhao Pan, Runmao Yao, Yalun Dai, Fushuo...
3D视觉
具身智能
基准测试
多视角重建
数据集
浏览器宿主、以结构化 JSON 状态为核心的移动端仿真平台与基准,单机即可承载数百并行实例用于可验证评估与在线 RL 训练。
Dingbang Wu, Rui Hao, Haiyang Wang, Shuzhe Wu, Han Xiao, Zhenghong Li,...
Benchmark
GRPO
GUI Agent
Mobile Agent
Reinforcement Learning
9.8B 激活参数的 MoE 大模型,通过 Agent 数据管线+Forge 强化学习系统+自我进化,在编码与办公 Agent 任务上比肩头部闭源模型
MiniMax, Aili Chen, Aonian Li, Baichuan Zhou, Bangwei Gong, Binyang Jiang,...
Agent
MoE
Speculative Decoding
代码生成
强化学习
在三维重建模型的特征空间里做扩散去噪,同时恢复图像与几何。
Jin Hyeon Kim, Jaeeun Lee, Claire Kim, Kyoungjin Oh, Paul Hyunbin Cho,...
3D重建
图像恢复
多视图
扩散模型
特征空间去噪
用多步去噪轨迹的"犹豫"信号动态路由双层安全探针,实现SOTA安全监控。
Aoxi Liu, Yupeng Chen, James Oldfield, Guanzhe Hong, Junchi Yu, Baoyuan Wu,...
LLM安全
动态路由
安全监控
扩散语言模型
线性探针
首个统一评测分钟级音视频生成的跨模态基准,覆盖文本/图像/视频三种条件输入。
Tengfei Liu, Yang Shi, Xuanyu Zhu, Jiafu Tang, Liu Yang, Qixun Wang, Zhuoran...
MLLM评估
多模态基准
视频生成评测
长视频一致性
音频-视频生成
用多智能体+双桥一致性框架在百镜头量级实现角色一致的长视频换脸/风格化重制
Yiren Song, Huilin Zhong, Kevin Qinghong Lin, Haofan Wang, Mike Zheng Shou
多智能体系统
电影化重制
视频理解
视频生成
身份一致性
在固定 VAE 潜空间中,对比直接预测干净潜码与速度预测的差距。
Funing Fu, Tenghui Wang, Junyong Cen, Qichao Zhu, Guanyu Zhou
DiT
VAE
扩散模型
潜空间生成
预测目标
提出CPT方法,通过搜索时信息共享减少并行TTS的冗余探索
Xinglin Wang, Hao Lin, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi,...
LLM推理
Test-Time Scaling
信息共享
并行推理
数学推理
以技能全生命周期管理为核心,让LLM智能体自主创建、评估、精炼并跨智能体迁移可复用技能
Huawei Lin, Peng Li, Jie Song, Fuxin Jiang, Tieying Zhang
LLM智能体
SkillsBench
技能生命周期
技能级记忆
自演化
把视频当码率流处理,codec-stream 在事件级定位上 +44.8。
Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui...
多模态大模型
感知智能
时序定位
视觉token压缩
视频理解
构建可重放的多模态社交推理游戏环境,对 VLM 代理的每句发言做逐句轨迹核验
Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang...
VLM
博弈论
多模态智能体
幻觉检测
社交推理
用 Gemini 多模态底座统一文本/图像/视频/音频的稠密嵌入表示。
Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego,...
Gemini
MTEB
RAG
多模态嵌入
对比学习
系统揭示 RMSNorm 中可学习 scale vector 通过自放大预条件加速 LLM 预训练,并提出异构化、双侧放置与幅向重参数化三项零成本改进。
Mingze Wang, Shuchen Zhu, Yuxin Fang, Binghui Li, Kai Shen, Shu Zhong
LLM预训练
RMSNorm
Scale Vector
优化理论
归一化层
把注意力矩阵拆成对称与反对称两部分,用 Hopfield 能量视角诊断并用「循环扰动」控制扩散模型的保真度-多样性权衡。
Hyunmin Cho, Woo Kyoung Han, Kyong Hwan Jin
Hopfield网络
可解释性
扩散模型
推理时控制
注意力机制
首个评估个性化和主动行为的长期用户交互智能体基准测试
Yuxin Chen, Yi Zhang, Zhengzhou Cai, Yaorui Shi, Zhiyuan Yao, Chenhang Cui,...
个性化推荐
主动交互
基准测试
智能体评估
长期记忆
用单源奖励作锚点,量化多源融合的信息增益
Fanhu Zeng, Zhicong Luo, Zefan Wang, You Li, Chi Chen, Maosong Sun
优势归一化
多模态推理
强化学习
视觉理解
NoisyAgent:在训练中显式注入用户与工具噪声以提升LLM智能体鲁棒性
Yuxin Chen, Xiaodong Cai, Junfeng Fang, Zhuowen Han, Yu Wang, Yaorui Shi, Yi...
GRPO
LLM智能体
噪声注入
强化学习
课程学习
通过双路径 rollout 动态探测知识边界,引导 agentic RL 训练减少冗余工具调用。
Dingwei Chen, Zefang Zong, Zhipeng Ma, Leo Luo, Yang Li, Chengming Li, Peng...
Agentic RL
GRPO
LLM Agent
RAG
Tool-Use
把稀疏化从权重转向激活,在 DiT 上首次实现无损 2:4 N:M 加速
Xing Cong, Hanlin Tang, Kan Liu, Lan Tao, Lin Qu, Chenhao Xie
CUDA 算子优化
DiT
N:M 半结构化稀疏
Sparse Tensor Core
扩散模型加速
借鉴不完全信息博弈论,把多 agent 协调重写为「独立生成 + 结构化信念 + 受控暴露」,在六个推理基准上以最高 6.5 倍更少 token 达到 SOTA。
Yi Li, Songtao Wei, Dongming Jiang, Zhichun Guo, Qiannan Li, Bingzhe Li
Guardrail
不完全信息博弈
受控通信
多智能体 LLM
推理集成
首个面向移动端的十亿参数级MoE模型,建立端侧LLM新帕累托前沿
Yanbei Chen, Hanxian Huang, Ernie Chang, Jacob Szwejbka, Digant Desai,...
Scaling Law
模型压缩
混合专家网络
移动AI
端侧部署
系统研究VLM表征如何影响VLA初始化,提出能力-更新-动作三轴设计原则
Weifeng Lin, Siyuan Huang, Hao Li, Tingwei Chen, Ruichuan An, Xinyu Wei,...
LoRA
VLA
VLM
机器人
机器人学习
首次系统比较 6 种不确定性估计方法在激活预言机上的校准效果,发现温度自助法显著优于自述置信度。
Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech
LLM 内部表示
MCMC 采样
不确定性量化
可解释性
校准
提出DLA模块和多阶段去噪策略,整合MLLM与VAE实现高质量主题驱动图像生成
Shuhong Zheng, Aashish Kumar Misraa, Yu-Teng Li, Yu-Jhe Li, Igor Gilitschenski
主题驱动生成
图像生成
多模态大语言模型
扩散模型
身份保持
Trajel框架:审计多代理轨迹级幻觉,五种类型分类法
Harshada Badave, Santosh Borse, Andrea Gomez, Harshitha Narahari, Sara...
多代理系统
工业AI
幻觉检测
评估基准
轨迹审计
首个20B参数统一框架支持文本/图像/图层生成多层可编辑设计
Zhicong Tang, Zhao Zhang, Jingye Chen, Mohan Zhou, Yifan Pu, Yuchi Liu,...
分层图像生成
图像编辑
多任务学习
扩散模型
蒸馏加速
将长时程智能体的记忆管理建模为状态自适应问题,通过线索-页面架构实现意图驱动的记忆检索
Yuyang Hu, Hongjin Qian, Shuting Wang, Jiongnan Liu, Ziliang Zhao, Jiejun...
强化学习
智能体
记忆管理
长时程推理
首个生产级GPU内核生成基准,解决基准与生产环境不匹配问题
Gabriele Oliaro, Yichao Fu, May Jiang, Owen Lu, Junli Wang, Zhihao Jia, Hao...
CUDA
GPU优化
LLM推理
内核生成
基准测试
自动化评估框架,在系统、轨迹、节点三级洞察LLM代理行为
Asaf Yehudai, Lilach Eden, Michal Shmueli-Scheuer
Agent调试
LLM代理
可观测性
自动化评估
错误分析
通过零空间投影和乘法参数更新实现高效精准的大模型知识遗忘
Yujie Lin, Chengyi Yang, Zhishang Xiang, Yiping Song, Jinsong Su
参数高效调优
机器遗忘
模型安全
知识编辑
隐私保护
按时间顺序预训练的LLM比打乱训练更具时效性知识
Pilchen Hippolyte, Fabre Romain, Signe Talla Franck, Perez Patrick, Grave Edouard
持续学习
数据课程
时序学习
知识时效性
预训练
将英语对比偏好调优扩展到多语言场景,无需为每种语言单独标注偏好数据
Mike Zhang, Ali Basirat, Desmond Elliott
DPO
偏好调优
多语言学习
对比学习
自生成数据
用VAE潜在空间+RTR策略实现高频机器人平滑控制
Kunyun Wang, Yuhang Zheng, Yupeng Zheng, Jieru Zhao, Wenchao Ding
动作块
异步推理
机器人控制
模仿学习
潜在表示
现有证据不足以证明大语言模型具有强元认知监控能力
Shashwat Singh, Tal Linzen, Shauli Ravfogel
元认知
内省
可解释性
机制分析
行为实验
从NSF资助摘要中构建280万科学声明数据集,用于科学声明验证和提取研究
Delip Rao, Weiqiu You, Eric Wong, Chris Callison-Burch
大语言模型
数据集构建
科学声明提取
科学文献挖掘
资助摘要分析
提出STREAM框架从流媒体挖掘交互信号,构建StreamDial多域任务导向对话数据集
Liang Xue, Haoyu Liu, Cheng Wang, Pengyu Chen, Haozhuo Zheng, Yang Liu
任务导向对话
对话合成
数据挖掘
检索增强生成
流媒体
一种通过潜在空间记忆传播和恢复流匹配实现分钟级稳定人体动画的轻量级后训练框架
Wuyang Li, Yang Gao, Mariam Hassan, Lan Feng, Wentao Pan, Po-Chien Luan,...
人体动画
流匹配
视频生成
计算机视觉
长时序生成