首个统一下游驱动基准,同时评测LLM构造数据与评估数据质量两大能力
Hao Liang, Qifeng Cai, Yibo Lin, Jianzhuo Du, Qifeng Xia, Sizhe Qiu,...
SFT数据
下游评测
域适应
基准测试
数据构造
用协同进化的技能库协调出题与解题双方自博弈,破解LLM自进化的多样性与验证困境。
Siyuan Huang, Pengyu Cheng, Haotian Liu, Tao Chen, Yihao Liu, Jingwei Ni,...
大语言模型自进化
工具调用
强化学习
智能体技能库
自博弈
用约8.6K行可读代码搭出匹配Megatron栈吞吐的智能体RL训练框架
Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang,...
FSDP2
MoE
PyTorch
vLLM
分布式训练
建立原生多模态预训练的算力最优扩展定律,揭示语言与多模态目标的差异化扩展行为
Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu
上下文学习
原生多模态预训练
扩展定律
混合专家MoE
算力最优
把记忆重构为五原语生命周期,以验证式压缩实现线性成本与保真。
Gaurav Dadhich
LLM Agent
上下文压缩
上下文管理
智能体记忆
检索增强
提出统一协议,让训练代码、人类与LLM智能体通过同一接口共同操控实时训练流程。
Wentao Zhang, Xuanhe Pan, Han Zhou, Yang Lu, Yuntian Deng
LLM智能体
交互式训练
可审计机器学习
实验追踪
训练控制平面
把能量距离变成常数规模三体散射,实现高维一步生成
Peng Sun, Zhenglin Cheng, Deyuan Liu, Jun Xie, Xinyi Shang, Tao Lin
MMD
Wasserstein梯度流
一步生成
分布匹配
图像生成
多语言RAG中兼顾语义相关性与语言一致性的重排序器
Seongtae Hong, Youngjoon Jang, Jungseob Lee, Seungyoon Lee, Heuiseok Lim
多语言检索
检索增强生成
知识蒸馏
语言一致性
跨语言对齐
无需训练的智能体框架,通过追踪物体状态演化检测工业视频异常
Mei Yuan, Qi Long, Qifeng Wu, Zhenyang Li, Yizhou Zhao, Lei Wang, Yang Liu, Min Xu
工业异常检测
无需训练
智能体推理
目标跟踪
视觉语言模型
给冻结大模型挂两个轻量头,从隐状态读出能力判断与干预决策,大幅降低调用强模型的成本。
Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi, Di Niu
工具调用
智能体决策
模型路由
自我感知
轻量适配
把身份保持建模为视频重打光,用重打光人脸+法线+关键帧+深度联合控制,实现关键帧编辑的逐帧扩散传播。
Yuancheng Xu, Mingming He, Pablo Salamanca, Li Ma, Yash Kant, Emmett Steven,...
ControlNet
人脸动画
扩散Transformer
视频到视频
视频生成
用多智能体框架把科研创意生成重定义为质量-多样性搜索。
Varun Gumma, Navonil Majumder, Soumitra Sinhahajari, Soujanya Poria
LLM-as-Judge
Yield指标
创意谱系管理
多智能体系统
科学发现自动化
无需训练,用3D引擎的位姿与深度对应关系解决自回归视频生成中的相机重访不一致。
Wenchao Ma, Changran Liu, Sharon X. Huang, Haomiao Jiang
KV缓存
Wan-VACE
注意力偏置
环闭合
生成式渲染
首个评测 VLM 智能体在多物体 3D 场景上执行动作的可执行基准
Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao,...
3D 场景理解
VLM 智能体
具身智能
几何评估
动作执行
推理时用FFT频谱对齐校正扩散模型曝光偏差,开销仅3-4%
Yuya Kobayashi, Masato Ishii, Yuhta Takida, Takashi Shibuya, Yuki Mitsufuji
图像生成
扩散模型
无训练引导
曝光偏差
频谱对齐
复用预训练 VLM 自身做视觉 token 自压缩,轻量适配、极端压缩下仍强。
Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu
KV-Cache
LoRA
层次信息传递
自编码器
视觉token压缩
聚合多句匿名语音并结合语言、韵律线索攻破单句级匿名化。
Ashi Garg, Cristina Aggazzotti, Leibny Paola García-Perera, Nicholas Andrews
多模态融合
说话人匿名化
说话人嵌入聚合
说话人隐私
说话人验证