首个开源3T级原生多模态MoE,配1M上下文与多档强化学习
Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, M. C., Jianfeng Cai, Xinyuan...
Mixture-of-Experts
原生多模态
大语言模型
智能体强化学习
长上下文
统一框架梳理机器人学习进度奖励模型:接口、构造机制、数据与评测
Jianshu Zhang, Keliang Wu, Haoran Lu, Anbang Liu, Ce Zhang, Weijie Yin,...
奖励建模
强化学习
机器人学习
综述
视觉语言模型
把可编辑画布作为智能体共享项目状态,支撑长程多模态创意创作的开放框架
Yunlong Lin, Zixu Lin, Zhaohu Xing, Biqiang Li, Chenxin Li, Haonan Wang,...
Model Context Protocol
创意智能体
多模态创作
开源系统
智能体框架
用结构化JSON协议蒸馏专有模型推理能力,提升开源模型智能体搜索
Junlin Liu, Jiangwang Chen, Zixin Song, Shuaiyu Zhou, Chunji Lv, Hank Wu,...
多智能体系统
强化学习
智能体搜索
检索增强生成
知识蒸馏
揭示CFG组合OPD的分支歧义缺陷,提出分支感知的PDM目标稳定跨尺度蒸馏
Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu, Yang Shi,...
CFG
扩散模型蒸馏
无分类器引导
策略内蒸馏
视频生成
让主智能体直接读写程序状态而非截图,长程桌面任务显著提效降本
Yan Yang, Xiangru Jian, Ziyang Luo, Zirui Zhao, Yutong Dai, Ziji Shi, Hanshu...
智能体框架
程序状态接地
自我验证
计算机操作智能体
长程任务
用五层数据金字塔系统化组织具身智能数据生态
Yifan Ye, Yankai Fu, Yaoxu Lv, Bohan Hou, Jun Cen, Lingdong Kong, Duo Zheng,...
世界模型
具身智能
数据金字塔
数据驱动
机器人操作
将动态路由、稀疏计算与近似校正统一到单次在线softmax中的免训练稀疏注意力
Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu, Jincheng Yu,...
GPU内核优化
扩散Transformer
推理加速
稀疏注意力
视频生成
把试穿重新定义成多参考理解驱动生成,靠数据引擎+CPT-SFT-RL达到任意品类SOTA
Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang,...
多参考图像生成
多模态大模型
强化学习
扩散模型
时尚AI
联合训练音视频VAE,用对比学习与语义蒸馏实现跨模态对齐,提升联合生成质量。
Jun Zhan, Chen Yang, Yitian Gong, Donghua Yu, Kuangwei Chen, Wenbo Zhang,...
变分自编码器
对比学习
潜在扩散模型
跨模态对齐
音视频生成
用可控环境系统揭示长程规划能力在预训练、GRPO/OPD、多教师蒸馏三阶段的获取、塑造与整合规律。
Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao
世界模型
在线策略蒸馏
多教师蒸馏
强化学习
智能体
用角相似度替代欧氏距离做码本路由,解决高维视觉量化坍缩。
Tianren Ma, Lin Long, Chuyan Chen, Mu Zhang, Junbo Zhao, Tong Zhang, Qixiang Ye
codebook collapse
图像生成
图像重建
多模态理解
表示自编码器
组合式级联视觉编码器+RoI评测,统一2D/3D医学影像理解
Hangjie Yuan, Yichen Qian, Zhiwei Tang, Xianzhe Xu, Lirong Wu, Sicheng Yang,...
3D CT理解
医学影像分析
多模态大模型
指令跟随评测
放射报告生成
用RAG+微调让LLM调用外部史料知识,精准修复古籍人名地名等命名实体
Gabeen Kim, Kyeongpil Kang
Hanja汉字古籍
低资源语言
历史文献修复
命名实体
大语言模型微调
让单条蛋白序列同时适配同一靶点的多种构象或多个不同靶点。
Hengyuan Cao, Shizhuo Cheng, Mingxuan Liu, Weicheng Huang, Yunhong Lu,...
多状态设计
多靶点设计
流匹配
离散流模型
结合蛋白设计
用最终答案注意力学习投影,滤除推理轨迹噪声步骤以提升大模型幻觉检测
Junlin Fang, Do Nguyen-Thanh, Xiaogang Xu, Zhen Fang, Sean Du
大推理模型
幻觉检测
推理轨迹去噪
注意力机制
表示学习
将LLM评判逻辑蒸馏为可执行程序委员会,兼得低成本与高准确率。
Tzu-Heng Huang, Shengqi Qiu, Frederic Sala
LLM评测
PAJAMA
奖励模型蒸馏
帕累托前沿
弱监督
将 VLM 数据配方解耦为类间比例搜索与类内凸优化,实现可归因、可迁移的配比。
Jiahao Xie, Zhongbin Guo, Qianle Wang, Ruiqi Lu, Dongling Xiao, Wanxuan Sun,...
LLM-as-a-Judge
VLM
凸优化
多模态预训练
数据配比优化
冻结模型加验证记忆层,已解决任务零token位精确复用。
Sietse Schelpe
LLM服务优化
上下文窗口
可验证推理
确定性复用
精确内容寻址
跨四代 GPU 测得 warp 分歧动态成本稳定,但编译器重汇聚机制持续演进
Alpin Dale
Blackwell
GPU微架构
SASS逆向工程
warp分歧
独立线程调度
以电影学院级电影语言构建的多镜头T2V/R2V基准,揭示动态美学是当前瓶颈
Shengyi Wang, Niantong Li, Guangzheng Hu, Hong Qi, Fei Ding, Weixu Qiao,...
参考条件生成
基准测试
多镜头视频
电影语言
自动化评测
两阶段课程让 LLM 先推理业务规则再检索工具,保留知识且吞吐提升约200倍
Sai Shruthi Sistla, Ashutosh Hathidara, Christopher Toukmaji, Mayank...
业务规则推理
企业 LLM
参数化工具检索
知识保留
课程学习
面向端侧部署的低延迟异构视觉编码器,配合两阶段生成式预训练实现SOTA。
Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati, Anestis Zaganidis,...
大视觉语言模型
异构ViT架构
生成式预训练
知识蒸馏
移动NPU
统一扩散Transformer融合动作生成与未来视觉预测,无需大型VLM即可达LIBERO前沿
Sen Wang, R. Gnana Praveen, Bidhan Roy, Marcos Villagra
LIBERO
VLA
世界模型
扩散策略
机器人学习
Google 提出 GNM:首个统一刻画皮肤、眼、牙、舌的生成式头部模型。
Stylianos Ploumpis, Jan Bednarik, Gaspard Zoss, Ruslan Guseinov, Luca...
3D 形变模型
人脸重建
参数化人头
神经渲染
计算机图形学
提出八元组词汇表,分解多智能体自动研究系统的设计坐标
Bardiya Akhbari
LLM智能体
多智能体系统
研究框架
自动化研究
评估器完整性
用波动率门控自适应融合情绪与技术特征预测比特币涨跌。
Muhammad Abdullah Haroon
BiLSTM
FinBERT
加密货币
多模态融合
市场状态检测
用逐字引用+检索替代坐标框,让VLM证据归因召回率提升数倍
Zhuchenyang Liu, Yao Zhang, Yu Xiao
强化学习
文档智能
文档问答
检索增强
视觉语言模型
全自动流水线合成130万+多轮印度-英语混码对话,覆盖9种语言18种变体
Sahil Deepak Gawande, Mayank Singh
Hinglish
个性化对话
代码混合
印度语言
多语言LLM
将组合生成建模为内在奖励对齐,导出闭式倾斜分布与原则性扩散引导
Debottam Dutta, Jaehoon Hahm, Jianchong Chen, Romit Roy Choudhury
总相关性
扩散模型
文本到图像生成
测试时对齐
组合生成
大规模自然驾驶基准,把车型/路线/情境混淆当作核心测量对象
Yuhang Wang, Lingyao Li, Hao Zhou
基准评测
多模态时间序列
捷径学习
混淆控制
自然驾驶数据集