多步 GraphRAG 引擎配 7B 提取模型,分离抽取与整合,证据召回率达 84%
Mikhail Komarov, Ivan Bondarenko, Stanislav Shtuka, Oleg Sedukhin, Roman...
GraphRAG
图社区检测
检索增强生成
知识图谱
紧凑语言模型
把教程视频等多模态资源蒸馏为层次化可执行技能库,提升软件智能体创作能力
Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng, Qi Dai, Bei Liu,...
多模态蒸馏
技能检索
教程视频
智能体技能库
程序性知识
用层循环配方让循环MoE在等算力下稳定胜过普通堆叠
Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai
大模型预训练
强化学习对齐
循环Transformer
数学推理
混合专家模型MoE
用十万小时UMI真实轨迹预训练的VLA基础模型,刷新四大机器人基准SOTA
Xiaomi Robotics Team, Jun Guo, Piaopiao Jin, Jason Li, Peiyan Li, Yingyan...
UMI数据采集
具身智能
扩散Transformer
数据缩放
机器人基础模型
首个突破N=4的超连接法,以时间特征增强与稀疏残差更新让大N扩展成为实用缩放轴
Xiangdong Zhang, Xiaohan Qin, Sunan Zou, Tuo Dai, Xiaoming Shi, Huaijin Wu,...
LLM预训练
大模型架构
残差连接
混合专家
稀疏计算
用人类把关的自我进化循环把医疗后训练变成数据配方搜索问题。
actAVA AI, Haolin Chen, Leon Qi, Steve Brown, Deon Metelski, Tao Xia,...
EHR工具调用
LoRA
SDFT
临床推理
医疗大模型
用教师与基础模型的概率差作为蒸馏奖励,大幅提升推理蒸馏效果。
Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
后训练
在线策略蒸馏
大语言模型推理
奖励设计
强化学习替代
记忆中枢+语义ID+隐式推理,让LLM低成本驱动淘宝推荐
Bowen Zheng, Chao Yi, Dian Chen, Gaoyang Guo, Han Zhu, Jiakai Tang, Jian Wu,...
大语言模型
工业部署
强化学习
推荐系统
用户建模
百万级PR实证研究:LLM/Agent代码审查的采纳实践、协作模式与质量权衡
Suzhen Zhong, Shayan Noei, Bram Adams, Ying Zou
GitHub
LLM
代码审查
智能体
软件工程实证研究
用国际象棋测试床建立预训练-RL联合缩放律并揭示RL机制
Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus...
GRPO
国际象棋
强化学习
推理
缩放律
三组件架构(分词器+LLM+渲染器)实现可控高保真歌曲与翻唱生成
Jin Xu, Kangdi Wang, Ruibin Yuan, Shun Lei, Xiong Wang, Xize Cheng, Xueyao...
Qwen-Music
多阶段对齐
大语言模型
扩散Transformer
文本到音乐
消除共享背景子空间的免训练单样本分割新框架
Mantha Sai Gopal, Jaison Saji Chacko, Harsh Nandwana, Sandesh Hegde,...
DINOv2
SAM
上下文分割
免训练分割
单样本学习
少量迭代优化任务专属提示级智能体框架,超越最强推理档并省最多60%成本。
Hyunin Lee, Jinglue Xu, Jeffrey Seely, Donghyun Lee, Matei Zaharia, Yujin Tang
LLM编程代理
多智能体系统
智能体框架优化
测试时计算
递归自我改进
用单一统一多模态推理模型打通科学理解、预测与生成
Jiahao Zhao, Junyi Liu, Lifeng Xu, Nan Xu, Qingli Wang, Qingxiao Li, Tianle...
AI for Science
多任务解码
科学基础模型
结构化推理监督
统一多模态推理
探究 Muon 优化器在不同优势估计器的长程 Agentic RL 中的效果
Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun
Agentic RL
Muon
优化器
信用分配
强化学习
用冻结视频基础模型做编码器,统一支持连续与离散视频生成,收敛快5倍。
Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang
潜在空间量化
自编码器
表示学习
视频基础模型
视频生成
用参考答案引导的对比概率差作为token级正确性信号来塑形RLVR优势
Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai, Min Chen, Hao Zhang
GRPO
RLVR
优势塑形
大模型推理
对比学习
用世界模型预测数据操作效果,智能体训练加速14倍、推理加速3-6倍
Zherui Yang, Fan Liu, Hao Liu
世界模型
强化学习
数据科学智能体
环境转移模拟
自主智能体
全开源音视频大模型,专为长复杂视频设计,三阶段课程加时间接地链式推理
Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit...
全开源
多模态融合
数据集
视频理解
链式推理
以成本为统一坐标轴对比攻防两类安全智能体,揭示截然不同的缩放规律。
Paul Kassianik, Blaine Nelson, Yaron Singer
AI智能体评估
基准测试
大语言模型智能体
成本效益分析
网络安全
用机器人坐标系下的点云图给VLA注入3D几何,化解相机-动作坐标错配。
Byungkun Lee, Dongyoon Hwang, Dongjin Kim, Hojoon Lee, Minho Park, Jaegul Choo
3D几何
VLA
机器人中心坐标系
机器人操作
点云图
让两个模型互相当考官,竞争式RL隐式评估推理过程质量。
Vladislav Beliaev
GRPO
LoRA
多智能体竞争
强化学习
推理模型
用自适应高斯噪声保护谈判代理的私有约束,抵御行为侧信道推断攻击
Barkha Rani
侧信道攻击
差分隐私
自主谈判代理
行为隐私
随机化机制
把VLM二值自验证循环嵌入GRPO,无需外部监督大幅提升多模态推理
Mingyuan Wu, Jingcheng Yang, Shengyi Qian, Xudong Wang, Jize Jiang, Qifan...
GRPO
RL微调
多模态推理
强化学习
自验证
用潜变量刻画校验级联相关性,可靠性多项式衰减且有盲区天花板
Jiangang Han
LLM可靠性
Odds Law
de Finetti定理
校验器级联
潜变量模型
首个针对等离子体诊断 ML 模型的传感器失效鲁棒性基准,揭示序列模型在临近扰动失效时崩塌。
Neerav Gupta
传感器失效
基准测试
托卡马克
扰动预测
时间序列预测