把部署路由护栏的交互轨迹与能力信号转化为课程化后训练,闭合评估—选择—更新循环。
NeoHorse Team, Guoliang Cao, Guohao Dai, Tianyu Guo, Kai Han, Hailin Hu,...
LLM路由
在线策略蒸馏
技术报告
智能体后训练
课程学习
用自然语言指令与音频上下文统一语音生成和编辑的开源基础模型,四步推理提速4.5倍
Ziyang Ma, Zhikang Niu, Wenming Tu, Tianrui Wang, Ruiqi Yan, Junxi Liu,...
偏好优化
开源模型
强化学习
整流流
统一基础模型
双脑架构+流式分块扁平化,让一个端到端模型同时胜任全双工语音交互和长程智能体任务。
Orantqing, Shengpeng Ji, Junlong Tong, Jialong Zuo, Dongjie Fu, Di Cao,...
Thinker-Talker
全双工交互
全模态大模型
技术报告
智能体编排
用弱教师策略偏移方向放大强学生自身梯度,加速训练并突破教师上限
Youngrok Park, Sangmin Bae, Hojung Jung, Jongwoo Ko, Yunseon Choi, Young Jin...
RLVR
在线策略蒸馏
多教师蒸馏
弱到强泛化
策略梯度缩放
开源模块化研究栈把世界-动作模型预训练变成受控实验,提炼三大准则并开源6400小时数据预训练模型
Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang...
世界-动作模型
具身智能
具身预训练
机器人操作
流匹配
单张32GB GPU一周内把图像编辑DiT改造成细节锐利的SOTA单目深度估计器
Igor Pavlovic, Thiemo Wandel, Anton Obukhov, Luca Bartolomei, Andrey...
单目深度估计
扩散Transformer
最优传输损失
稠密回归
表示对齐REPA
解耦预训练感知与决策、蒸馏统一,端到端驾驶首次超越人类司机
Hao He, Chengcheng Hu, Zirun Su, Heng Zhang, Haisong Liu, Jinke Li, Haochen...
强化学习
知识蒸馏
端到端自动驾驶
视觉基础模型
闭环仿真
全栈 RL 后训练系统:token 级保真 rollout、全异步调度与三种权重同步传输
RadixArk, Tom Chen, Mao Cheng, Shi Dong, Kangrui Du, Yanbin Jiang, Jiajun...
Agentic RL
MoE训练
RL后训练系统
低精度训练
异步训练
从零预训练的世界-动作模型,零样本OOD成功率随数据从300小时到3万小时由17.1%升至44.1%
AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen,...
MeanFlow
世界-动作模型
单步视觉规划
数据缩放
机器人操作
随机双噪声掩码扰动自回归推演,缓解逆KL众数坍缩,无需真实数据即提升蒸馏视频质量
Zhuoran Zhao, Shengju Qian, Tongtong Liang, Xianghao Kong, Songchun Zhang,...
分布匹配蒸馏
实时视频生成
掩码建模
自回归视频生成
视频扩散蒸馏
图像先验快速初始化加智能体局部演化,24倍提速生成物理有效且多样的仿真场景
Xingjian Ran, Xiaoye Mo, Sihao Liu, Jianyu Zhang, Li Luo, Bo Dai
3D场景生成
VLM智能体
具身智能
布局多样性
物理有效性
用可自我演化的“程序三元组”图为 LLM 智能体逐步导航
Yuxing Lu, Yicheng Chen, Shanchan Wu, Sercan Ö. Arık
LLM Agent
图结构
智能体记忆
程序性知识
自演化
利用全局查询的聚类几何结构,用信标查询预判思维回看,保留关键KV缓存并实现5.8倍显存压缩
Janghyeon Kim, Minsoo Kim, Kyuhong Shim, Jungwook Choi
Farthest Point Sampling
KV缓存压缩
大型推理模型
无训练方法
注意力机制
让潜在视觉推理成为预测的因果必经之路,且不损失预训练视觉能力。
Suhyeong Park, Junha Jung, Jaewoo Kang
因果干预分析
多模态大模型
循环深度推理
潜在视觉推理
视觉问答
用手持夹爪采集手-爪配对数据,两阶段扩散框架实现复杂空间操作迁移
Hongxiang Zhao, Mutian Xu, Zeyu Jin, Yiming Hao, Shuguang Cui, Xiaoguang Han
人-机器人迁移
扩散模型
数据集
机器人操作
模仿学习
分支注意力CP分解与TapChannel旁路传输,让草稿在线协同训练实现最高1.88倍加速
Zili Wang, Zhaopeng Qiu, Yuekai Zhang, Shuang Yu, Junjie Lai
RL后训练
上下文并行
分布式训练系统
投机解码
流水线并行
分布驱动的转向向量能复现Schwartz价值环几何,行为导向方法只学到行为捷径。
Mohammad Mahdi Abootorabi, Armin Saghafian, Ali Bazshoushtari, Hamid Rezaei,...
Schwartz价值理论
价值对齐
可解释性
激活转向
线性表征假设
按控制器决策的最大因果触达,把智能体视觉生成统一划分为 L0–L4 五层的综述与评估框架
Yinming Huang, Shuyuan Tu, Xi Yan, Jiahao Zhan, Zihan Yang, Zhen Xing, Hui...
LLM控制器
图像与视频生成
强化学习
智能体视觉生成
综述
将Delta规则线性注意力重构为线性高斯状态空间模型,用卡尔曼增益按不确定性自适应调节记忆写入
Ngoc Bui, Tinglin Huang, Rex Ying
卡尔曼滤波
变分推断
状态空间模型
线性注意力
联想记忆
280个难度分级任务系统诊断VLA模型:复杂空间与长程操作下最强模型成功率也跌至22.3%
Zhenxuan Fan, Bo Zhang, Yutong Lin, Yuqian Yuan, Juekai Lin, Liang Liang,...
VLA
机器人操作
模仿学习
空间推理
评测基准
把适应从智能体侧转向环境侧,用分阶段增强反馈破解长程RL奖励稀疏
Hongbang Yuan, Zhuoran Jin, Yixin Cao
LLM智能体
奖励稀疏
强化学习
环境设计
长程任务
仅用3D坐标、免训练地把多视角词元精确剪到目标数量,8%词元保留93.5%性能
Nhat-Tan Bui, Varshini Elangovan, Arun Reddy Anugu, Sreyas Mohan, Wei Ye,...
免训练方法
多视角3D推理
推理加速
视觉词元剪枝
视觉语言模型
把已播放语音回喂模型,修复全双工语音打断后的自我定位漂移
Xuanning Zhou, Junyi Ao, Xiaotong Liu, Tom Ko, Benyou Wang, Haizhou Li
全双工语音
打断处理
数据集构建
语音大模型
语音对话系统
首个直接输出29自由度全身动作的视觉语言导航模型,纯仿真训练即可零样本部署真机。
Anqi Li, Yuxin Chen, Zhaobo Li, Zhuo Cao, Junli Ren, Masayoshi Tomizuka, Dhruv Shah
Sim-to-Real
VLA模型
人形机器人
仿真数据合成
全身控制
加希腊语容易,证明有效难:五类常用指标全部失灵,需以构造性对照与多种子复现重建可信结论。
Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos
世界模型
假阳性控制
机器人策略
视觉-语言-动作模型
评测方法学
生产级遥测揭示:LLM交易agent的行为由滑块、渲染与订单路径决定,而非模型推理。
T. J. Barton, Chris Constantakis, Patti Hauseman, Annie Mous, Alaska...
LLM智能体
因果推断
实证测量
评估方法论
量化交易
把多镜头叙事从时间轴搬进空间网格,联合生成长视频
Jiawei Mao, Haoqin Tu, Hardy Chen, Yuhan Wang, Keyang Xu, Jieru Mei,...
LoRA
后训练
多镜头叙事
扩散模型
视频生成
用MoCap驱动深度条件视频扩散构建1.9万段合成步行视频,证明合成监督可有效迁移到真实步态估计。
Soroush Mehraban, Xin Lei Lin, Vida Adeli, Majid Mirmehdi, Amirhossein...
临床运动分析
合成数据集
基准评测
步态分析
视频扩散模型
量化VAE重建退化,用像素空间几何损失与GRM后解码修正实现单步精准法线估计
Mingwei Li, Yi Yang, Hehe Fan
LoRA微调
VAE重建退化
单目几何估计
整流流
法线估计
开源五阶段视频数据流水线,对照实验证明广覆盖配方的早期预训练效果优于高过滤配方
Yan Ma, Jiadi Su, Zhulin Hu, Ethan Chern, Linhao Zhang, Tiantian Mi, Pengfei Liu
数据基础设施
数据配方
数据集
自监督学习
视频生成
快慢解耦架构只在异常时唤醒重型模型,实现因果流式视频异常理解。
Chia-Hui Chen, Shih-Ying Yeh, Fu-En Yang, Min-Hung Chen, Shang-Hong Lai
Slow-Fast架构
多模态大语言模型
智能监控
流式视频
视频异常理解
首个AI智能体内部威胁检测开放基准:150账户、12威胁、40监控器大规模评测
Aashiq Muhamed, Virginia Smith
AI安全
LLM监控
MITRE ATT&CK
内部威胁检测
智能体评测基准
时序基础模型仅对需求类序列的有损压缩有效,297对全胜提升21.4%
Roberto Tacconelli
TimesFM
数据压缩
时间序列基础模型
熵编码
误差有界压缩
融合CLIP语义与DINO结构先验,用熵不确定性逐样本加权,刷新deepfake检测泛化纪录
Xuechao Zou, Yi Zhou, Kai Li, Shun Zhang, Yuhui Chen, Congyan Lang, Junliang Xing
LoRA微调
不确定性估计
域泛化
深度伪造检测
特征融合
模型内部已线性编码“无解”信号,但它与安全拒答轴近乎正交,未被路由进弃答行为。
Yucheng Du, Xiyang Hu
可解释性
安全对齐
拒答机制
激活转向
线性探针
用尖峰-滑块先验加高斯混合的变分学习同时剪枝与量化,压缩率更高且精度损失更小。
Ziyi Wang, Nan Jiang, Guang Lin, Qifan Song
剪枝
变分推断
模型压缩
贝叶斯深度学习
量化
伙伴专业度在第8层最可解码却因果沉默,第36层后才真正驱动输出。
Mika Okamoto, Gabriele Sarti
基础模型科学
对话建模
机制可解释性
激活补丁
线性探针
按隐藏状态轨迹方向角把冗余思维链压成潜在token,精度升2.6%、长度近半。
Xiaoang Xu, Siyuan Liu, Shuo Wang, Junlan Feng, Fanyu Meng, Zhu Zhang, Jixun...
几何动力学
思维链压缩
显式-隐式交织
潜在推理
高效推理
改造视频生成大模型,用交叉注意力注入光照,前馈完成单/多视角物体重光照
Hejun Wang, Jinxi Li, Junwei Jiang, Shiwei Mao, Hu Cheng, Shouwang Huang, Bo Yang
多视角重光照
流匹配扩散模型
生成式Transformer
视频基础模型
重光照数据集
模型只解释问题,确定性策略执行预写分析程序,答案与证据可复现
MasterControl AI Lab
LLM智能体
Text-to-SQL
关系代数
受治理数据分析
可复现性
以可修订的“协调事件”为防御单元,把跨执行监控、政策判定与重启后遏制变成可证伪的实验问题
Gregory N Frank
入侵检测与响应
共识主动性
多智能体系统
安全立场论文
智能体安全
蒸馏2D编辑模型、VLM与3D生成先验,无配对数据训练前馈3D编辑器
Hao Wen, Weibin Yun, Hongxing Fan, Haotian Lu, Rui Chen, Zehuan Huang, Lu Sheng
3D编辑
3D高斯泼溅
分布匹配蒸馏
前馈编辑
无配对监督