视频生成仅作训练信号,推理时丢弃视频分支直接预测轨迹
Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin...
世界-动作模型
强化学习
流匹配
端到端自动驾驶
视频生成
揭示SFT多阶段训练产生任务冲突而RL可稳定共存,并提出Parallel-RL解耦框架。
Kejian Zhu, Zhuoran Jin, Shangqing Tu, Hongbang Yuan, Yushi Bai, Kang Liu,...
GRPO
LLM后训练
多任务学习
强化学习
梯度正交性
多模态环境不能盲目堆量,应从能力多样性与难度结构两维度设计训练分布
Kejian Zhu, Zhuoran Jin, Dongqi Huang, Hongbang Yuan, Yupu Hao, Kang Liu, Jun Zhao
GRPO
多模态智能体
强化学习
环境设计
课程学习
构建83亿人格库与四大模拟环境,用模拟用户端到端评测AI产品
Xiaomin Li, Yuexing Hao, Jianheng Hou, Jintao Huang, Qianfeng Wen, Shirley...
LLM智能体
人格数据集
合成人口
智能体评测
模拟用户评估
训练14个小模型证明0.6B即可匹配70B认知代理,且模型靠真实任务信息而非统计捷径
Nick Oh, Fernand Gobet
LoRA微调
噪声天花板
心理-101数据集
提示消融
缩放定律
把 PEFT 适配器放置建模为约束规划,自动为 YOLO 检测器产出可审计可部署方案
Xu Lin, WenJie Nie, Jinlong Peng, Weifu Fu, YueXiao Ma, Xiawu Zheng, Yong Liu
YOLO
参数高效微调
目标检测
约束规划
适配器放置
把规划从脚手架固定产物变成可跨脚手架迁移的模型能力
Kishanthan Thangarajah, Boyuan Chen, Ahmed E. Hassan
CLI智能体
监督微调
脚手架解耦
规划能力内化
软件工程智能体
微调激活预言机会对自身训练时持久存在的概念选择性失读
Tobias Bersia, Tatiana Gaintseva
LLM安全审计
可解释性
微调副作用
机制可解释性
潜知识提取
首个联合评估四项能力的小时级流式视频基准,配合双层解耦的StreamMind架构
Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu,...
主动交互
基准评测
多模态智能体
流式视频理解
视频大模型
离线缓存教师Top-K对数几率并融合分块KL损失,让蒸馏显存随序列长度线性增长。
Bakbergen Ryskulov, Iker García-Ferrero, David Montero, David Jansen, Ali...
KL散度
分布式训练
大语言模型
显存优化
模型压缩
两阶段训练兼顾十亿级检索效率与细粒度语义判别
Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua...
多模态检索
对比学习
嵌入模型
工业部署
隐式推理
用自演化的音频接地评分标准做过程级奖励,提升音频推理质量
Fangxu Yu, Tao Feng, Dehai Min, Zinan Lin, Weijia Xu, Michael Xu, Philip S....
大音频语言模型
强化学习
评分标准奖励
过程监督
音频推理
硬提示压缩会独立打分切断证据依赖,保留答案却删除其支撑桥梁,导致范式级失效。
Zhengpei Hu, Kai Li, Dapeng Fu, Xuechao Zou, Yuanhao Tang, Yue Li, Tengfei...
上下文压缩
多跳问答
大语言模型推理
指代悬空
提示压缩
WorldTrace:免训练的可寻址压缩记忆,让视频世界模型在长程生成中保持场景一致性
Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé,...
KV缓存压缩
旋转位置编码
视频世界模型
记忆机制
长程生成
把轨迹打分重构为条件OOD检测,用不确定性子空间分离可解释与不可解释残差,提升无人机图像目标导航。
Deyi Zhu, Haoyu Fan, Yinan Zhu, Weichen Zhang, Shilin Ma, Xinlei Chen, Yansong Tang
不确定性建模
世界模型
分布外检测
图像目标导航
无人机导航
多智能体协作推理检测深伪视频,并构建10万级细粒度标注数据集
Xuechao Zou, Shun Zhang, Kai Li, Yi Zhou, Xinyu Sun, Yuhui Chen, Zhe Wu,...
多智能体系统
多模态大语言模型
强化学习对齐
数据集
深度伪造检测
用每场景约20段对话的人类标注校准LLM轮替预测,合成场景自适应的全双工训练数据
Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim,...
LLM校准
人机交互
全双工语音对话
对话数据合成
语音大模型
Google 大规模实证揭示 AI 生成 C++ 代码的质量、维护与计算成本特征
Michael Tran, Fred Lewis, Kun Yang, Saksham Thakur, Aditya Kini, Aditya...
AI代码生成
代码审查
实证研究
软件质量
静态分析
用方向标志训练单一双向扩散模型,以前后往返的不一致自监督估计展开误差。
Alexander Scheinker
PDE代理模型
双向时间动力学
循环一致性
扩散模型
潜空间生成模型
引入单一耦合指数修正加性缩放律的边界偏差,外推误差降1.5-3×,稀疏网格省10×算力
Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja
Chinchilla定律
大模型训练
损失函数建模
神经缩放定律
计算最优分配
单一工具调用智能体内化搜索策略,统一优化提示词、程序与ML工作流。
Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang...
AutoML
LLM智能体
代码智能体
推理驱动搜索
自动优化
把测试时训练的内部学习器表示为有向无环图,系统消融发现浅层小学习率方案最优
Bohao Tang, Zhen Qin, Yuqi Pan, Zheng Li, Pengfei Liu, Ya Zhang
序列建模
快速权重
测试时训练
消融研究
线性注意力
将对抗样本反转用于保护内容所有者,统一五大防护研究社区
Jiaming Zhang, Boyang Chen, Zherui Li, Fuyao Zhang, Xinyu Yan, Hong Xi Tae,...
内容溯源
对抗机器学习
综述
视觉内容防护
隐私保护
保留帧级特征的双编码器嵌入模型,单一相似度同时刻画语义与时间对齐
Kaisi Guan, Bingzi Zhang, Xihua Wang, Ying Ba, Xin Cheng, Yijing Chen, Ruihua Song
对比学习
嵌入表示
跨模态检索
音视频同步
音视频学习
用统一强化学习框架打通情感感知、理解与交互三大层次
Jiahao Huang, Zheng Lian, Jingyi Zhang, Zhide Chen, Xiaojiang Peng, Shaonan Wang
GRPO
共情对话生成
多任务学习
多模态情感计算
强化学习
把世界生成模型构造未来的内部计算蒸馏为仅由当前观测预测的表征,控制时无需执行生成器
Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian,...
世界模型
机器人操控
视觉语言动作模型
预测表征学习
高效推理
提出SA-PPG分层指标与RailCap在线抑制策略,揭示G-AP系统性高估污染缓解效果。
Ruijie Hou, Yueyang Jiao, Zhao Wang, Yingming Li
基准污染
大模型评测
污染缓解评估
解码干预
评估度量
用大五人格量表测量大模型智能体经历生活事件后的人格变化,构建 BFI-Adapt 基准。
Ming Wang, Peidong Wang, Xiaocui Yang, Daling Wang, Shi Feng, Fiona Fui-Hoon...
LLM 评测基准
人格条件化智能体
人格演化
大五人格
心理测量
用执行状态匹配校验特权参考轨迹,只在匹配轮次做自蒸馏,多轮智能体任务成功率显著提升。
Junzhuo Liu, Weiwei Li, Jun Ling, Peng Wang
GRPO
LLM agents
multi-turn agents
on-policy distillation
reinforcement learning
首个聚焦 LLM 智能体获取阶段隐私泄露的基准,含 1182 个用例
Mingxuan Zhang, Jiahui Han, Dadi Guo, Songze Li, Guanchu Wang, Na Zou,...
Benchmark
LLM Agent
工具调用
数据最小化
隐私审计
用执行中心的能力分类法训练四类专家再合并蒸馏成统一具身VLM
Ying Chen, Weizhen Li, Zhe Hu, Zhenjiang Li, Rui Jiang, Zhifeng Gu, Lihuang...
具身智能
强化学习后训练
机器人推理
模型合并
知识蒸馏
用成语跨概念网络评测多模态模型的创造性解码能力。
Ming Wang, Yuqing Zhang, Tingna Xie, Xiangju Li, Xiaocui Yang, Daling Wang,...
MLLM评估
创造力评测
基准测试
多模态大模型
成语
BagNet+t-SimCNE,打造天生可解释的眼底图像基础模型
Samuel Ofosu Mensah, Camila Roa, Kerol Djoumessi, Philipp Berens
医学影像
可解释机器学习
基础模型
眼底图像
自监督学习
单个矩阵门同时控制记忆保留与写入,使量子快权重模型预测误差降低91%以上
Kuo-Chung Peng, Samuel Yen-Chi Chen, Jiun-Cheng Jiang, Chen-Yu Liu, En-Jui...
Kolmogorov-Arnold网络
序列建模
快权重编程
时间序列预测
量子机器学习
5个嵌入裁判+Borda投票,评测17个视频语言模型对90秒电影片段的段落级描述
Mukhtiar Ali, Harsh Dubey, Sugam Mishra, Chulwoo Pack
Borda聚合
嵌入相似度
模型集成
视频语言模型
评测基准