提出以结果为导向的视频生成新任务,用VLM评判结果达成与语义接地双重指标。
Keyu Tu, Zhuowei Chen, Mengqi Huang, Yuxin Wang, Jiahao Zhu, Zhendong Mao,...
VLM评估
图像到视频
基准评测
指令遵循
数据集构建
冻结VLA策略,用自进化的代码Critic与恢复技能实现机器人闭环执行治理与持续提升
Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu...
VLA
具身智能
推理基础设施
机器人操作
自进化Agent
验证门控智能体框架:LLM 生成的 PLC 逻辑须经规范、编译与实机三重外部验证方可交付
Yanlun Tu, Huacan Wang, Ziyue Zhou, Jie Zhou, Ningyan Zhu, Ge Chen, Wangyi...
LLM智能体
PLC代码生成
工业自动化
运行时验证
验证门控
让多个独立模型互为老师:以同伴多数票为奖励,无需标注即可涌现推理能力
Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi,...
多智能体
大语言模型推理
强化学习
无标签RL
自奖励
单一模型自博弈:既写可执行训练环境又解题,环境难度随能力共同进化,实现持续自我提升。
Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim,...
LLM智能体
强化学习
环境合成
自博弈
课程学习
Top-K提示+化学合理性奖励训练出超越传统模型的大语言模型逆合成系统
Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Maksim Kuznetsov, Mathieu...
化学信息学
单步逆合成
合成规划
大语言模型
强化学习
让15个前沿大模型各管一家足球俱乐部20年,测谁会“经营”而不只是“执行”。
Tianyou Wang, Chongyang Gao, Kezhen Chen, Chen Dong, Yinghao He, Donghan Li,...
LLM Agent
基准测试
多智能体竞技场
行为能力分解
长程决策
从残差分支乘积中剔除通用恒等结构,仅凭权重判断两个模型检查点是否同源
Aman Singh Thakur, Rayan Khoury
LLM供应链安全
权重指纹
模型审计
模型溯源
残差网络
循环语言模型在组合式工具调用上优势显著,自适应推理带来更优的计算-性能权衡
Andrei Cristian Popescu, Haitz Sáez de Ocáriz Borde, Pietro Liò
AI Agent
工具调用
循环Transformer
测试时计算
自适应推理
用外部流行度为每条事实定制遗忘梯度强度,自动平衡深度擦除与能力保留
Anna Borisiuk, Andrey Savchenko, Alexander Panchenko, Elena Tutubalina
LLM遗忘
机器遗忘
梯度上升
流行度差距
约束优化
可解码不等于可排序:动作条件辅助监督让潜在代价排序对齐真实结果,提升MPC成功率
Jiawei Wang, Ke Rui, Yushen Zuo, Yichun Feng, Minglei Li
JEPA潜在世界模型
决策度量对齐
机器人操作
模型预测控制
表征几何
用人工策划的体裁属性把故事种子扩展成50K条13体裁创意写作数据
Hwan Chang, Yongil Kim, Heuiyeen Yeen, Yireun Kim, Jinsik Lee, Hwanhee Lee
CIKM 2026
LLM-as-a-Judge
创意写作
合成数据
指令微调
4千条视触觉演示加DSR指标,识别任务成功却过度挤压物体的策略
Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He,...
具身智能
可变形物体
基准评测
机器人操作
视觉-触觉学习
首个用人类反馈训练的音视频联合生成思维链奖励模型,取代易被hack的专家指标
Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang...
GRPO
人类偏好对齐
奖励模型
强化学习后训练
音视频联合生成
把技能选择从结果奖励噪声中拆出,用双通道信用分配单独训练
Qingyao Li, Wenxiang Jiao, Shuai Shao, Kangning Zhang, Yuan Lu, Yi Guo,...
GRPO
信用分配
大模型智能体
强化学习
技能选择
以学生置信度与跨语言表征距离为奖励训练出题模型,兼顾多语言性能与一致性
Ishika Agarwal, Arkajyoti Charaborty, Tanner Sorensen, Neha Gupta, Andreas Stolcke
GRPO强化学习
合成数据生成
后训练数据策展
多语言LLM
灾难性遗忘
把提示注入防御从模型层移到授权架构层,用组合闭包将外泄攻击成功率压到0%
Xabier Muruaga
多智能体系统
授权架构
提示注入防御
智能体安全
最小权限
用33维黑盒特征流加BiGRU序列标注检测token级幻觉,AUC较逐token独立分类提升11点
Igor Itkin
BiGRU
RAG
信息论分析
多信号融合
幻觉检测
首个系统评估音乐编辑系统非目标属性保持能力的四维度指标框架MuseCPEval
Yash Vishe, Eric Xue, Xunyi Jiang, Zachary Novack, Junda Wu, Julian McAuley, Xin Xu
MIR指标
扩散模型
评估基准
音乐信息检索
音乐编辑
学习式自适应初始化替代固定噪声,LiDAR场景补全仅0.1秒,快2.3倍
Azhar Hussian, Martin Vossiek, Vasileios Belagiannis
LiDAR场景补全
可变形注意力
实时3D感知
点云补全
鸟瞰图BEV
从预训练检测器引出语义/几何/上下文先验,组成5维可解释表示,不动检测器即刷新OoD检测SoTA
Changshun Wu, Weicheng He, Xiaowei Huang, Saddek Bensalem
OoD检测
可解释性
幻觉缓解
概念学习
模型可靠性