以真实危机视频为锚构建RA-Bench,系统评测发现现有检测器与人眼在逼真AI视频面前双双失守
Shuo Liang, Yixing Ma, Pengfei Zhou, Xingyan Chen, Zihan Mei, Manting Li,...
AI生成视频检测
危机事件
基准评测
多模态大模型
深度伪造防御
反转师生不对称方向:教师看原图、学生看增强退化视图,用视图落差当免费蒸馏信号
Yijiang Li, Yijun Liang, Yunjie Tian, Bingyang Wang, Ke Zhang, Zhenfei Yin,...
后训练
数据增强
知识蒸馏
自监督学习
视觉语言模型
以过程指标与对照实验评估七个前沿模型的长程自动研发能力:当前智能体更像工程优化器而非自主研究者
Yiwei Li, Wanli Yang, Hexiang Tan, Xiangzhou Huang, Zhengyu Chen, Ziran Li,...
Agent Harness
智能体评估
经验复用
自动研究Agent
过程评估
用可执行环境、隐藏验证器与HDS6过程验证,把开放式现实难题变成可评测的AI发现任务
Brian Wang, Bin Feng, Xiaoman Pan, Chenyang An, Felix Liu, Tangqi Fang,...
AI基准
智能体评估
现实环境
生物医学AI
科学发现
共享文本空间对齐加稳定化技巧,实现跨分词器的长上下文推理在线蒸馏
Haonan He, Haodi Lei, Yun Luo, Haoran Zhang, Shunkai Zhang, Yizhuo Li,...
LLM后训练
在线蒸馏
数学证明
知识蒸馏
跨分词器
把FFN知识库与注意力推理器解耦共享,同等精度下推理提速近4倍、训练数据省37%
Kai Chen, Jifeng Ding, Ning Ding, Jiaye Ge, Lixin Gu, Yicheng Gu, Qipeng...
持续预训练
推理效率
模型架构
潜在推理
知识推理解耦
显式276维世界状态加零参数渲染器承担精确几何与控制,神经网络只负责画外观
Zian Meng, Zhen Li, Chuanhao Li, Qiang Li, Kaipeng Zhang
世界模型
交互式视频生成
具身智能
可控生成
角色动画
仅用合规数据从头训练的10亿参数HRM模型,丹麦语新SOTA、英语媲美4B模型
Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen,...
丹麦语NLP
分层推理模型
合成数据
小语言模型
开源模型
基于一年真实移动经验的设备端记忆基准与KEME数据合成框架,现有记忆系统远未达标
Xinle Deng, Yida Xue, Xiangyuan Ru, Haoming Xu, Shuofei Qiao, Mengru Wang,...
基准评测
多模态
数据合成
移动智能体
长期记忆
把自蒸馏教师的特权上下文从手工设计改为可学习的潜在token,端到端内化经验。
Guibin Zhang, Jiayang Lyu, Ran Sun, Xinlei Yu, Haoyu Zhao, Qibing Ren, Shuicheng Yan
LLM后训练
在策略自蒸馏
潜在计算
知识蒸馏
自进化智能体
发布153小时分类人形追踪基准与偏好对齐指标HumanScore,弥合运动学误差与人类感知鸿沟
Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan, Yintianrun Zhang,...
人形机器人
人类偏好对齐
基准与评测
奖励模型
物理仿真
从通用编辑、真实部署到推理编辑三维覆盖,与人类偏好最对齐的图像编辑评测基准
Qinye Zhou, Jun Zheng, Yongchao Du, Yuan Wang, Zhengrui Chen, Zuan Gao,...
VLM评估
图像编辑
基准评测
多图编辑
推理能力
在ReAct行动-观察空闲窗口并行分支推理,不加关键路径即可减回合、省解码、保精度
Zhensu Sun, Chengran Yang, Yunbo Lyu, Jieke Shi, David Lo
LLM智能体
ReAct
并行推理
推理效率
推理时计算
LLM 神经元按语言、形式/社会/物理推理四大认知域自发分工,与人脑模块化组织一致
Pengrui Han, Jacob Andreas, Evelina Fedorenko, Andrea Gregor de Varda
因果消融
归因修补
机制可解释性
模块化
神经科学与AI交叉
把机器人执行视频转成进度曲线,用 OPD 指标体系细粒度评估具身模型的过程能力
Yuyang Liu, Yanqing Shen, Ruike Chen, Jifan Zhao, Yuxuan Tian, Yichi Zhang,...
VLA模型
具身智能
机器人操作评估
评测基准
过程奖励模型
固定TPP缩放下最优重复次数随模型变大反而增加,且由领域验证损失主导
Jingwei Li, Xinran Gu, Rui Dai, Xintong Hao, Chengyin Xu, Yan Wu, Shuran...
大模型预训练
数据混合
数据重复
缩放律
过拟合
把测试时算力从多采样转向声明级证伪验证,等调用量下提升数学推理准确率并显著省 token
Sen Xu, Wei Wang, Shixi Liu, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong...
LLM推理
免训练框架
测试时扩展
自洽性聚合
证伪验证
用基座LM与多模态模型的SAE特征差异来发现并定向控制多模态行为
Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian...
AI安全
多模态大模型
模型可解释性
激活转向
稀疏自编码器
从数学、内核、更新规则到通信全栈加速 Muon 正交化,优化器步时间最多降低约 6 倍
Noah Amsel, Jack Zhang, Kwangjun Ahn, Ali Naeimi, Austin Feng, Berlin Chen,...
GPU内核
Muon
优化器
分布式训练
大模型预训练
低可预测性令校准预测幅度坍缩,逐序列损失漏掉截面排序,CalibRank 兼顾两者
Shu Wan, Miles Ma, Hank Zhu, Guangqi Liu, Stephen Wang, Qingsong Wen, Huan Liu
截面相关性
损失函数设计
时间序列基础模型
模型评测
金融预测
用K-5小学语料从零训练5B模型构建可控知识沙盒,检验规模、后训练与ICL能否突破预训练边界
Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna...
受控预训练
小模型
强化学习后训练
数据过滤
知识边界
两个同伴谎报同一错误答案即可带偏临床Agent委员会,只有独立私查的裁判能抓住它
Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo, Felipe...
AI安全与监督
LLM-as-a-Judge
LLM评测
临床AI
多智能体系统
RLVR 在提升当前任务的同时,会把未来任务的成功轨迹挤到固定预算内难以采样
Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang
RLVR
大语言模型
强化学习
持续学习
指令跟随
用GNN+ViT+GRU联合建模冻结VLM内部计算轨迹,实现词元级幻觉检测与解码期干预
Dvir Samuel, Guy Bar-Shalom, Fabrizio Frasca, Ethan Fetaya, Yftah Ziser, Gal...
可控解码
多模态
幻觉检测
视觉语言模型
计算轨迹
以ALD/E-ImageMiner基准为支点,规划科学图像多模态理解的长期评测路线图
Jennifer D'Souza, Fahad Ahmed, Cecilia Andrea Bustamante Andrade, Lina...
基准数据集
多模态AI
数字图书馆
材料科学
科学图像理解
修复 Nanbeige4.2-3B 的五处部署 bug,分块预填充使其可用上下文扩展 2.7 倍
John T. Halloran
Apple Silicon
Looped Transformer
内存优化
工具调用
工程调试
思维模型放大自我修正等行为,但最预测正确性的是置信校准——放大不等于预测
Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig
大模型推理
思维链
模型行为分析
评估与基准
把视觉生成当作训练期辅助监督,训后丢弃生成分支,零推理开销提升理解能力
Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He,...
Mixture-of-Transformers
多模态大模型
统一理解-生成模型
表征学习
视觉生成
用三级难度引用扰动揭示:LLM 能抓住假案例,却难以验证真实引用的页级命题支持。
Apurv Verma
LLM评测
幻觉检测
引用验证
法律AI安全
法律NLP
用查询依赖的权威建模与逐字引用约束,让 RAG 平衡总结意大利十个议会党团立场
Mirko Tritella, Riccardo Pozzi, Matteo Palmonari
RAG
专家发现
引用忠实性
知识图谱
议会NLP
全自动四阶段流水线,把虚假捷径写成可执行布尔表达式并经反事实因果验证后用于无标注去偏
Chidaksh Ravuru, Shashank Srivastava
LLM数据审计
因果验证
模型去偏
自然语言推理
虚假相关性
用单一原生多模态生成模型统一3D重建、稠密对应与空间推理
Jinsheng Quan, Jianhua Li, Siyi Xie, Xuanke Shi, Kewang Deng, Zukai Chen,...
3D视觉
光流估计
多模态统一模型
整流流生成
空间推理