用200名真实用户500天可穿戴数据出4084道10选1题,14个大模型最高仅72.9%
Ji Soo Lee, Xilun Chen, Pierce Chuang, Ashish Shenoy, Jason Wei, Dohwan Ko,...
2026-09-10
医疗健康AI
大语言模型
数据集构建
时间序列推理
评测基准
280个难度分级任务系统诊断VLA模型:复杂空间与长程操作下最强模型成功率也跌至22.3%
Zhenxuan Fan, Bo Zhang, Yutong Lin, Yuqian Yuan, Juekai Lin, Liang Liang,...
2026-09-09
VLA
机器人操作
模仿学习
空间推理
评测基准
提出L0–L4递退监督阶梯,沿奖励与经验双轴梳理LRM超越人类监督的方法、风险与评测。
Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao,...
2026-09-01
RLVR
大型推理模型
奖励模型
综述
自我演化
PRISK框架系统评测13个LLM,量化个性化带来的无关注入、偏好窄化与谄媚三大隐性代价
Yumeng Wang, Yuchen Wu, Cheng Qian, Zhiyuan Fan, Hyeonjeong Ha, Shujin Wu,...
2026-09-01
LLM-as-a-Judge
LLM个性化
LLM安全与对齐
信息茧房
评测基准
偏好线索藏在工具返回或需自行推断时,模型暗中跟随偏好而不在思维链声明的比例显著升高
Aryo Pradipta Gema, Neel Rajani, Rohit Saxena, Wai-Chung Kwan, Pasquale Minervini
2026-09-01
AI安全
CoT忠实性
智能体监控
评测基准
谄媚性
视频模型能生成合理的单条未来,却难以复现同一条件下可能未来的正确分布。
Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević,...
2026-08-28
世界模型
分布对齐
概率校准
视频生成
评测基准
首个系统评测视频指令遵循的基准:20余模型中最强者仅得54.5分
Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng,...
2026-08-27
LLM-as-Judge
多模态大模型
指令遵循
视频理解
评测基准
用千级细粒度概念库与组合式密集监督,刷新图像编辑SOTA并压缩训练样本需求1.5倍。
Long Cui, Xiaoqian Liu, Qi Qin, Yi Xin, Tao Lin, Jianguo Li, Linfeng Zhang
2026-08-25
图像编辑
密集监督
扩散模型
指令跟随
数据合成
首个贯通游戏生成、缺陷修复与多轮优化的编码智能体全生命周期游戏开发评测基准
Kun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie,...
2026-08-25
多轮交互优化
执行落地评估
游戏开发
程序修复
编码智能体
以先验知识固定交互路径并逆向改造网络视频,系统评测全模态大模型的实时视频助手能力。
Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao, Yonghui...
2026-08-24
全模态大模型
多轮交互
流式视频理解
视频助手
评测基准
分层智能体评测流水线把世界模型评分变成可审计的证据树,判断与人类高度一致
Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai,...
2026-08-18
VLM-as-Judge
世界模型
可解释性
智能体评测
视频生成
把多参考图像生成拆成锚定、解缠、绑定、组合四个算子,构建约1600例基准并定位失败根源
Haoran Wang, Chaofan Ma, Ran Yi, Lizhuang Ma
2026-08-18
VLM裁判
多参考图像生成
组合泛化
统一多模态模型
评测基准
用私有审计真值图构建企业QA基准,专考语料中从未明说的组织关系推理
Akrin Zheng, Alexander Wu, Alaia Liu
2026-08-18
RAG
企业问答
多跳推理
知识图谱
评测基准
把机器人执行视频转成进度曲线,用 OPD 指标体系细粒度评估具身模型的过程能力
Yuyang Liu, Yanqing Shen, Ruike Chen, Jifan Zhao, Yuxuan Tian, Yichi Zhang,...
2026-08-17
VLA模型
具身智能
机器人操作评估
评测基准
过程奖励模型
让智能体递归优化自身设计Harness,40分钟自动产出人类偏好最高的学术海报
Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li,...
2026-08-14
代码智能体
元Harness优化
多模态设计
智能体自进化
论文转海报
首个评测LLM移动助手跨应用检索分散个人信息的基准,最强模型准确率仅57.3%
Junjie Ye, Zhuohui Sheng, Shaofan Liu, Yulun Zhu, Wenjie Fu, Dingwei Zhu,...
2026-08-12
LLM智能体
信息检索
工具调用
移动助手
评测基准
首个60学科专家标注的科学视频生成基准,揭示“看着逼真”不等于“机理正确”
Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao
2026-08-11
MLLM-as-Judge
科学推理
视频生成
评测基准
量规评测
用语义关系蒸馏与几何变换对齐,让视频扩散模型生成与可见场景一致的镜面反射
Youjun Zhao, Alex Warren, Gary K. L. Tam, Rynson W. H. Lau
2026-08-11
LoRA微调
表示对齐
视频修复
视频扩散模型
评测基准
5个嵌入裁判+Borda投票,评测17个视频语言模型对90秒电影片段的段落级描述
Mukhtiar Ali, Harsh Dubey, Sugam Mishra, Chulwoo Pack
2026-08-10
Borda聚合
嵌入相似度
模型集成
视频语言模型
评测基准
跨平台 CUA 轨迹评测基准揭示 VLM 判官普遍的宽容偏差,并开源低成本奖励模型弥合成本鸿沟。
Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen,...
2026-08-07
VLM 判官
奖励模型
强化学习
计算机使用智能体
评测基准