找到 60 条结果

PRISK框架系统评测13个LLM,量化个性化带来的无关注入、偏好窄化与谄媚三大隐性代价

Yumeng Wang, Yuchen Wu, Cheng Qian, Zhiyuan Fan, Hyeonjeong Ha, Shujin Wu,... 2026-09-01
LLM-as-a-Judge LLM个性化 LLM安全与对齐 信息茧房 评测基准

视频模型能生成合理的单条未来,却难以复现同一条件下可能未来的正确分布。

Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević,... 2026-08-28
世界模型 分布对齐 概率校准 视频生成 评测基准

分层智能体评测流水线把世界模型评分变成可审计的证据树,判断与人类高度一致

Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai,... 2026-08-18
VLM-as-Judge 世界模型 可解释性 智能体评测 视频生成

把机器人执行视频转成进度曲线,用 OPD 指标体系细粒度评估具身模型的过程能力

Yuyang Liu, Yanqing Shen, Ruike Chen, Jifan Zhao, Yuxuan Tian, Yichi Zhang,... 2026-08-17
VLA模型 具身智能 机器人操作评估 评测基准 过程奖励模型