← 前一天
2026-08-18
后一天 → 今日

分层智能体评测流水线把世界模型评分变成可审计的证据树,判断与人类高度一致

Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai,...
VLM-as-Judge 世界模型 可解释性 智能体评测 视频生成

LLM提议候选、高斯过程校准不确定性,采集函数统一调度推理算力与昂贵实验,实现跨域科学发现

Zhongwei Yu, Yan Song, Xue Yan, Anjie Liu, Xingyu Lu, Yihang Chen, Huichi...
LLM智能体 序列与分子设计 测试时计算 科学发现 贝叶斯优化

潜空间预训练再迁移像素空间后训练的实证配方,质量持平潜空间模型且推理快3.18–4.75倍

Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe...
像素空间生成 实证研究 扩散模型 文生图 步数蒸馏

以8万余条无攻击诱导的有害输出,为23个前沿LLM刻画有害性与多样性双轴风险画像。

Zhouyuan Ma, Yutao Wu, Hanxun Huang, Xiang Zheng, Xiao Liu, Yixin Cao,...
LLM安全评估 基准数据集 智能体工作流 有害内容分布分析 模型风险画像

按物理、社会、自指三级认知框架系统分析智能体AI对人类能动性、自主性与控制力的风险

Guanchu Wang, Qinuo Li, Mengnan Du, Xia Hu, Bowen Zhou
AI风险治理 LLM智能体 对齐 智能体安全 机器意识

把严重噪声建模为潜空间低秩仿射畸变,闭式几何修正编译成静态矩阵,免梯度实现亚毫秒级测试时适应

Ashish Anand Shukla, Rini Smita Thakur, Aryan Das, Vinod K. Kurmi
几何去噪 测试时适应 边缘推理 零样本分类 音频-文本基础模型