构建百万级多方言指令数据集并微调LLM可控生成阿拉伯诗歌。
Abdelrahman Sadallah, Kareem Elozeiri, Mervat Abassy, Rania Elbadry, Mohamed...
2026-05-01
LLM评估
LoRA
创意文本生成
指令微调
方言处理
首个大规模基准评估AI智能体在科学文献深度与广度检索中的真实能力
Lei Xiong, Kun Luo, Ziyi Xia, Wenbo Zhang, Jin-Ge Yao, Zheng Liu, Jingying...
2026-04-29
Deep Research
DeepXiv
LLM评估
ReAct框架
Wide Research
评估智能体能否从经验中发现并持续修复技能库的终身学习基准
Ziao Zhang, Kou Shi, Shiting Huang, Avery Nie, Yu Zeng, Yiming Zhao, Zhen...
2026-04-21
LLM评估
技能发现
智能体基准
流程自动化
终身学习
用种子驱动的程序化生成构建无限科学数据仓库与可验证问答基准
Oliver Bentham, Vivek Srikumar
2026-04-16
Agent评测
LLM评估
可回答性检测
工具使用
科学推理
用轻量级BERT模型替代词汇方法,高效评估LLM答案正确性
Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Emmanuel Malherbe, Céline...
2026-04-15
LLM评估
基准测试
编码器模型
自动评估
构建405道自然科学实验预测任务,揭示LLM在实验结果预测与可靠性校准上的双重缺陷
Udari Madhushani Sehwag, Elaine Lau, Haniyeh Ehsani Oskouie, Shayan Shabihi,...
2026-04-14
LLM评估
基准测试
实验预测
校准评估
科学发现
用"用户回合生成"作为新探针,揭示任务准确率与交互感知能力完全脱钩。
Sarath Shekkizhar, Romain Cosentino, Adam Earle
2026-04-13
LLM-as-Judge
LLM评估
交互感知
多智能体
对话系统
OmniBehavior:首个用快手真实日志构建的用户模拟基准,揭示LLM的积极性偏差与人格趋同。
Jiawei Chen, Ruoxi Xu, Boxi Cao, Ruotong Pan, Yunfei Zhang, Yifei Hu, Yong...
2026-04-10
LLM评估
工业数据集
用户模拟
结构偏差
行为基准
通过关系型schema统一LLM质量评估与路由决策,实现可解释、低成本的多模型智能调度
Zecheng Zhang, Han Zheng, Yue Xu
2026-03-31
LLM-as-Judge
LLM评估
模型路由
结构化输出
网关系统
递归扩展树生成问题特定评估标准,揭示LLM细粒度能力差异
Shanghua Gao, Yuchang Su, Pengwei Sui, Curtis Ginder, Marinka Zitnik
2026-03-26
HealthBench
LLM评估
开放式问答
评估标准生成
递归扩展
首个将第一视角视频感知与网页任务执行连接的基准,含500对视频-指令样本
Shoubin Yu, Lei Shu, Antoine Yang, Yao Fu, Srinivas Sunkara, Maria Wang,...
2026-03-25
LLM评估
基准测试
多模态智能体
第一视角视频
网页智能体
首个评估LLM Agent技能在软件工程中边际效用的基准,发现49个技能中39个无提升
Tingxu Han, Yi Zhang, Wei Song, Chunrong Fang, Zhenyu Chen, Youcheng Sun, Lijie Hu
2026-03-18
Agent技能
LLM评估
代码生成
技能注入
软件工程基准
首个评估LLM生成原则驱动、交互式HTML应用能力的基准测试框架
Zuhao Zhang, Chengyue Yu, Yuante Li, Chenyi Zhuang, Linjian Mo, Shuai Li
2026-03-11
LLM评估
Web开发
交互式应用
代理评估
代码生成
LLM生成长篇故事时频繁自相矛盾,本文构建基准和自动化检测管道系统性分析五类一致性错误
Junjie Li, Xinrui Guo, Yuhao Wu, Roy Ka-Wei Lee, Hongzhi Li, Yutao Xie
2026-03-10
LLM评估
叙事一致性
故事生成
自动化检测
长文本生成
推理型LLM在概率性推理中过度自信,无法复现人类的分级不确定性判断
Gaurav Kamath, Sreenath Madathil, Sebastian Schuster, Marie-Catherine de...
2026-03-04
LLM评估
不确定性量化
人类认知
常识推理
概率推理
用272道大学级数学题、1300+份专家人工评分,系统审计LLM-as-a-Judge在证明评分中的系统性偏差与奉承陷阱。
Santiago Gonzalez, Alireza Amiri Bavandpour, Peter Ye, Edward Zhang, Ruslans...
2026-03-04
LLM评估
大学数学
对齐鸿沟
数学推理基准
自动证明评估
提出RubricBench基准,揭示LLM自动生成评估标准与人类标准之间存在约27%的准确率鸿沟
Qiyuan Zhang, Junyi Zhou, Yufei Wang, Fuyuan Lyu, Yidong Ming, Can Xu,...
2026-03-03
LLM评估
偏好对齐
基准测试
奖励模型
评分标准
提出T-RANK等测试时计算方法,显著提升多语言基准测试翻译质量
Hanna Yukhymenko, Anton Alexandrov, Martin Vechev
2026-03-02
LLM评估
基准测试
多语言评估
机器翻译
测试时计算
首份系统性实证研究:97.1% 的 MCP 工具描述存在"坏味道",增强全部组件可使任务成功率提升 5.85 个百分点但执行步骤激增 67.46%。
Mohammed Mehedi Hasan, Hao Li, Gopi Krishnan Rajbahadur, Bram Adams, Ahmed E. Hassan
2026-02-26
AI Agent
LLM评估
MCP
Prompt Engineering
工具描述
Gemini 3数学Agent在FirstProof中自主解决6/10道研究级难题
Tony Feng, Junehyuk Jung, Sang-hyun Kim, Carlo Pagano, Sergei Gukov,...
2026-02-25
AI数学推理
LLM评估
数学研究
自主Agent
自动定理证明