找到 170 条结果

本文首次系统综述 Agent-as-a-Judge 范式,通过规划、工具验证、多智能体协作和记忆机制提升 AI 评估的鲁棒性和可验证性。

Runyang You, Hongru Cai, Caiqi Zhang, Qiancheng Xu, Meng Liu, Tiezheng Yu,... 2026-01-09
AI评估 LLM-as-a-Judge 多智能体系统 工具增强推理 自动评估