构建近万真实智能体的大规模检索基准,用执行性能定义相关性。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
把网页分块重构为基于稳定ID的语义规划问题,大幅降低输出token与成本。
真实可复现的多模态深度研究智能体评测基准
用可训练软令牌包裹文档实现零重算 KV 缓存拼接
把语料离线编译成层次化技能树,让LLM智能体主动浏览导航,取代被动的top-k检索。
用 7 属性+10 检查点+250 故事形式化衡量 AI 的连续性
提出 HiExp 框架,将搜索代理的随机探索转化为基于分层经验引导的策略性搜索
把论文拆成可验证声明,文献检索+代码执行双管齐下,标注证据等级但不替代人类判断。
把稀疏注意力、RAG 等LLM优化统一为四阶段内存流水线,并用GPU-FPGA异构系统加速。
稀疏注意力+文档级RoPE,端到端训练实现1亿token线性扩展
提出BubbleRAG框架,通过气泡扩展启发式算法解决黑盒知识图谱中的召回率和精确率双重挑战
通过上下文化和去重模块改进Search-R1,EM提升5.6%,检索轮次减少10.5%
首个多模态多源个性化记忆问答基准 ATM-Bench,SGM 显著优于传统 DM。
首个将虚假叙事与仇恨言论融合的多维可解释仇恨检测基准
首个法律领域端到端RAG基准,证明检索质量比LLM更关键
知识图谱验证的大语言模型基准测试
👍 7提出FactCheck基准,系统评估LLM在知识图谱事实验证中的能力、RAG效果与多模型共识策略
CatRAG通过动态图遍历解决静态知识图谱RAG中的语义漂移问题
通过层次化语义索引和双路径检索,在固定证据预算下实现高效多文档推理
提出NOVA规则与自举框架,通过噪声感知训练显著提升RAG系统中LLM的置信度校准性能
人类标注的多模态RAG基准,评估视觉检索、答案生成与定位能力