首个用强化学习训练多跳搜索智能体,为知识密集型图像生成收集外部知识与视觉参考
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
8个规模的多语言嵌入模型,覆盖200+语言,14B版SOTA
通过多类型记忆结构和多智能体协作,实现长对话中自适应检索与用户理解
通过意图感知路由和多智能体工具架构,实现可靠的伊斯兰知识问答系统
用信息几何、层论和随机动力学为AI智能体记忆建立数学基础
通过上下文化和去重模块改进Search-R1,EM提升5.6%,检索轮次减少10.5%
基于真实世界的城市场景世界模拟模型:首尔世界模型
👍 155首尔世界模型:用街景图像检索增强,实现真实城市级别的世界模拟视频生成
提出MADQA基准评估多模态Agent在复杂文档集合上的推理能力,发现Agent主要依赖暴力搜索而非真正的战略规划
首次将检索增强生成引入单细胞扰动预测,细胞类型感知的可微检索显著提升跨细胞类型泛化能力
评估智能体在700篇非结构化知识中检索推理执行客服任务的能力
首个法律领域端到端RAG基准,证明检索质量比LLM更关键
利用开源预训练数据构建基准,量化LLM参数知识与外部知识的交互机制
面向查询聚焦与记忆感知的长上下文重排序器
👍 58利用LLM注意力头中隐含的检索能力,训练小型模型实现高效列表式重排序。
提出基于GSW的非参数持续学习框架,通过写入时结构化构建实现读取时高效多跳推理
提出检测RAG软压缩中token何时丢失任务相关信息(溢出)的方法,实现预LLM推理的高效检测
提出HybridRAG-Bench框架,分离RAG推理与参数记忆。
提出DeR²基准,通过四种评估设置解耦检索与推理,揭示LLM推理缺陷
层级检索接口赋能LLM自主决策,实现Agentic RAG范式突破
提出科学文献问答环境,用RLVR训练搜索代理在1600万篇PubMed摘要上回答事实型问题
Actor-Refiner协作框架解决搜索推理中的多尺度信用分配问题