通过控制干预审计揭示RAG重写增益主要来自答案字符串暴露而非证据质量改进
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出批评者模型闭环优化检索,提升多跳问答精度
OCC-RAG:面向忠实问答的最优认知核心
👍 101用大规模合成数据训练专精小模型,攻克忠实上下文问答
上下文管理效果取决于检索器-模型能力匹配度,呈现倒U型非单调模式
通过检索历史生成内容解决AR长视频生成的错误累积问题
用抽取式VerbatimRAG给ACL论文做无幻觉问答,150M小模型登顶。
GrepSeek:训练直接语料库交互的搜索代理
👍 117通过shell命令让LLM直接检索原始文本,bypass传统检索索引实现高效多跳推理
首个将数据无关的自我对弈扩展到开放式任务的框架,通过文档锚定的标准分解实现自我评估和持续自我改进
通过动态建模搜索边界来减少代理式搜索中的过度搜索,同时保持推理准确性
提出STREAM框架从流媒体挖掘交互信号,构建StreamDial多域任务导向对话数据集
多智能体辩论+3D首帧接地,从一句话生成完整可播短剧。
检索增强的智能体框架,通过带元数据的策略库实现多目标Lean证明优化。
用检索增强的开卷重写器在微调前主动净化训练数据,防御 LLM 后门与投毒攻击。
统一检索与编译器反馈为可训练策略,构建OProofs语料,在五项Lean4基准上取得SOTA
把检索基础设施作为可演化的动作空间,LLM 诊断模块自主闭环改进。
用书签式问答对在长剧情中按需检索与增量同步,让角色扮演智能体既保留细节又省算力
用强化学习联合优化记忆图边表示与路由策略的查询条件遍历框架。
用编码器-解码器交叉注意力替代外部检索器,统一检索与生成
用层次化记忆树+对比投影器为大模型Agent精准划出安全/恶意决策边界,零训练、低延迟。
在单次自回归轨迹内同时生成候选并排序,用分解式GRPO解决端到端信用分配难题。