找到 115 条结果

用大规模合成数据训练专精小模型,攻克忠实上下文问答

Maksim Savkin, Mikhail Goncharov, Alexander Gambashidze, Alla Chepurova,... 2026-06-03
中训练 合成数据 多跳推理 小语言模型 忠实问答

通过shell命令让LLM直接检索原始文本,bypass传统检索索引实现高效多跳推理

Alireza Salemi, Chang Zeng, Atharva Nijasure, Jui-Hui Chung, Razieh Rahimi,... 2026-06-01
代理式搜索 多跳推理 强化学习 检索增强生成 直接语料库交互

首个将数据无关的自我对弈扩展到开放式任务的框架,通过文档锚定的标准分解实现自我评估和持续自我改进

Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang, Pasquale Minervini 2026-06-01
大语言模型 开放式任务 强化学习 检索增强生成 自我对弈

用书签式问答对在长剧情中按需检索与增量同步,让角色扮演智能体既保留细节又省算力

Letian Peng, Ziche Liu, Yiming Huang, Longfei Yun, Kun Zhou, Yupeng Hou, Jingbo Shang 2026-05-15
LLM Agent 剧情理解 检索增强生成 角色扮演智能体 长上下文记忆