找到 448 条结果

ESPO通过提前终止失败轨迹节省20%+token并提升LLM推理性能

Zihang Li, Rui Zhou, Yingcheng Shi, Wenhan Yu, Zhewen Tan, Zixiang Liu,... 2026-06-02
大语言模型 强化学习 数学推理 策略优化 训练效率

首个将数据无关的自我对弈扩展到开放式任务的框架,通过文档锚定的标准分解实现自我评估和持续自我改进

Wai-Chung Kwan, Aryo Pradipta Gema, Joshua Ong Jun Leang, Pasquale Minervini 2026-06-01
大语言模型 开放式任务 强化学习 检索增强生成 自我对弈

首个能同时有效遗忘和保留因果知识的三阶段 LoRA 遗忘框架

Suryash Yagnik, Shubham Gaur, Saksham Thakur, Vinija Jain, Aman Chadha, Amitava Das 2026-06-01
LoRA 适配器 因果推理 大语言模型 机器遗忘 知识编辑

揭示了LoRA参数化记忆遵循幂律容量定律,p>0.5为确定性回忆阈值,提出MemFT优化方法提升记忆效率

Ziwen Xu, Haiwen Hong, Linsong Yu, Benglei Cui, Longtao Huang, Hui Xue, Ningyu Zhang 2026-05-29
LoRA微调 参数化记忆 大语言模型 相变分析 记忆容量

提出双向进化搜索框架,通过进化算子和目标分解突破现有搜索方法的限制,在自改进和推理中显著提升性能。

Guowei Xu, Zhenting Qi, Huangyuan Su, Weirui Ye, Himabindu Lakkaraju, Sham... 2026-05-28
双向搜索 大语言模型 搜索算法 自改进 进化计算

用信息瓶颈理论量化探索-利用平衡,通过IBTree提升在线强化学习效率和稳定性。

Hao Jiang, Shurui Li, Tianpeng Bu, Bowen Xu, Xin Liu, Qihua Chen, Hongtao... 2026-05-28
信息瓶颈 在线强化学习 大语言模型 数学推理 树搜索

限制蒸馏 rollout 到前 N 个 token,解决 OPD 的离策略教师衰减问题

Zhou Ziheng, Jiaqi Li, Huacong Tang, Ying Nian Wu, Demetri Terzopoulos 2026-05-28
在线策略蒸馏 大语言模型 模型压缩 知识蒸馏