找到 188 条结果

用LLM智能体自动搜索能预测论文未来影响力的评分标准,再用该标准反向改写论文,人工盲评中79%更偏好修改版。

Bingchen Zhao, Jenny Zhang, Chenxi Whitehouse, Minqi Jiang, Michael... 2026-03-04
LLM智能体 人机协同 学术影响力预测 文本改写 论文评审自动化

通过四维策略梯度分析揭示ARL训练不稳定根源,提出SAMPO统一算法实现稳定训练

Xiaoxuan Wang, Han Zhang, Haixin Wang, Yidan Shi, Ruoyan Li, Kaiqiao Han,... 2026-02-26
LLM智能体 多轮交互 强化学习 策略优化 训练稳定性

提出基于信息瓶颈原则的LLM智能体长期记忆框架,通过分层记忆和三通路检索提升推理性能。

Zhenyuan Zhang, Xianzhang Jia, Zhiqin Yang, Zhenbo Song, Wei Xue, Sirui Han, Yike Guo 2026-02-13
LLM智能体 信息瓶颈 混合检索 记忆优化 长期记忆

用自监督 RL 训练 LLM 成为动作条件的世界模型,提升智能体决策能力

Xiao Yu, Baolin Peng, Ruize Xu, Yelong Shen, Pengcheng He, Suman Nath,... 2026-02-06
GRPO LLM智能体 世界模型 强化学习 自监督学习

通过层次化上下文管理、动量回溯和自适应协作进化,系统性解决LLM进化搜索的三大失效模式

Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Zhankui He,... 2026-01-16
GPU内核优化 LLM智能体 多岛屿并行搜索 符号回归 进化算法

通过多样化初始化、遗传进化和层级记忆三大机制,提升代码自进化搜索效率。

Tu Hu, Ronghao Chen, Shuo Zhang, Jianghao Yin, Mou Xiao Feng, Jingping Liu,... 2026-01-15
LLM智能体 代码生成 算法效率 自进化优化 进化搜索