找到 999 条结果

将智能体交互历史渲染为压缩图像,用视觉 token 替代文本 token,节省 50%+ 消耗

Lang Feng, Fuchao Yang, Feng Chen, Xin Cheng, Haiyang Xu, Zhenglin Wan, Ming... 2026-01-12
Token 压缩 多模态智能体 强化学习 智能体记忆 视觉语言模型

通过熵驱动潜在分支和信息瓶颈正则化,解决大语言模型推理中的探索崩溃问题

Huilin Deng, Hongchen Luo, Yue Zhu, Long Li, Zhuoyue Chen, Xinghao Zhao,... 2026-01-12
信息瓶颈 大语言模型 强化学习 探索利用平衡 推理优化

让小模型主动调用大模型,用1.07%的token成本恢复60%性能差距

Chengsong Huang, Tong Zheng, Langlin Huang, Jinyuan Li, Haolin Liu, Jiaxin Huang 2026-01-09
GRPO token-level路由 强化学习 模型协作 高效推理

提出多会话协作基准与记忆框架,使对话代理跨会话学习用户偏好并持续提升协作质量。

Shuhaib Mehri, Priyanka Kargupta, Tal August, Dilek Hakkani-Tür 2026-01-09
人机协作 对话系统 强化学习 用户建模 长期记忆

提出PSN框架,让智能体通过可执行符号程序持续获取、精炼和重用技能

Haochen Shi, Xingdi Yuan, Bang Liu 2026-01-08
LLM智能体 具身智能 强化学习 持续学习 程序合成