找到 163 条结果

把自我改进智能体形式化为参数更新与脚手架更新两条路径,统一梳理历史、分类、应用与评估。

Zhe Ren, Yimeng Chen, Dandan Guo, Guowei Rong, Tonghui Li, R. B. Xiong,... 2026-07-16
基础模型 工具使用 强化学习 提示优化 智能体

通过利用LLM评分token的完整分布实现细粒度反馈的通用验证框架,在多个领域达到SOTA性能

Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea... 2026-07-07
奖励建模 强化学习 智能体 测试时缩放 验证

通过上下文空间和参数空间双重蒸馏,将大模型的过程式记忆能力迁移到小模型,实现边缘设备部署

Peyman Hosseini, Ondrej Bohdal, Ahmed Alajrami, Andrea Maracani, Ignacio... 2026-07-03
LoRA 智能体 知识蒸馏 边缘计算 过程式记忆

提出智能体数据裁剪框架,将高熵原始多模态流转换为意图对齐的结构化训练数据

Cong Wan, Zeyu Guo, Zijian Cai, Jiangyang Li, SongLin Dong, Lin Peng,... 2026-06-23
多模态学习 强化学习 数据合成 数据工程 智能体

提出智能体应辅助而非替代因果发现,开发causal-learn+平台保持算法核心完整性

Yujia Zheng, Vishal Verma, Mantej Gill, Haoyue Dai, Peter Spirtes, Kun Zhang 2026-06-23
可信AI 可解释性 因果发现 大型语言模型 智能体