找到 188 条结果

对比师生轨迹差异,把行为差距蒸馏成可验证的文本技能,增强冻结的弱学生智能体

Qiming Shi, Yibo Dou, Jiawen Zhu, Yulong Tao, Linbo Jin, Zhaolu Kang, Yunfan... 2026-08-06
LLM智能体 师生对比 技能学习 提示工程 知识蒸馏

用统一策略在行动前依据当前状态重构检索经验,GRPO 端到端训练

Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei,... 2026-07-31
GRPO LLM智能体 POMDP 强化学习 经验重构

把单轮基准升级为意图演变多轮对话,揭示前沿LLM难以跟踪变化的用户意图

Jihoon Tack, Philippe Laban, Jennifer Neville 2026-07-24
LLM智能体 多轮对话评估 对话建模 智能体基准 用户意图跟踪