← 返回 2026-07-24

大语言模型在用户意图演变中的迷失 LLMs Get Lost in Evolving User Intent

Jihoon Tack, Philippe Laban, Jennifer Neville 📅 2026-07-22 👍 23 2026-07-29 18:30
LLM智能体 多轮对话评估 对话建模 智能体基准 用户意图跟踪

把单轮基准升级为意图演变多轮对话,揭示前沿LLM难以跟踪变化的用户意图

前置知识

用户意图状态(User Intent State)

本文把用户在某一轮对话中真正想完成的事情形式化为一个结构化元组 $I_t = (f_t, C_t, C^{rev}_t, y_t)$:$f_t$ 是想调用的函数(如 search_restaurant),$C_t$ 是它的全部参数取值集合(如 {城市、菜系}),$C^{rev}_t \subseteq C_t$ 是已向智能体暴露的子集,$y_t$ 是该任务的正确答案。意图随轮次演化的本质就是这个元组在时间轴上的迁移。

全文的方法、三类转移、以及“在最后一轮锚定意图”这一关键设计,全部建立在这个形式化之上;不理解它就无法看懂第3、4节。

单轮 vs 多轮基准(Single-turn vs Multi-turn Benchmark)

单轮基准(如 GSM8K)把任务的全部信息一次性写在一条 prompt 里,答案是确定的、可用规则校验(如数值相等、SQL 执行结果、单元测试通过)。多轮基准则把任务拆到若干用户轮次中,需要智能体在交互中积累、修正信息。本文要解决的核心矛盾是:多轮轨迹组合爆炸、难以定义逐轮 ground truth,导致多数多轮基准只能依赖 LLM-as-judge。

本文的出发点正是“单轮基准已具备大规模可验证监督,但缺少意图动态;多轮基准有动态却不可验证”,这是理解其贡献的钥匙。

部分可观测马尔可夫决策过程(POMDP)

论文附录 A 把用户-智能体协作建模为 POMDP:用户持有一个潜在的意图状态 $I_t$,通过文本渲染器 $U$ 生成可观测的话语 $u_t \sim U(\cdot | \Delta I_t, h_{t-1})$,智能体 $M$ 只能从观测 $o_t=(u_t,h_{t-1})$ 推断意图。奖励 $R_t=R(a_t,y_t)$ 仅在最后一轮评估,从而保留可验证性。

POMDP 视角解释了“为什么模型会迷失”——意图对智能体是不可见的,必须从历史中估计信念状态,而这正是模型的弱项。

GRPO(Group Relative Policy Optimization)

GRPO 是一种用于大模型的强化学习算法,在一条提示的多个采样回复上用组内相对优势估计 baseline,避免单独训练 value 网络,从而降低显存与训练成本。论文附录 F.5 用它在 Qwen3-4B 上、以最终轮奖励作为 outcome reward 做了少量训练(少于 50 步)来验证框架也能产出训练数据。

这是论文“框架不仅可评估、还能反哺训练”这一延伸结论的支撑实验,理解 GRPO 能判断该实验是否可信。

研究动机

随着 LLM 从被动问答转向“替用户完成长程任务”的协作智能体(如 vibe coding、深度研究、文档迭代编辑),真实交互中用户几乎从不一次性把需求说全,而是在对话过程中逐步披露、临时修改、甚至中途转向另一项任务。然而今天主流的 LLM 评估仍停留在单轮、信息完全给定的设定——GPT-5.5 在 GSM8K 上能拿到 99.0%,BIRD-SQL 上 80.0%,看上去已经“饱和”。现有的多轮基准(MT-Bench、τ-bench、MINT 等)虽然走出了单轮,但存在三个硬伤:(i) 奖励依赖 LLM-as-judge 而非可验证答案;(ii) 用户轮次偏短程;(iii) 对用户行为可控性差,基本只能模拟“逐步披露信息”,无法刻画修订、转向等更丰富的真实动态。结果是:到底当前模型能不能忠实跟踪并执行一个不断变化的用户意图,在既有评测体系里几乎完全看不见。

本文的目标是作者的目标是构建一个可扩展、且“完全可自动验证”的多轮评测框架,用来系统性地度量 LLM 智能体在“用户意图随对话演变”时的表现。具体目标包括:能复用现有单轮基准(数学、Text-to-SQL、搜索、代码)的原始校验器,从而无需任何新的人工标注或 LLM 裁判;能对三类核心动态(信息披露、信息修订、任务转向)做组合、可控、可缩放的模拟;并能在同一来源问题上做“单轮 vs 演变”的对照,量化模型因为意图变化而损失了多少准确率。

与已有工作不同的是,本文的独特切入角度是“逆向锚定”:不从零构造多轮环境,而是把单轮基准里那条完整、可验证的源问题,原封不动地放到对话的最后一轮作为锚点 $I_T=(f^*,C^*,C^*,y^*)$,然后回溯式地合成之前若干轮“可能导向这个锚点”的函数与参数。因为最终轮与源问题完全一致,源数据集原有的校验器可以直接给最终动作打分,把“可验证监督”这个单轮基准的奢侈品免费带到多轮里。这与以往“正向生成对话、再用 LLM 判分”或“只做 under-specification 一种动态”的做法形成本质区别。

核心方法

直觉上,作者把对话生成理解成“先定终点、再编开头”的倒叙写作:终点必须是那条可验证的源问题,前面几轮则是“用户为什么会一步步走到这里”的合理前传。技术路线分三步:(1) 从单轮问题里抽取源意图 $(f^*,C^*)$ 作为锚;(2) 回溯式扩展——为修订需要合成“反事实参数”(如把目标 Brooklyn 先说成 New York),为转向需要合成共享参数的“前驱函数”(如 find_appointment_location → find_restaurant → book_restaurant),披露则只需把源参数切分到多轮;(3) 做“情境化模拟”,按预算把转移事件排程到各轮,再把每一轮的意图增量 $\Delta I_t := I_t \setminus I_{t-1}$ 渲染成自然语言用户话语。整条流水线由 GPT-5.1 驱动抽取与合成,渲染则以规则为主、可选 LLM 重述。

核心创新是“锚定最终轮 + 回溯扩展”,这是全文最关键的一点。已有工作要么正向生成对话再标注,要么把完整问题改写成模糊 prompt(只覆盖 under-specification 一个维度,且受限于源问题信息量)。本文反过来:让最终轮等于源问题,于是源校验器天然可用;让前面的转移可控、可任意加长——因为“修订”和“转向”不依赖源问题的原始信息量,可以无限堆叠,从而把短程的单轮问题拉升成长程、复杂的多轮交互。三类转移 $I_t=(f_t,C_t,C^{rev}_t,y_t)$ 形式化了“披露/修订/转向”,比单纯“固定欠定状态”的模拟器更能逼近真实用户。

方法步骤详情

完整流程分三步。(1) 意图抽取:给定单轮问题-答案对 $(q,y^*)$,用 LLM 抽取源函数与参数集 $(f^*,C^*) \sim \text{Extract}(\cdot|q)$,作为最终轮锚点 $I_T=(f^*,C^*,C^*,y^*)$。(2) 回溯扩展:对每个源参数 $c^*_i$ 生成反事实取值 $c^{cf}_i \sim \text{Counterfact}(\cdot|c^*_i;f^*)$(供后续“修订回源值”);为“转向”生成满足 $C^{pre} \cap C^* \neq \emptyset$ 的前驱函数 $(f^{pre},C^{pre}) \sim \text{Predecessor}(\cdot|f^*,C^*)$,并递归应用得到任意长度前驱链(find_appointment_location → find_restaurant → book_restaurant)。(3) 情境化模拟:调度器在总轮数 $T$ 与各类转移预算下排程事件,受一致性规则约束——最后一轮必须是源锚点且全部参数已披露、首轮须有函数与至少一个参数、同轮内不重复、转向前当前任务须完全披露、反事实/前驱须先出现再被回退;最后渲染器把意图增量 $\Delta I_t$ 拼成带领域话语前缀的用户轮(转向用 “Now let's think about this”,披露用 “Wait, I forgot to mention”),输出可被源校验器直接打分的多轮对话。

技术新颖性

新颖性体现在三处相对已有技术的本质区别:第一,对“基于 prompt 的用户模拟器”,本文用结构化意图状态 $I_t$ 与显式转移规则实现精确可控,能覆盖修订与转向,而后者大多把用户困在固定欠定状态。第二,对“把完整问题改写为模糊 prompt”的 under-specification 路线,本文保留可验证的源校验器,并通过反事实参数与前驱函数把交互扩展到任意长度,不再受源问题信息量限制。第三,对“手工设计 schema 的领域专用模拟环境(τ-bench、UserBench)”,本文是通用管线,用统一的 Extract/Counterfact/Predecessor 三件套适配数学、SQL、搜索、代码等四个互不相同的领域,无需为每个领域重新设计 schema。

Illustration of three types of intent state transitions: argument reveal, argument revision, and function switch.
Figure 2: Illustration of three types of intent state transitions: argument reveal, argument revision, and function switch.
Evolving-intent conversations from single-turn data.
Figure 3: Evolving-intent conversations from single-turn data.

实验结果

主实验(Table 1)在四领域、9 个模型上验证:每种转移各 2 次、共 6 次转移、7 轮对话下几乎全线退化。代表性的是 GPT-5.5:GSM8K 99.0%→80.5%(相对 -18.7%)、BIRD-SQL 80.0%→71.0%(-11.3%)、BrowseComp+ 65.0%→57.0%(-12.3%)、SWE-Bench Verified 86.0%→80.0%(-7.0%)。开源模型退化更猛:DeepSeek V3.2 在 BIRD 上 76.0%→53.0%(-30.3%)、BrowseComp+ 36.0%→15.0%(-58.3%);Mistral Large 3 在 BrowseComp+ 上 17.0%→5.0%(-70.6%)。SWE 域出现极端失效:GPT-5.1、Grok 4.20、Mistral Large 3 都直接归零(-100%),原因是它们耗尽每轮 100 次工具调用预算后超时,且其中只有不到 4 次是执行类(pytest/python/apply_edits),其余全是探索类(sed/grep/find/ls),说明累积的工具轨迹本身成了干扰项。消融(Table 2、Figure 4)显示单独放大任一转移都单调拉低准确率,而函数转向曲线最陡(需丢弃而非吸收信息);组合越多样越差,GPT-5.1 在 SWE 上只要引入 function switch 即归零。Figure 5 揭示转向后若再插入披露/修订性能会进一步下滑,说明模型无法把转向前后的上下文联合整合。记忆机制(Figure 6)中 oracle recap 把 function switch 从 65% 提到 75%,但仍低于单轮 80%,证明瓶颈在意图跟踪本身;意图跟踪分解(Table 3)中披露/修订近满分(98-99%),但函数转向从 1 次的 89.0% 掉到 2 次的 82.0%。难度放大效应(Figure 7)显示源问题变难时多轮退化更狠(GPT-5.5 在 BIRD 上易→难单轮 -3.6%、多轮 -9.0%);推理模式(Table 4)几乎无用;更小模型退化更重(Figure 10)。Table 5 证明退化来自意图转移本身而非轮数。最后用框架造数据做 GRPO 训练(Table 6)把 Qwen3-4B 演变意图准确率从 64.0% 提到 76.0% 且不损单轮性能。

LLMs get lost in evolving user intent. Accuracy (%) across four datasets.
Table 1: LLMs get lost in evolving user intent. Accuracy (%) across four datasets.
Models struggle more under increasingly complex evolving-intent compositions.
Table 2: Models struggle more under increasingly complex evolving-intent compositions.
Turn-wise intent-tracking performance.
Table 3: Turn-wise intent-tracking performance.
RL with evolving intent.
Table 6: RL with evolving intent.
Scaling intent transitions monotonically degrades accuracy.
Figure 4: Scaling intent transitions monotonically degrades accuracy.
LLMs gradually shift away from earlier context after function switches.
Figure 5: LLMs gradually shift away from earlier context after function switches.
Multi-turn interaction compounds problem difficulty.
Figure 7: Multi-turn interaction compounds problem difficulty.
查看结构化数据
任务指标本文基线提升
GSM8K(数学,演变意图 6 次转移) 准确率 (%) GPT-5.5: 80.5 GPT-5.5 单轮: 99.0 相对 -18.7%(最弱模型 Mistral Large 3: 73.5,相对 -23.0%)
BIRD-SQL(Text-to-SQL,演变意图) 准确率 (%) GPT-5.5: 71.0 GPT-5.5 单轮: 80.0 相对 -11.3%(DeepSeek V3.2: 53.0,相对 -30.3%)
BrowseComp+(智能体搜索) 准确率 (%) GPT-5.5: 57.0 GPT-5.5 单轮: 65.0 相对 -12.3%(Mistral Large 3: 5.0,相对 -70.6%)
SWE-Bench Verified(软件工程) 准确率 (%) GPT-5.5: 80.0 GPT-5.5 单轮: 86.0 相对 -7.0%(GPT-5.1/Grok/Mistral 直接归零 -100%)
GRPO 训练(Qwen3-4B,演变意图 GSM8K) 准确率 (%) 76.0(训练后) 64.0(训练前) +12.0 个百分点,且单轮性能 94.0→95.0 不降

局限与改进

作者坦承:框架只刻画意图演化,不建模 persona、口吻、笔误、语法错误等更细的用户行为差异,渲染出的话语风格偏单一(每个领域只配固定的话语前缀);并假设每轮只含一次意图转移,而真实用户可能“一边修订一边转向”或在同一轮里提多个相关问题。可验证性也是刻意取舍:校验器只在最终轮精确,中间轨迹只是被调度转移间接约束、其效果只能反映在最终结果上。我额外观察到两点局限:一是合成质量完全依赖 GPT-5.1 的抽取与反事实生成,若某领域(尤其 SWE)的源问题难以干净地分解成“函数+参数”,整套锚定机制会松动;二是评测仅 7 轮、每种转移仅 2 次,量级偏小,统计噪声(尤其 SWE 只 50 样本、部分模型归零)需要谨慎解读。

独立分析的弱点

第一个弱点是“锚定假设”与真实用户错配:真实对话常以中途转向告终、并不收敛回某个预定义可验证问题,本文为保证可验证性而强行让终点等于源问题,可能高估模型在最坏情况(终点不可预测)下的鲁棒性——改进方向是设计逐轮可验证器或弱监督中间奖励,既保留规模化又允许更自由终点。第二个弱点是渲染自然度不足:固定话语前缀(“Now let's think about this”等)易被模型识别为模式信号、相当于把转移“泄漏”给被测模型,可能低估真实退化;可引入 persona-conditioned、带犹豫/打断/纠错的渲染器逼近真实分布。第三个弱点是 SWE 域失效归因偏浅:把 0.0% 归于预算耗尽,但“为何陷在 grep/find 里”可能与单轮 SWE 智能体本身的探索-执行失衡有关,需在等长单轮轨迹上做对照以区分“意图演变”与“工具策略”两个因素。第四个弱点是样本量偏小(SWE 仅 50、部分模型归零),建议扩样并报告置信区间;第五是缺与 τ-bench、UserBench 的正向同模型对照,难以判断本框架独有的退化占比。

未来方向

作者明确点出的方向包括:把管线做成 persona-conditioned,使反事实参数、前驱函数与渲染话语反映多元用户背景;放宽“每轮一次转移”假设,支持单轮多意图、多可验证目标,并设计能兼顾规模化的逐轮/中间校验器;把框架从评测扩展为训练数据生成器(Table 6 已有初步验证)。基于成果可延伸的方向:第一,把“意图跟踪”显式化为一个可被监督的子任务(如在每轮要求模型输出结构化意图信念 $\hat{I}_t$ 并用 Table 3 式判分),再用 RL 优化它,可能比纯 outcome reward 更高效。第二,研究“主动澄清”能力——让智能体在检测到转向或矛盾时主动发问,而非被动累积上下文。第三,扩展到多模态/工具密集场景,验证三类转移范式是否仍成立。第四,与本团队前期“LLMs Get Lost in Multi-turn Conversation”结合,分离“轮次记忆衰减”与“意图演变”两类失效。

复现评估

复现评估整体良好。作者公开了代码仓库 microsoft/evolving-intent,方法以通用管线形式覆盖四个领域,数据来自公开单轮基准(GSM8K 200 样本、BIRD-SQL 100、BrowseComp+ 100、SWE-Bench Verified 50)。但合成阶段依赖 GPT-5.1 做抽取/反事实/前驱生成,复现需要付费 API 调用且会受模型版本漂移影响;被测模型多为闭源前沿模型(GPT-5.x、Gemini 3.1 Pro、Grok 4.20),本地只能完整复现开源三件(Kimi K2.5/K2.6 为 1T 参数 MoE、32B 激活;Mistral Large 3 为 675B MoE、39B 激活),算力门槛高。主实验规模小(7 轮、每类转移 2 次),单卡可跑评测部分,但 SWE 域每轮 100 次工具调用、BrowseComp+ 每轮 50 次搜索,单条对话成本与时间不低。训练实验(GRPO on Qwen3-4B,<50 步)相对易复现。整体难度中等:评测管线开源可复现,但高质量合成与前沿模型评测需要 API 预算与耐心。