← 返回 2026-09-08

对话生成产物中的修订传播:高性价比测试时计算探索 What Else Needs Fixing? Exploring Cost-Effective Test-Time Compute for Revision Propagation in Artifacts Generated Through Conversation

Daisuke Kikuta 📅 2026-09-03 👍 5 2026-09-12 18:30
LLM基准评测 修订传播 成本效益分析 测试时计算 结构化输出编辑

提出RevPropBench评测LLM修订传播能力,并行采样加选择是性价比最高的测试时计算方法

前置知识

JSON Patch(RFC 6902)

对 JSON 文档做增量修改的 IETF 标准:补丁是有序操作数组,每个操作为 $(op, path, value)$ 三元组,操作类型为 add/replace/remove,$path$ 是 RFC 6901 JSON Pointer,按顺序依次应用到当前文档。本文中 LLM 的修订输出和 gold patch 都是这种 JSON patch。

本文把修订传播形式化为"输出与 gold patch 语义一致的 JSON patch",评测方式是比较补丁分别应用后的两个产物是否完全一致,不理解该格式就无法看懂任务定义、提示词与指标。

修订传播(revision propagation)

指对产物施加一个局部修改后,识别并更新所有受其影响的依赖部分以恢复全局一致性。例如从旅行行程中删掉目的地 B 后,日程时长要缩短,按人数与人均额计算的预算也要联动下调。该问题在代码(调用图)、知识编辑(知识图谱)、文档编辑(章节引用)中已有研究,本文首次研究依赖关系藏在对话历史中的场景。

这是全文的核心问题:基准构建、九种修订方法设计与失败分析都围绕"该改的没改(漏改)与不该改的改了(多改)"展开。

测试时计算与自洽性

指不改动模型参数、仅在推理阶段投入更多计算以提升输出质量,包括并行采样多个候选再挑选(best-of-N 用验证器打分、self-consistency 多数投票)和串行迭代改进(Self-Refine、Reflexion 式反思)。本文把这两族方法系统地搬到修订传播任务上并比较其成本效益。

论文的第二大主题就是"哪种测试时计算对修订传播最具性价比",REFLECT/OR/AND/MAJ/MED/SELECT 六种方法全部是该范式的变体。

最小贝叶斯风险解码与 medoid

MBR 解码从候选中选与其他候选平均相似度最高的输出,不依赖外部评分器。本文的 MED 方法将其改造:先把每个候选补丁应用成产物,再在叶子级键值对上度量两两分歧 $D(c_i)=\frac{1}{k-1}\sum_{j \neq i} d(c_i, c_j)$,选出平均分歧最小的最典型候选。

MED 是性价比第二的推荐方法,理解它为什么在"产物"而非"补丁字符串"层面比较分歧,是读懂其优于 OR/AND/MAJ 逐元素合并的关键。

完成率与失败分解指标

完成率(completion rate)是主指标:模型生成的补丁应用到原产物后与 gold 产物完全一致(路径和值均匹配)的样本占比。失败进一步分解为三类:miss(漏掉必要的级联修改)、over edit(做了不必要的修改)、wrong value(必要修改的值计算错误)。

所有实验结论都以这些指标表述;"错误以 miss 为主、模型倾向传播不足"这一失败画像是解释 MED/SELECT 为何有效的核心证据。

研究动机

在实际使用中,用户常通过多轮对话让 LLM 逐步生成结构化产物:旅行行程、发票、购物车、项目排期、部署配置等,多以 JSON 形式落地。当用户提出局部修改请求时,例如"把目的地 B 从行程中去掉",往往不会一一指出所有受影响的部分——日程需要整体提前,三人预算要从 $\$200 \times 3$ 改为 $\$180 \times 3$。这些依赖并未写进产物本身,而是在对话过程中隐式建立(比如用户说过"预算按人均 200 美元")。已有关于修订传播的研究集中在依赖显式或可静态分析的场景:仓库级代码编辑靠调用图与 import 关系(SWE-bench、CodePlan 等),知识编辑靠知识图谱(RippleEdits、ChainEdit),文档编辑靠章节、引用与论断结构(EditPropBench、LEDGER)。对话式生成产物的依赖既没有预先存在的图结构,也无法从最终产物静态推导,该设定此前无人系统研究;已有的 JSON 编辑工作(如 JSON Whisperer)只考察能否改对被点名的元素,完全不考察级联一致性。

本文的目标是本文要做两件事。其一是度量:构建一个人工标注的基准 RevPropBench,系统评测 LLM 能否在对话生成的 JSON 产物上,根据一条局部修订请求输出完全正确的 JSON patch(RFC 6902),既不漏改也不多改;基准覆盖 9 个实用领域、6 种传播模式、10/50/100 三种产物规模,共 150 个样本(30 开发 + 120 测试)。其二是改进:以该基准为试验台,系统比较 9 种修订方法——3 种单次推理基线(只给最终产物 J、只给对话历史 H、两者都给 J+H)、串行反思 REFLECT、以及并行采样的 5 种变体(规则合并 OR/AND/MAJ、medoid 选择 MED、LLM 选择 SELECT)——在 6 个 LLM(gpt-oss-20b/120b、gpt-5.4-mini、qwen3.5-9b/27b/122b)上从准确率、API 成本、延迟三个维度评估,给出"花多少测试时计算最划算"的实用建议。

与已有工作不同的是,本文的独特切入有三点。第一,问题设定新:依赖关系在多轮对话中隐式建立,事先不存在依赖图谱或文档结构可查,因此 RepoGraph、LEDGER 这类显式依赖引导的方法在此失效,模型必须自己"读懂"对话来恢复依赖。第二,评测设计巧:场景被约束为传播结果唯一确定(每个受影响字段的正确新值唯一),使修订正确性可用补丁比对自动判定,无需 LLM-as-judge,规避了评判偏置;gold patch 由强模型起草、人类用 GUI 工具逐条审核修正。第三,分析视角实用:不止报告准确率,而是把测试时计算方法放进成本-性能-延迟三维空间,量化出"采样几次、用哪种选择器"最划算这一可操作结论——例如明确推荐 SELECT 用 4 次调用、延迟敏感时用 MED 用 3 次调用——这对工程落地比单纯刷分更有价值。

核心方法

直觉上,修订传播可以被严格判分:把模型输出的补丁和 gold patch 分别应用到同一产物上,比较两个最终 JSON 是否完全一致即可。论文先形式化两阶段任务:生成阶段,LLM 在多轮对话中每轮以 add 型 JSON patch 增量添加元素,直到产物达到目标规模(10/50/100 个叶子元素);修订阶段,用户给出只针对单个叶子元素的局部修改请求,模型输出完整 JSON patch。技术路线分三步:先用 LLM 辅助头脑风暴产出 50 个场景,规定领域、对话模式与传播模式并保证传播结果唯一确定;再用 GPT-5.5 逐轮合成对话并生成修订请求,用 Claude Opus 4.8 起草 tentative gold patch,由人类标注者用 GUI 工具审核修正(支持 direct/cascade 分类、四种值匹配方式和 optional 标记)。评测时把 J、H、J+H 三种上下文与 6 种测试时计算方法组合成 9 种方法,在 6 个模型 × 5 个种子上运行,报告完成率与失败分解,并折算 API 成本与延迟。

核心思想是:对话历史本身就是依赖的载体。作者通过受控的上下文消融验证这一点——J(仅最终产物)、H(仅对话历史)、J+H(两者都给)三种基线在所有模型上一致呈 J < H < J+H(如 gpt-5.4-mini 为 90.7% < 92.7% < 93.0%),说明依赖信息主要藏在产物之外的对话里,无法从最终 JSON 恢复,而显式重给产物又能减少路径错误与漏改。第二个关键创新是 MED:由于同一处修改可以写成多种不同的 JSON patch,直接比较补丁字符串没有意义,MED 先把每个候选补丁应用成产物,再在叶子级键值对上度量候选间分歧 $D(c_i)=\frac{1}{k-1}\sum_{j \neq i} d(c_i, c_j)$,选出最接近"共识"的候选,这是最小贝叶斯风险解码思想在结构化产物修订上的移植。第三是引入 SELECT:先并行采样多个补丁,再用同一个 LLM 对照产物与请求逐一审查候选并选出最佳者,把"生成"与"判断"解耦。

方法步骤详情

流程分五步。第一步场景设计:遵循三条准则(领域多样、传播模式多样、gold patch 唯一确定),产出覆盖 9 领域、6 种模式的 50 个场景,如算术重算(改单价则行金额与小计依次重算)、实体替换、增删、阈值门控、时间平移、状态翻转。第二步数据采样:GPT-5.5 逐轮生成"用户指令 + 助手 add 补丁"的对话,每轮限制新增叶子数,直到达到 10/50/100 的目标规模,最后生成只针对单个叶子的修订请求。第三步人工标注:Claude Code 分批起草 gold patch,标注者在 GUI 中逐条审核,把操作标为 direct(请求点名)或 cascade(依赖引发),共投入 32 小时以上、修订了 15% 的样本。第四步划分与协议:按场景分层划分 30 开发/120 测试样本,温度 0.6,每方法每样本跑 5 个种子($s=0,42,84,126,168$),REFLECT 固定 4 轮反思共 5 次调用。第五步评测:比较生成补丁与 gold patch 应用后的产物得完成率,分解 miss/over edit/wrong value,并折算成本与延迟。

技术新颖性

技术新颖性体现在四方面。其一,新问题设定:首次把修订传播放到"依赖隐式存在于对话中"的场景,与代码、知识、文档三类已有设定形成清晰对照,并用 J/H/J+H 上下文消融有效刻画了这一特性。其二,基准工程:开源的不只是数据集,还有从场景模板、逐轮采样提示词到 GUI 标注工具的完整流水线,标注者可以标记 cascade 操作和 optional 字段,使基准可持续扩充难度——这是应对模型进步、基准饱和的前瞻设计。其三,方法适配:将 MBR 解码改造成产物级 medoid 选择(MED),并引入 LLM 选择器(SELECT),两者都避免了在补丁字符串层面做无意义比对或逐元素投票;与 OR/AND/MAJ 的对照实验清楚显示"选一个完整候选"优于"逐元素合并"。其四,评测方法论:在准确率之外引入按 token 价格折算的成本和实测延迟,用增益除以相对成本增幅(如 $\frac{\text{gain}}{\text{cost}/\text{cost}_{J+H}-1}$)之类的性价比指标扫描整条调用次数曲线,找出收敛点与最优工作点,而非只报告单一配置。

Overview of RevPropBench.
Figure 2: Overview of RevPropBench.
Statistics of RevPropBench (n=150 samples over 9 domains and 50 scenarios).
Figure 3: Statistics of RevPropBench (n=150 samples over 9 domains and 50 scenarios).
An example scenario and its corresponding generated sample.
Figure 7: An example scenario and its corresponding generated sample.
Graphical user interface of the annotation tool.
Figure 8: Graphical user interface of the annotation tool.

实验结果

核心发现分四层。第一,基线能力:最强基线 J+H 的完成率为 68.3%(qwen3.5-9b)至 93.0%(gpt-5.4-mini),模型规模单调受益;所有模型一致呈 J < H < J+H(gpt-5.4-mini 为 90.7%/92.7%/93.0%,qwen3.5-122b 为 81.7%/86.7%/90.3%),证明依赖信息藏在对话历史而非产物中。第二,方法对比:SELECT 最稳定,相对 J+H 提升 +3.3–12.5%,在 4/6 模型上第一、2 个第二;MED 次之(+1.8–7.7%);REFLECT 增益小(+0.5–8.2%);AND 因要求全票一致比 J+H 低 13.2–21.3 个百分点(qwen3.5-9b 仅 47.0%),OR 过度编辑多,MAJ 居中。第三,失败模式:错误以 miss(漏改)为主,模型倾向传播不足;MED 抑制离群过度编辑,SELECT 减少漏改最有效。第四,成本与延迟:性能在 4–5 次调用饱和;性价比最高是 SELECT 3–4 次或 MED 3 次调用;SELECT 在 Qwen 上成本达 J+H 的 5.7–7.5 倍;实用建议为默认 SELECT 4 次调用,延迟敏感用 MED 3 次。

Average latency per sample of J+H and relative latency multipliers of REFLECT, MED, and SELECT with respect to J+H.
Table 1: Average latency per sample of J+H and relative latency multipliers of REFLECT, MED, and SELECT with respect to J+H.
Per-token prices used for the cost analysis (as of June 12, 2026).
Table 2: Per-token prices used for the cost analysis (as of June 12, 2026).
The six propagation patterns covered by RevPropBench's 50 scenarios, with a representative scenario for each.
Table 3: The six propagation patterns covered by RevPropBench's 50 scenarios, with a representative scenario for each.
Completion rate of the nine revision methods on the 120-sample test split, for each of the six models.
Figure 4: Completion rate of the nine revision methods on the 120-sample test split, for each of the six models.
Element-level failure composition by method, pooled over the six models (i.e., 3600 samples).
Figure 5: Element-level failure composition by method, pooled over the six models (i.e., 3600 samples).
Completion rate versus API cost as the number of LLM calls increases.
Figure 6: Completion rate versus API cost as the number of LLM calls increases.
查看结构化数据
任务指标本文基线提升
修订传播完成率(120 测试样本,最强模型 gpt-5.4-mini) 完成率(%) SELECT 96.3 J+H 单次推理 93.0 +3.3(SELECT 跨全部模型的提升范围为 +3.3–12.5)
修订传播完成率(最弱模型 qwen3.5-9b) 完成率(%) SELECT 80.8 J+H 68.3 +12.5(全部模型中的最大增益)
并行规则合并 vs 单次推理(6 模型范围) 相对 J+H 的完成率变化(百分点) AND 低于 J+H 13.2–21.3;OR/MAJ 为 −0.8–+4.8 J+H 负或接近零:逐元素规则合并在该任务上不可靠
串行反思 vs 单次推理(6 模型范围) 相对 J+H 的完成率变化(百分点) REFLECT +0.5–8.2,但很少追平 MED/SELECT J+H +0.5–8.2
延迟效率(6 模型,每样本实测) 相对 J+H 的延迟倍数 MED(k=3)约 1.1–1.3×;SELECT 约 2–6.2×;REFLECT 2.0–6.0× J+H(1×,绝对值 7.3–58.5 秒) MED 是延迟最优选择,支撑"延迟敏感用 MED k=3"的建议

局限与改进

作者明确承认的限制包括:问题设定不覆盖已有显式依赖结构的代码/知识/文档编辑场景;对话为合成数据、依赖被控制为确定唯一,不含真实对话中"该不该改见仁见智"的歧义情形;150 个样本覆盖 9 领域 6 模式但未穷尽所有传播模式;对话由 GPT-5.5 生成,可能让 GPT 系模型占优(作者以人机协作设计场景、用元级指令构建对话来缓解);gpt-5.4-mini 已达 93%,存在性能饱和、基准失效的风险,故连工具链一起开源以便持续扩充。我的补充观察:第一,gold patch 由单一标注者完成并复核,虽有 32 小时投入,仍可能带个人偏差,且 15% 的样本修订率提示自动起草的噪声不小;第二,修订请求严格限定为单个叶子元素的一次编辑,现实中的复合指令、多轮连续修改、模糊指令均未覆盖;第三,完成率是全有全无指标,10 处改对 9 处与全错得分相同,元素级指标只出现在失败分析中;第四,产物是至多 100 个叶子的 JSON,真实企业配置可能上千节点、深嵌套,方法可扩展性未知;第五,本地模型的 API 成本按 OpenRouter 价格折算,只是估算而非真实部署开销。

独立分析的弱点

独立分析可见以下弱点。其一,任务面窄:一次只改一个叶子、传播链由场景模板保证唯一,模型实际上在做约束满足而非真实的用户意图理解;改进方向是引入复合编辑、可选编辑与用户偏好建模,测量歧义指令下的表现。其二,评测指标粗:完成率不区分"几乎正确"与"完全错误",可能误导方法比较——MED 减少的过度编辑和 SELECT 减少的漏改在该指标下权重相同;建议将元素级 precision/recall/F1 提升为主报告指标。其三,测试时计算只覆盖采样与选择族,未尝试从对话中显式抽取依赖图再做图引导修订——而 related work 中代码/文档场景恰恰证明这类方法有效,缺少这条路线的对照使"测试时计算最好"的结论不够完整。其四,SELECT 的选择器与生成器同源,存在自评偏差,9B 级小模型上选择器能力尤其可疑;改进方向是跨模型家族选择器或训练专用轻量验证器。其五,缺少与微调的对比:面对仅六类稳定传播模式,小模型针对性微调可能比多次采样更便宜且更快。其六,附录 E 提出的人审保护(先展示全部传播修改再应用)只是概念性建议,未做任何用户实验验证其实际减负效果。

未来方向

作者提出的后续方向:利用开源的场景-采样-标注工具链持续扩充并加难基准,避免 gpt-5.4-mini 级模型导致的性能饱和;把"LLM 先展示所有传播修改、经用户批准再应用"的安全机制实验化,并探索用 LLM-as-a-judge 按关键性排序、或让用户预先指定关键字段,以降低人审成本(作者注明这些仍是未经实验验证的概念设想)。基于本文成果还可延伸:从对话历史自动构建显式依赖图作为中间表示,把 RepoGraph/LEDGER 的图引导思想迁移到无预置依赖结构的场景,填补上文指出的方法空白;在六类传播模式上做针对性微调或蒸馏,训练轻量验证器替代昂贵的多次采样;扩展到多编辑、多轮连续修订以及代码加文档等跨产物的一致性维护;研究歧义修订下的主动澄清策略,把"该不该问用户"纳入决策优化;以及在真实人机会话日志上检验合成基准结论的外推有效性。

复现评估

复现条件较好。代码、150 个样本的基准实例及从采样到标注的完整工具链都在 https://github.com/ntt-dkiku/llm-revision-propagation 开源,附录 F 公开了数据生成与评测的全部提示词,协议细节完备:温度 0.6、每样本 5 个种子(0,42,84,126,168)、LiteLLM 缓存保证同种子同输入输出一致、REFLECT 固定 4 轮反思共 5 次调用、SELECT 采样 4 候选加 1 次选择。评测算力要求低:gpt-5.4-mini 走 API,本地模型用 vLLM 部署,单张 A100 80GB 可跑 gpt-oss-20b/120b 与 qwen3.5-9b/27b,仅 qwen3.5-122b 需 4 卡。难点有三:一是依赖 GPT-5.5、Claude Opus 4.8、gpt-5.4-mini、qwen3.5 等特定版本模型,完整对齐受模型可用性影响;二是 gold patch 依赖单标注者判断,边界样本难以完全复刻;三是人工标注耗时 32 小时以上,扩充数据集需持续标注投入。总体属于协议透明、中低难度的可复现工作。