← 返回 2026-08-13

LLM 智能体能守住剧本吗?交互式叙事长程一致性基准 NCP-Bench Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

Yingpeng Ma, Jianhao Yan, Bei Shi, Ka Hou Kam, Runnan Wang, Xuebo Liu, Yulong Chen, Yue Zhang, Derek F. Wong 📅 2026-08-08 👍 28 2026-08-18 18:30
LLM-as-a-Judge LLM智能体 交互式叙事 基准评测 对抗性测试 长程一致性

NCP-Bench 揭示:最强 LLM 叙事代理 20 轮后存活率仅 42%,长程承诺保持未解决

前置知识

叙事承诺保持(NCP)

指交互式叙事中,叙事代理在多轮自由文本交互中必须持续遵守的逻辑承诺:已确立的世界事实不能被悄悄改写,剧情先后顺序约束不能被跳过,必须达成的目标不能被搁置。论文将其形式化为:代理维护显式事实账本 $F_t$ 与承诺集合 $C$,每轮由固定审计程序抽取状态更新并验证一致性与可满足性。

这是全文的中心任务定义,基准的数据格式、冲突指标、存活率与成功判定全部围绕“承诺是否被保持”展开,不理解它就无法理解论文在测什么。

事实账本(Fact Ledger)

一种显式世界状态表示:把故事中已确立的持久事实写成带稳定 ID 的原子命题列表(如 “f7: 玩家尚不知道反派身份”),随剧情推进增量添加新事实、把过时事实标记为 negated(否定)。被否定的旧事实保留在历史中以供追溯,但不再进入活跃状态参与后续判定与审计。

NCP-Bench 的冲突检测就是拿叙述者回复与活跃账本逐条比对,“事实冲突率”这一主导指标的语义完全建立在账本机制之上。

参考轨迹与轨迹节点

有序剧情步骤序列 $R$,每个节点包含:发生了什么(description)、触发该步骤的外部可见事件(trigger)、完成后不可逆的关键状态变化(key delta)。只有 trigger 与 delta 都明确发生,轨迹指针 $i_t$ 才推进到下一节点,模糊时不推进。

轨迹进度(Traj.%)指标和“跳步违规”检测都以节点结构为判定单元,是理解承诺冲突与进度权衡的前提。

三类叙事承诺

承诺集合 $C$ 中每条承诺都带满足条件与违反条件,分属三类:Invariant(某条件在指定区间内必须始终为真,如“暴露前保持卧底”);Ordering(事件先后顺序,如“背叛须在结盟之后”);Achievement(必须达成的目标)。前两类查违反、第三类查满足,全部成就达成且无违反才成功。

冲突分解指标(Commit. 冲突率)与成功终止条件直接由该分类驱动,案例研究中的违规判定也按此展开。

LLM-as-a-Judge 审计协议

用固定 prompt 的 LLM 审计器代替人工判定:每轮对叙述者回复依次执行冲突检查(事实/承诺/玩家输入三个维度,初检阳性还需二次确认以压低误报)、事实增量抽取、轨迹节点更新、承诺状态检查。所有审计器输出结构化 JSON,且必须引用具体证据与 ID,形成可复核的判定链条。

整个基准的可复现性建立在“被测代理与审计协议解耦”之上;审计器敏感性分析(Pearson 相关系数 0.96 以上)是实验结论可信度的关键支撑。

对抗玩家代理与视角锁定

固定配置的玩家模拟器,只能基于玩家角色可见的交互历史行动:隐藏事实、承诺与未来轨迹节点全部屏蔽,以第一人称生成有挑战但合乎世界内逻辑的输入(不超过 50 词),例如证据不足就指认凶手、前提未建立就强行推进到后期剧情,试图绕过、否定或改写已确立的叙事约束。

它是压力测试的来源;“视角锁定/未来视界隔离”保证了这些干预虽然对抗但公平——玩家不能利用上帝视角作弊,从而让失败归因于叙述者本身。

研究动机

LLM 正在推动 AI for Games 中“叙事代理/Game Master”的复兴,这些系统能生成流畅、有氛围感的文本,却常在最基本的要求上失败:系统刚说“门是锁着的”,下一轮角色却径直走了过去;系统说“唯一的钥匙在被锁的房间里”,用户坚称“我昨天已经拿到钥匙了”,多数 LLM 会默认接受并追溯性改写历史,或允许“直接跳到反派被捕的结局”这类不可能跳转,产出听起来合理却与交互历史或剧情约束相矛盾的文本。更麻烦的是评测:现有研究大多是偏好式的(感知连贯性、吸引力),两个代理可以产出同样“好看”的对话记录,但在是否守住既定事实和强制剧情节点上天差地别,逻辑失败既难检测也难跨方法比较。这种“无界用户自由 vs 刚性剧情目标”的张力在对抗干预下最致命:若系统无法在不可预测的用户行为下维持剧情的因果完整性,它就不能充当游戏世界一致性的“真相引擎”。

本文的目标是论文要把“叙事承诺保持”(Narrative Commitment Preservation, NCP)变成一个显式、可检查、可复现的任务:叙事代理维护显式事实账本与非可选承诺集合,每轮生成叙事回复后,由自动化程序抽取状态更新并验证世界状态是否一致、承诺是否仍可满足。为此作者构建 NCP-Bench——100 个源自电影梗概的叙事环境,每个环境是一份结构化规范 ⟨F0, C, R⟩(初始事实账本、承诺集合、有序参考轨迹),并配套一个把被测代理与固定审计协议解耦的评估框架;再用对抗玩家压力测试六个 SOTA 模型在长达 100 轮交互中的表现,量化存活率、轨迹进度、承诺满足率与三类冲突率,定位当前 LLM 在长程一致性上的具体短板。

与已有工作不同的是,独特切入在于把交互式叙事从“创意写作”重新定义为“长程约束满足问题”:剧情不是主题指南,而是一组刚性逻辑约束——世界事实、因果依赖、强制事件序列——系统必须作为游戏现实的最终裁判去满足它们。与既有工作相比:(i) 经典叙事规划系统依赖作者手写的叙事骨架或脚本化游戏环境,LLM 时代系统(StoryVerse、Drama Llama、StoryWriter)把逻辑一致性当作总体质量优化的副产品;(ii) 角色扮演评测(CharacterBox)关注人设特质持久性而非具体剧情承诺;(iii) 评测方法学(CheckEval、Prometheus)不针对“开放式语言交互中持久承诺被悄悄违反”这一特定失效模式。NCP-Bench 首次提供可复现协议,系统测量任意叙述者代理在用户蓄意跳过、否定、改写剧情约束时能坚持多久、败在何处。

核心方法

先讲直觉:相当于给游戏引擎配一个“规则管理员”,把剧情写成机器可查的账本和规则,每轮对话后自动对账,对不上即判负。技术路线分三块。其一,数据侧:每个环境是一份结构化叙事规范 ⟨F0, C, R⟩——初始事实账本 $F_0$(只含玩家角色在 0 时刻可观察到的真值,含显式负知识如“尚未知晓 X”,杜绝上帝视角泄漏)、承诺集合 $C$(Invariant/Ordering/Achievement 三类,各带满足与违反条件)、有序参考轨迹 $R$(每个节点含触发事件与关键变化双要件)。其二,交互侧:对抗玩家代理(只见可见历史)与被测叙述者代理逐轮生成自由文本,形成轨迹 $\tau_{1:T} = (u_1, y_1, \ldots, u_T, y_T)$。其三,审计侧:固定 prompt 的 LLM 审计器每轮执行四步——冲突检查(含二次确认)、事实更新、轨迹节点更新、承诺检查;全局状态记为 $s_t = (F_t, i_t, C, R)$。任何确认违规即以 CONFLICT 终止;100 轮无冲突为 SURVIVAL;全部成就承诺满足为 SUCCESS。

核心创新是把“承诺保持”从隐性偏好变成显式可审计对象。与已有方法的本质区别有三:(1) 外化状态——事实与承诺不再是隐含在对话记录里、需要评测者自行推断的东西,而是带稳定 ID、满足条件、违反条件的结构化对象,审计器输出必须引用具体 ID 和证据,消除了不同 LLM judge 对“是否存在某承诺/事实”的分歧;(2) 解耦评测——被测代理只管生成叙事,审计协议固定且外部定义,任何叙述者方法都能插到同一审计管线下公平比较,审计器与数据可独立替换与复用;(3) 保守状态机——轨迹节点用“触发事件 + 关键变化”双要件判定推进,事实抽取遵循“不确定不添加、不确定不否定”的默认偏置,候选更新先挂起、冲突检查通过后才入账,初检冲突还要经过二次确认才触发终止。同时玩家视角锁定保证干预虽然对抗但公平,使失败可归因于叙述者的一致性执行能力而非信息不对称。

方法步骤详情

数据构建分三阶段 agentic 抽取:从 CMU Movie Summary Corpus 出发,人工清洗候选池(去重、修角色错配、剔除过简梗概),人工选 100 部电影最大化体裁覆盖(18 类),依次运行参考轨迹抽取(节点原子化、因果强耦合)、承诺抽取(用轨迹节点 ID 做逻辑门控,拦截“未调查先指认”式跳跃)、初始事实抽取(未来视界隔离,只记录玩家在 $r_0$ 可知的事实,含负命题)。三专家复查全部规范,仅 7 份被标记且均为局部歧义。运行时按 Algorithm 1 循环:玩家代理生成第一人称输入 $u_t$(≤50 词,仅基于可见历史);叙述者生成回复 $y_t$(≤150 词);Fact Update 抽取最小严格事实差分;Conflict Check 审计事实、承诺、玩家输入三维冲突,初检阳性经 Double-Check 复核;通过后账本由 $F_t$ 更新为 $F_{t+1}$,再更新轨迹索引与承诺状态。终止条件:确认冲突、达 100 轮、或全部成就承诺满足。解码统一 temperature 0.6、top-p 0.95、8092 token,校验失败仅重试该次调用。

技术新颖性

技术新颖性体现在四个层面。(1) 任务形式化:首个把“开放文本交互中的持久承诺保持”作为独立能力加以测量的基准——先前工作要么保留作者骨架、要么限定脚本化环境、要么把一致性当聚合质量的副产物,没有一个提供可复现的压力测试协议。(2) 评测协议工程:事实账本支持“否定保留”以获得可审计的状态变迁史;三维冲突分类 + 二次确认 + 保守默认(不确定则 PENDING、不更新)显著抑制误报;人类复核显示 100 份 GPT-4o-mini 结果中仅 4 例事实冲突误报争议,承诺与玩家输入冲突判定零错误。(3) 审计器鲁棒性验证:三个审计骨干(GPT-5.4-mini、Gemini-2.5-Flash、GPT-5.2)两两 Pearson 相关 0.9628–0.9866、Spearman 0.9027–0.9817,证明结论不绑定单一评测模型。(4) 可解性对照:作者亲自担任叙述者的试点研究证明任务对人类可解——19 轮化解全部 19 次干预、达成 13/13 轨迹节点、成就承诺全部满足——排除了“任务定义有问题”的质疑,使模型的大面积失败成为有意义的负结果。

NCP-Bench turns each movie synopsis into a stateful interactive environment and audits every narrator response.
Figure 2: NCP-Bench turns each movie synopsis into a stateful interactive environment and audits every narrator response.
Primary genre distribution of the 100 movies in NCP-Bench.
Figure 3: Primary genre distribution of the 100 movies in NCP-Bench.
Per-movie distributions of facts, commitments, and trajectory nodes in NCP-Bench.
Figure 6: Per-movie distributions of facts, commitments, and trajectory nodes in NCP-Bench.

实验结果

六模型 × 100 电影共 600 次(审计器 Gemini-2.5-Flash)。20 轮后最强 GPT-5.2 存活率仅 42%,其余模型迅速趋零;仅 3.5% 撑满 100 轮且大多未满足全部承诺。GPT-5.2 平均 32.92 轮最长但轨迹进度仅 9.94%;DeepSeek-V3.2 仅活 15.88 轮却达最高轨迹进度 15.40% 与满足率 13.42%,Kimi-K2.5 平均 2.88 轮即崩。失效分解:事实冲突主导(最低 GPT-5.2 40%、最高 Qwen3 68%),承诺冲突 24%–54%,玩家输入冲突 11%–31%;表现为幻觉矛盾、过早泄露、改写现实、无视输入四类。HiAgent 把承诺冲突 26%→4%、轮次 22.16→30.05,但全满足运行 2→0、输入冲突翻倍至 38%,记忆增强不解决问题。自然输入也救不了:平均轮次 46.08、到限运行 3→19,但全满足运行 2→0。人类在 Iron Man 环境 19 轮化解全部干预、13/13 节点 SUCCESS,GPT-4o-mini 2 轮即败,GPT-5.2 撑 73 轮未完成。

Main results on NCP-Bench across different models (evaluated with Gemini-2.5-Flash auditor).
Table 1: Main results on NCP-Bench across different models (evaluated with Gemini-2.5-Flash auditor).
Auditor sensitivity analysis on GPT-4o-mini with three checker backbones.
Table 2: Auditor sensitivity analysis on GPT-4o-mini with three checker backbones.
Comparison between plain GPT-4o-mini and HiAgent evaluated under the same GPT-5.4-mini auditor.
Table 3: Comparison between plain GPT-4o-mini and HiAgent evaluated under the same GPT-5.4-mini auditor.
GPT-4o-mini under adversarial versus natural inputs (GPT-5.4-mini auditor).
Table 4: GPT-4o-mini under adversarial versus natural inputs (GPT-5.4-mini auditor).
Human narrator baseline on the Iron Man environment.
Table 5: Human narrator baseline on the Iron Man environment.
Global statistics for the processed NCP-Bench dataset.
Table 6: Global statistics for the processed NCP-Bench dataset.
Model Performance Comparison across Different Movie Genres (%).
Table 7: Model Performance Comparison across Different Movie Genres (%).
Survival rate of narrative environments across interaction turns.
Figure 4: Survival rate of narrative environments across interaction turns.
Common failure modes of interactive narrative agents.
Figure 5: Common failure modes of interactive narrative agents.
查看结构化数据
任务指标本文基线提升
20 轮交互后环境存活率(无冲突存续比例) Survival Rate @20 turns GPT-5.2:42%(全场最高) Kimi-K2.5、Grok-4.1-Fast、DeepSeek-V3.2、Qwen3-235B-A22B 随轮数趋近 0 最强模型也只有不到一半环境能撑过 20 轮,且随轮数继续下滑
平均交互轮次 Avg. Turns GPT-5.2:32.92 轮 Kimi-K2.5:2.88 轮(最低);Grok-4.1-Fast:7.87 轮 最强与最弱模型相差约 11 倍
轨迹进度 Traj. % DeepSeek-V3.2:15.40%(最高) GPT-5.2:9.94%;Kimi-K2.5:10.26% 存活久不等于剧情推进远,呈现进度-稳健性权衡
承诺满足率 Sat. % DeepSeek-V3.2:13.42%(最高) Kimi-K2.5:5.18%;GPT-4o-mini:10.90% 即便最高者也仅约 13%,全部成就承诺达成只出现在极个别运行
事实冲突率(越低越好) Fact Conflict % GPT-5.2:40%(最低) Qwen3-235B-A22B:68%(最高);GPT-4o-mini:64% 事实冲突是所有模型的主导失效模式
100 轮无冲突存活占比 Conflict-free to limit 全部 600 次运行中仅 3.5% 其余 96.5% 以冲突提前终止 极少幸存者仍大多未满足全部叙事承诺
记忆增强(HiAgent vs 原始 GPT-4o-mini,同审计器) 承诺冲突率 / 玩家输入冲突率 HiAgent:4% / 38% GPT-4o-mini:26% / 13% 承诺冲突大降但输入冲突近 3 倍,全满足运行 2→0,记忆压缩与输入保真互相挤占
对抗 vs 自然玩家输入(GPT-4o-mini) 平均轮次 / 全满足运行数 自然输入:46.08 轮 / 0 个 对抗输入:22.16 轮 / 2 个 合作玩法延长寿命却仍无法达成全部承诺,难度并非主要来自对抗性
人类对照(Iron Man 环境) 轨迹节点达成 / 终局状态 人类:13/13 节点,19 轮 SUCCESS GPT-4o-mini:2/13 节点,2 轮即失败;GPT-5.2:73 轮仍未完成 任务对人类可解、对当前模型极难

局限与改进

作者承认的局限:LLM 审计器对歧义文本的判断可能不完美(人工复核发现 4 例事实冲突误报,均为边界情形);供应商侧非确定性导致相同解码设置也无法比特级复现;框架只覆盖单线程、按时间顺序的线性叙事,非线性结构(分支时间线、闪回、平行视角)需要把承诺与事实模型推广到带时间范围与条件有效性的形式,留待未来;对抗玩家只是特定压力测试策略;电影化规范可能继承源素材偏差。我补充的观察:(1) 每模型对 100 部电影只跑一次,temperature 0.6 采样方差未经多次运行标准差报告,主表数字波动性未知;(2) 每轮约需 5 次审计调用(事实更新、冲突检查加复核、轨迹更新、承诺检查),评测成本高,社区大规模复跑门槛不低;(3) 被测叙述者的 prompt 中显式提供当前轨迹节点、承诺与事实账本,测的是“给定显式约束下的一致性执行”而非约束的自我推断与维护,与真实 Game Master 需自行管理隐藏规则的场景尚有距离;(4) 成功定义偏严苛(须满足全部成就承诺),部分完成质量刻画有限。

独立分析的弱点

独立分析几点弱点。(1) 审计器严格性影响结论:GPT-5.2 担任审计器时 GPT-4o-mini 成功数为 0,而 GPT-5.4-mini 与 Gemini-2.5-Flash 给出 5 个,审计器越强判得越严,模型排名可能随之改变;论文做了敏感性分析却未标定哪个审计器更接近人类裁判,改进方向是构建人工标注的冲突金标集来校准审计器。(2) 记忆压缩与输入保真的矛盾在 HiAgent 实验中暴露:承诺冲突率降到 4% 但玩家输入冲突率涨到 38%,“记住剧情规则”与“记住玩家刚说了什么”在压缩表示中互相挤占,改进方向是把逐轮确认玩家输入作为显式约束写入记忆结构,或为玩家意图单设不可压缩的状态槽。(3) 对抗玩家是单一 LLM 策略,干预模式可预测(早期指认、越权推进、荒诞请求),长期可能诱发针对该分布的过拟合,应引入真实人类红队或异构玩家策略混合评估。(4) 事实模型无法表达时间范围与条件有效性(如“直到 X 发生前为真”),扩展到非线性叙事时账本粒度需重新设计。(5) 成功指标二值化抹平了部分完成的质量差异,可引入分承诺的加权部分信用。

未来方向

作者明确提出的方向:把 NCP 推广到非线性叙事(分支时间线、闪回、平行视角),要求承诺与事实模型支持时间范围与条件有效性;在逻辑脚手架可靠之后叠加更丰富的评测维度——戏剧张力、情感共鸣、角色深度;覆盖更多样的故事来源与叙事形态。基于本文成果可以延伸的方向:(1) 跨域实例化——论文指出同一结构适用于编码代理(新需求不得悄悄破坏既有实现、接口契约、测试与安全约束)以及长程对话、教学系统、工具使用与多代理协调,NCP 提供的是任务抽象,可沿此构建各领域的承诺保持评测;(2) 训练侧——以审计器信号为奖励做强化学习,或构造承诺保持导向的 SFT 数据,让模型学会用世界内阻力拒绝不合理玩家主张而非迎合;(3) 架构侧——把显式事实账本内化为代理运行时组件(账本即上下文),研究账本写入策略、检索与上下文长度的权衡,并修正 HiAgent 暴露的输入保真损失;(4) 玩家建模——刻画不同干预强度与类型分布下的性能曲线,定位模型脆弱性的干预谱系;(5) 沿人类基线方向建立可比较的专家裁判协议,为审计器严格性提供外部锚点。

复现评估

复现条件总体较好。数据、代码与全部 prompt 模板已在 GitHub 开源,源数据是公开的 CMU Movie Summary Corpus;每部电影规范平均 16.60 条事实(8–31)、12.22 条承诺(5–24)、15.11 个轨迹节点(6–28),示例 Bourne Identity 为 14/20/20。无需训练,纯推理 API 调用:6 个被测模型各跑 100 部电影,玩家与主审计器统一用相对便宜的 Gemini-2.5-Flash;但每轮约 5 次审计调用、最长 100 轮,单模型全套评测的 API 成本不可忽略。解码统一 temperature 0.6、top-p 0.95、最大 8092 token。主要复现风险有二:供应商侧非确定性(作者明示无法比特级复现)与审计器模型版本更迭带来的判定漂移,建议复现者固定审计器版本并附带敏感性分析。若要把基准扩展到新语料,需要投入同等量级的人工清洗与专家复查(构建含去重、选片与三专家验证)。总体评估:复现难度中等偏低,工程量集中在跑通管线与承担 API 开销,方法本身不依赖专有技术。