EvolvingWorld:交互式文学世界中角色扮演智能体与世界模型协同演化的开放模式框架 EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World
开放模式驱动角色与世界在长程文学互动中持续协同演化
前置知识
角色扮演智能体(Role-Play Agent)
以大语言模型为核心、模仿特定虚构或真实人物进行对话的智能体,通常用预设的 persona/简介(profile)约束其说话风格、知识与动机,并借助检索或记忆维持一致性。在本文中它是产出台词、心理与动作,并随剧情更新自身状态的核心执行单元。
本文要解决的恰恰是传统角色智能体『人设静态、不随剧情演化』的根本问题;理解传统角色智能体的工作方式,才能理解 EvolvingWorld 的改进落点。
世界模型(World Model)
对环境状态(如社会秩序、地点、物品、规则)进行显式表示与维护的模块,能根据角色行为更新环境并反过来影响后续交互。在交互式仿真中,它与角色智能体解耦但耦合运行,共同推进剧情。
本文核心创新之一就是把世界建模显式化、分解为全局状态与地点/实体级状态,并与角色状态协同更新,这是读懂其 7 任务流水线的前提。
开放模式(Open-Schema)
不预先固定属性槽位(如强制填写『性格/目标/关系』),而是让模型根据每本书的题材与设定自行选择、合并或新增合适的状态维度——例如侦探的『侦查习惯』或维多利亚孤儿的『社会地位』。
开放模式是 EvolvingWorld 区别于 BookWorld 等固定槽位框架的本质特征,理解它才能理解为何框架能跨多种文学世界泛化。
LoRA 有监督微调
LoRA 是一种参数高效微调方法:冻结主干权重、仅训练注入的低秩矩阵,从而以较低显存对开源大模型做指令微调(SFT)。
本文用 LoRA(rank 64、alpha 128、2 epoch、学习率 $\eta=2\times10^{-5}$)将 4B–32B 开源模型微调到 7 个可训练任务上,是复现其实验的关键技术细节。
LLM-as-Judge
用大语言模型作为自动评分裁判,按给定评分标准(rubric)对生成结果打分。本文采用『逐指标独立裁判』并在轨迹层级聚合,还设计了针对格式崩溃的 IC 惩罚与指标惩罚。
论文的评测体系完全建立在此之上,理解其打分与惩罚机制($ ext{penalty}_{IC}$、$ ext{score}=\text{score}_{judge}\times N/(N+1)$)才能正确解读所有实验表格。
研究动机
现有的角色扮演与文学仿真系统存在三类突出问题。第一,绝大多数 persona 智能体只依赖静态 profile 或短对话上下文(如 ChatHaruhi、Character-LLM、DITTO、SimsChat 等),角色一旦设定就不再随剧情真正『成长』。第二,多智能体环境(如 Generative Agents、LARP)多依赖人工预先定义的单一沙盒世界,难以扩展到风格迥异的文学世界。第三,已有的书本驱动系统要么只做单场景角色扮演(CoSER、AdaMARP 缺少世界建模),要么像 BookWorld 只更新『目标/状态/全局事件』等少数固定字段,既缺少完整 profile 演化与地点/实体级世界更新,也缺少可训练的子任务监督。结果是长程仿真中剧情越长、角色与世界越容易『漂移』和崩坏——Figure 3 即显示 BookWorld 的 PES 与 SCC 随场景数增加明显下滑。
本文的目标是本文要把『交互式文学世界』重新建模为一个长程过程:从书本某一切片出发,让多个角色在场景中互动,并使角色状态(profile、隐藏追踪器、动机)与世界状态(全局设定、地点与实体状态)被持久、显式地更新。目标不只是生成下一句合理台词,而是在跨场景的数十轮交互中保持角色与世界『协同且连贯地发展』,使角色行为能重塑地点或社会秩序、世界变化又能反过来改变角色动机与 profile,从而把仿真目标从『复现原书』转向『维持一个有根据、持续发展的世界』。
与已有工作不同的是,本文的独特切入点是『开放模式的协同演化(open-schema co-evolution)』:不强迫所有故事套用同一套固定槽位,而是让系统从每本书自行推断该追踪哪些角色维度与世界维度;一旦维度建立,再用『角色↔世界』的双向耦合更新保证两者同步演化。配合一个隐藏追踪器(hidden tracker)单独存放『微弱/初现』的证据,恰好解决了『何时证据才足够更新 profile』这一核心难点。这与以往只更新少数预定义字段的做法形成本质区别,也填补了『基于 LLM 的开放模式世界演化』在交互式文学世界中的研究空白。
核心方法
直觉上,EvolvingWorld 把一本小说『展开』成一个不断生长的交互世界:给定书本某时间点的状态切片(角色 profile、隐藏追踪器、全局世界状态、各地点/实体状态),模拟器按『规划场景→生成多角色互动→更新世界→修订角色状态』的循环逐场景推进。技术上它由两个耦合模块组成——开放模式的角色智能体(Character Agent)负责多角色扮演与 profile 演化,LLM 世界模型(World Model)负责全局与地点/实体级状态维护及场景推进;二者通过『观察(observation)』共享状态视图,并把整个循环分解为 7 个有序、可监督的子任务。最终产出的轨迹 $\tau=(O^w_{I,L,(0)},z_1,r_1,Y_1,O^w_{I,L,(1)},\ldots,z_T,r_T,Y_T,O^w_{I,L,(T)})$,保证场景内容、角色演化与世界状态变化彼此一致。
核心创新是把『角色演化』和『世界演化』做成显式、开放模式且双向耦合的两套状态机,并引入隐藏追踪器来建模『多时间尺度』演化。状态形式化为世界状态 $S^w_{\ell,(t)}=(G^{(t)},L_{\ell,(t)})$ 与角色状态 $S^c_{i,(t)}=(P_{i,(t)},H_{i,(t)},M_{i,(t)})$($P$ 开放模式 profile、$H$ 隐藏追踪器、$M$ 场景动机)。与以往『人设静态、世界被动』不同,这里每个 profile 维度都被视为可演化;情绪这种快变量即时更新,性格这种慢变量则先把微弱证据沉淀进 $H$,待证据跨场景累积到阈值再写回 $P$,从而避免过早、突兀的 profile 跳变。开放模式让维度因书而异,使框架天然适配从校园到末世等截然不同的世界。
方法步骤详情
模拟器在场景步 $t$ 按以下 7 个任务依序执行:(1) scene_cast:世界模型从全员集合 $I$ 选出参与者 $z_t\subseteq I$;(2) location_scenario:选定地点 $\ell_t$ 与剧本 $r_t$;(3) motivation_update:角色智能体为每个参与者生成场景动机 $M_i^{(t)}$;(4) next_character:世界模型从交互历史 $Y_{t,<k}$ 选出下一发言者 $i_{t,k}$(角色/环境/角色群);(5) interaction_gen:角色智能体生成内容 $y_{t,k}$,含心理 $[...]$、台词与动作 $(...)$;(6) world_update:世界模型逐轮更新全局与地点状态 $S^w_{\ell_t,(t,k+1)}$;(7) character_update:场景结束后基于完成的交互 $Y_t$ 与新世界状态更新各参与者 $S^c_{i,(t+1)}$,数据由 Gemini-2.5-Pro 从 57 本书提取并逐场景更新,再切分为 138,596 训练样本与 222 测试切片。
技术新颖性
技术新颖性体现在四点。其一,开放模式的状态表示——只给参考维度让模型自选/合并/新增,语料中共涌现 581 个不同角色维度与 136 个世界维度,证明固定槽位会丢信息。其二,隐藏追踪器显式建模『多时间尺度』演化,把『何时更新 profile』从启发式变成有据可依的阈值判断。其三,把长程仿真拆成 7 个端到端可监督的子任务,每个任务输入输出形式化清晰,并以 ShareGPT 格式做 SFT。其四,提出轨迹层级的 LLM-as-Judge 评测(10 维 20 指标),专门衡量『持续的角色与世界演化质量』,并用对数衰减、上限 50 的 IC 惩罚($\text{penalty}_{IC}$,使首轮即失败者 IC 归零、成功数百次后仍扣约 8–10 分)与『追加零分虚拟场景』的指标惩罚把格式崩溃反映进分数。这是首个在交互式文学世界中做 LLM 开放模式世界演化的工作。
实验结果
实验从四个角度印证设计有效。(1) 状态演化监督带来收益:同一骨干上 EW 微调普遍优于开源原版与 CoSER/Crab 等『纯角色扮演』基线——Qwen-7B (EW-F) 角色智能体平均达 45.53,远超 Qwen-7B (Coser) 的 18.98 与 Crab 的 18.32;闭源最强为 Claude-4.6-Opus(角色 94.97、世界 77.76)。(2) 受控的角色演化与更精准的环境落地:EW 模型在 profile、说话风格、动机一致性上更稳,Environment Awareness 一致提升。(3) 世界建模靠『结构化状态追踪』补足预训练短板:世界任务普遍难过角色任务;Qwen-32B 世界模型平均 59.87,反超闭源 Claude-4.6-Sonnet。(4) 与 BookWorld 对比,EW 角色与世界平均分均更高,PUF/PES/MQ 涨幅尤大(GPT-5.3-Chat 角色 70.64→85.52)。Figure 3 显示 BookWorld 的 PES、SCC 随场景数增长而退化,而 EW 不但抑制退化,PES 甚至随轨迹变长而上升。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 角色智能体综合评测(Qwen-7B 骨干,纯角色扮演基线对比) | CHARACTER 平均分(0–100) | Qwen-7B (EW-F) = 45.53 | Qwen-7B (Coser) = 18.98 / Qwen-7B (Crab) = 18.32 | 较 CoSER 提升 +26.55 分,说明长程角色扮演需要耦合的角色/世界状态演化而非单纯模仿对话 |
| 世界模型综合评测(开源 vs 闭源) | WORLD 平均分(0–100) | Qwen-32B (EW-F) = 59.87 | Claude-4.6-Sonnet = 57.54 / Gemini-2.5-Flash = 59.76 | 经过 EW 训练的 32B 开源模型反超闭源 Claude-4.6-Sonnet,证明结构化状态追踪监督有效弥补预训练不足 |
| 长程文学仿真对比(同骨干 GPT-5.3-Chat) | 角色智能体平均分 | EvolvingWorld = 85.52 | BookWorld = 70.64 | +14.88 分,其中 PUF/PES/MQ 等演化类指标涨幅最大 |
| 长程文学仿真对比(同骨干 GPT-5.3-Chat) | 世界模型平均分 | EvolvingWorld = 71.33 | BookWorld = 65.78 | +5.55 分,主要体现在长程场景连续性与轮次/场景编排 |
| 长程退化趋势(GPT-5.3-Chat,随场景数 3→15) | Profile Evolution Smoothness / Scene Continuity & Coherence | 随轨迹变长 PES 不降反升,SCC 保持稳定 | BookWorld 两项指标随场景数增加显著退化 | EW 有效缓解长程性能崩坏,证明结构化状态更新更利于长期演化 |
局限与改进
作者承认三点局限。其一,世界被建模为所有角色共享的单一客观状态,而文学角色往往对同一世界有不同感知与记忆(有人觉得世界仁慈、有人觉得敌意,或记错物品位置),这种主观感知与不完美记忆会塑造行为,但为每个角色维护独立『感知世界』会大幅增加系统复杂度。其二,世界表示受 LLM 上下文长度限制,每个地点只能追踪『重要实体』而非全部实体,未来或可引入信息密度更高的视觉输入构建更细致的世界。其三,受版权限制基准只用了 Project Gutenberg 的公版经典书,未覆盖现代小说、游戏或用户自建世界——但这主要是数据约束而非框架约束,因为 EvolvingWorld 完全开放模式、不含任何领域本体或预设槽位,原则上可迁移到其它叙事领域,OOD 实验(Appendix H)也显示在完全未见过的书上仍有一致增益。此外我观察到:评测高度依赖 LLM-as-Judge(虽有人工一致性 κ=0.8 背书,但裁判模型本身可能带偏);最大开源模型仅 32B,与顶级闭源仍有 35+ 分差距;训练数据全部由 Gemini-2.5-Pro 蒸馏,蒸馏噪声与版权/毒性内容会被继承。
独立分析的弱点
(1) 单一共享世界观的假设在多视角叙事(多主角、不可靠叙述者)中明显失真,改进方向是为每个角色维护带『可信度/时效』标注的主观世界副本,并设计一致性仲裁机制。(2) 上下文长度瓶颈使世界实体表示粗糙,可改进为引入分层记忆/检索(向量库+实体图)或多模态场景编码来压缩信息。(3) 评测依赖 LLM 裁判,存在模型偏置与风格偏好,可补充更多人工标注、引入基于规则的硬约束检查(如物品位置一致性、社交关系图谱对齐)。(4) 数据面仅有公版书且全部经单一模型蒸馏,存在领域与风格偏置以及蒸馏错误放大;可扩展到现代网文、游戏剧本与用户生成内容,并做多模型交叉蒸馏。(5) 仅做到 32B 微调,未与顶级闭源或更大 MoE 结合,可探索更强骨干上的上限;角色在 character_update 时可见他人状态,存在『全局信息泄漏』,可能让仿真偏向全知而非有限理性。
未来方向
作者明确希望后续解决主观世界建模、用视觉等多模态构建更细世界表示、并把跨域(现代小说/游戏/用户自建世界)评测做扎实。基于本成果还可延伸:把 7 个可训练任务升级为强化学习/自博弈,让角色与世界在『读者/导演奖励』下持续进化;把轨迹评测与可控叙事(分支、改写、长视频生成,如 Appendix J 已用 LingBot 演示的 Alice 四场景短片)结合,做可交互的长篇影视/游戏自动生成;引入玩家介入的混合智能体,研究『人+LLM 角色』的涌现行为;以及把开放模式思路推广到非文学领域(历史复盘、社会仿真、教育情景剧)。
复现评估
复现性整体较好。作者已公开代码仓库(github.com/HKUST-KnowComp/EvolvingWorld)。训练细节充分:LoRA rank 64、alpha 128、dropout 0.05、2 epoch、学习率 $2\times10^{-5}$、最大序列长 32,768、单卡 batch 1、梯度累积 64(有效 batch 64)、bf16+gradient checkpointing+FlashAttention-2,用 LLaMA-Factory 训练、vLLM 推理(50 并发);骨干为 Llama-3.1-8B、Qwen2.5-7/14/32B、Qwen3-4B,均为开源模型,算力门槛中等(消费级到单/多卡 A100 级别即可)。数据为 57 本公版书,训练样本与评测切片、裁判 prompt 均在附录详尽给出(Appendix C/K)。主要风险点有二:一是测试集仅 222 个切片、闭源 API 模型随时间会变版本;二是高质量监督数据依赖 Gemini-2.5-Pro 蒸馏,复现需调用闭源 API 且存在成本,蒸馏过程本身也较难完全对齐。整体属『中等可复现』。
论文图表