← 返回 2026-07-31

超越借用历史:面向交互式角色扮演评测的人格对齐用户模拟 Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation

Yuhang Zhu, Mingxuan Du, Benfeng Xu, Jie Gao, Lingyun Yu, Hongtao Xie 📅 2026-07-30 👍 33 2026-08-05 19:06
LLM评判 LoRA微调 个性化评测 基准评测 多轮对话 用户模拟 角色扮演智能体

用真实用户历史训练用户模拟器,对角色扮演智能体做人格对齐的自由多轮评测。

前置知识

角色扮演智能体 (Role-Playing Agent, RPA)

基于大语言模型、提供互动叙事、陪伴与情感对话的消费级应用。其价值往往在多轮交互中逐步展开,对象不是孤立的单条回复而是RPA与用户共同构造的一段对话,因此很难用唯一正确答案衡量,需借助角色忠实度、剧情发展、用户体验等维度评估。

PALATE 的评测对象就是 RPA,且强调'对话是被RPA和用户共同构造的'这一特性。不理解 RPA 的多轮共构本质,就无法理解为何固定历史续写会产生系统性偏差。

用户模拟器 (User Simulator)

用模型扮演人类用户、与被测系统对话以生成评测样本的技术。任务型对话中曾用 agenda 或语料训练方法;本文用 per-user LoRA 在某个人真实聊天历史上微调,得到能模仿该人语气、节奏、退出习惯的专用模拟器,作为交互评测的驱动方。

PALATE 的核心机制是用'学习到的用户模拟器'驱动自由多轮交互。读懂论文必须理解模拟器为何优于提示式 LLM,以及为何要为每人单独训练。

per-user LoRA 微调

LoRA (Low-Rank Adaptation) 在冻结的大模型权重旁注入低秩可训练矩阵,用极小可训练参数量适配下游任务。本文对 Qwen3.5-35B-A3B Instruct 为每个用户单独做 LoRA SFT,把该人的表达风格、内容偏好、节奏、退出习惯承载在其训练数据中,而非依赖手写用户画像。

Table 1 的对比实验直接说明 per-user LoRA 是让模拟器逼近真人(2AFC 0.561、身份一致性 77.6)的关键技术选择,是论文方法可行性的基石。

评分准则 / 量规 (Rubric)

一组显式的评分标准与锚点,供 LLM 评判时对照打分。本文区分三类:通用回合级准则(12 维,如角色知识、人格、连贯)、整场会话准则(11 维,如回忆、动机、关系)和个性化体验准则(每人 4 个体验驱动器,从该人标注历史诱导并冻结)。

三轨评分结构是 PALATE 输出的核心,理解准则如何被诱导、冻结、打分,才能看懂 Table 2 的 U-Score/G-Score/Overall 三类分数。

LLM-as-Judge 与 2AFC 欺骗率

LLM-as-Judge 指用大模型充当自动评分官。2AFC (two-alternative forced choice) 欺骗率是用户模拟器保真度指标:在留出会话中让人/模拟器各生成下一条消息,由评判官在两者间二选一,欺骗率越接近 0.500 表示越难区分真人与模拟器(随机不可区分参考)。

论文既用 LLM 做三轨评分(主判官 GPT-5.5),又用 2AFC 验证模拟器保真度。混淆两者会误读 Table 1 与 Table 3 的含义。

研究动机

现有角色扮演智能体(RPA)评测基准普遍采用'固定对话历史续写 + 固定评分准则'的设计范式,论文通过受控实验揭示这种设计的两个根本缺陷。第一个缺陷是'借用历史'导致的系统性条件偏差:作者选取五段超过20轮的真实对话,固定全部用户回合与剧情事件,保留原始角色方历史并改写成高质量版本和劣化版本,让四个候选RPA在不同深度上续写,结果高质量角色方历史使候选的平均总分在五分制上提高约0.21,而劣化版本则降低约0.13。这意味着固定历史评测实际度量的是条件质量 $Q(c|H)$,而非RPA独立于历史的多轮扮演能力。第二个缺陷是把质量视为与用户无关:角色扮演的核心是用户参与,缓慢升温的关系弧线对偏好慢热的用户是优点,但对追求高张力快冲突的用户却是缺点,静态、用户无关的评分准则无法对齐特定用户满意度,也无法捕捉个体体验差异。

本文的目标是本文目标是构建一个可扩展的、人格对齐的自由多轮RPA评测基准PALATE,从评测轨迹和评分视角两方面重新设计。具体而言:(1)让评估轨迹由被测系统自己参与构造,而非继承外部来源的历史;(2)从同一个真实用户的标注历史中同时学习其行为策略和体验偏好,前者构造候选轨迹,后者从该用户视角评估轨迹;(3)把评测基本单元从孤立的RPA转变为'用户-RPA对',从而暴露依赖用户的胜者和跨轨道能力错配。作者希望证明个性化评分在保留人类满意度排序上优于通用评分,并在16个候选上识别出用户依赖的赢家与能力错配,把单一排行榜扩展为可解释的用户-RPA性能画像。

与已有工作不同的是,本文的独特切入角度是把'同一个真实用户'的两个侧面——行为策略与个体效用——首次耦合到自由形式角色扮演评测中。先前工作要么用场景、意图或提示式人格作为交互方(如PingPong的场景条件询问者、RMTBench的非自适应用户回合、MiniMax的人工合成长程自扮演用户),而非从个人自然RPA历史中学到的行为;要么把参与者画像与实时反馈联系起来以揭示聚合排名隐藏的变异,或从交互历史中推导用户条件化准则,但都没有把这种体验视角与同一人的行为策略在自由扮演中耦合。PALATE的差异化路线是:从一个用户标注交互历史中诱导出冻结的评分准则并复用它评估该用户新的轨迹,从而把'人条件化评测'这一原则从任务条件化评测真正落地到角色扮演领域。

核心方法

PALATE通过三个功能模块闭合评测回路:用户行为建模、自由交互、人格对齐评测。数据上,作者构建300张中英双语结构化角色卡,在标注平台上让志愿者与RPA进行自然多轮对话并同步标注体验,主队列含5个用户、5133个用户回合(每用户约1000回合),并预冻结10张角色卡作为主评测面板。整体思路是先直觉:既然RPA输出被对话历史塑造、用户体验因人而异,那就让'被测RPA自己参与构造轨迹',并用'同一个真实用户的偏好'来打分。技术路线是对每人训练一个专用用户模拟器(基于Qwen3.5-35B-A3B Instruct的per-user LoRA SFT),冻结后与候选RPA在10张冻结卡上自由多轮交互,每格重复两次共 $5 \times 10 \times 16 \times 2$ 条轨迹;同时用元提示从同一用户训练集诱导个性化评分准则,再用通用、会话、个性化三轨评分。

核心创新是把评测基本单元从'孤立的RPA'重新定义为'用户-RPA对',并由此派生两个本质区别于已有方法的设计。第一是'自由多轮交互'取代'固定历史续写':轨迹由学习到的用户模拟器与候选RPA共同构造,从角色开场起没有任何外部编排器决定谁说什么、剧情如何发展,也没有候选继承他人生成的历史,因此度量的是RPA自身能力 $Q(c)$ 而非 $Q(c|H)$。第二是'个性化体验准则'取代'用户无关准则':同一份元提示处理不同人的训练会话,对比相似情境下的高分低分响应、汇总跨会话的后续反应语义,编译成可解释的个性化体验准则(每人约4个体验驱动器),冻结后在正式评分中不再检索原始历史。这把'人条件化评测'从任务评测原则真正落地到角色扮演,并把同一人解耦为行为策略(造轨迹)与个体效用(评轨迹)。

方法步骤详情

PALATE完整流程分四步。第一步训练per-user模拟器:把每个会话转成用户侧下一动作任务,目标为自由文本续写或经[QUIT]退出,角色消息为输入、人类消息为输出;训练与推理用语义相同的冻结任务指令、不写手写画像,在Qwen3.5-35B-A3B Instruct上做per-user LoRA SFT。第二步冻结模拟器自由交互:每个用户模拟器与每个候选RPA在10张冻结卡上自由多轮,每格重复两次,模拟器输出[QUIT]终止或在预设深度停止,产生 $5\times10\times C\times2$ 条轨迹。第三步构建个性化准则:元提示对比该用户训练集高/低分响应、识别反复出现的个人奖惩与反例,编译成准则并禁止响应长度等表面代理。第四步三轨评分:个性化准则对采样RPA响应及其下一反应打分聚合成轨迹级满意度,通用12维打同样响应,会话准则读完整对话评persona稳定性与关系发展。聚合公式 $\bar{P}(c)=\frac{1}{K}\sum_u P_u(c)$、 $U\text{-Score}=\frac{100}{s}\bar{P}(c)$、 $G\text{-Score}=\frac{100}{2s}(G(c)+S(c))$、 $\text{Overall}=\frac{100}{3s}(\bar{P}(c)+G(c)+S(c))$, $s=5$、$K=5$。

技术新颖性

技术新颖性体现在四个方面。第一,首次把'per-user LoRA模拟器'作为交互评测的驱动方,并通过2AFC欺骗率(目标0.500)和身份一致性(0–100)两项指标系统验证其行为保真,而非仅用提示式或带画像的LLM扮演用户。第二,把'个性化评分准则'建模为从同一人历史诱导并冻结、可复用、可测试的显式规则集(含触发条件、反例、校准信息),并禁止响应长度等表面代理,区别于仅链接画像与实时反馈、或从交互历史推导准则却不与行为策略耦合的工作。第三,三轨评分结构(个性化 / 通用12维 / 会话11维)保留了跨用户的通用质量比较与长程交互能力评估,同时为每人提供体验坐标,使Overall仅作展示用而非假设三者可压缩为单一标量。第四,受控实验用高质量/劣化借用历史(提升0.21 / 降低0.13)直接量化了固定历史评测的条件偏差,为'让被测系统参与构造连续轨迹'提供了可量化的动机证据。

The Palate evaluation pipeline.
Figure 2: The Palate evaluation pipeline.
The three-track Palate scoring structure.
Figure 3: The three-track Palate scoring structure.

实验结果

核心发现分三层。第一层是用户模拟器保真(Table 1):per-user LoRA的2AFC宏平均欺骗率0.561(最接近随机参考0.500)、身份一致性77.6,远超Prompted LLM(0.180/55.9)、LLM+profile(0.242/61.7)与Raw Instruct(0.002/15.0)。第二层是主评测(Table 2)跨16候选揭示能力错配而非单一排名:GPT-5.4以Overall 85.06居首(优势来自通用Gen 4.73);Claude Sonnet 4.6以Session 4.32领跑长程(84.82);DeepSeek V4 Pro以U-Score 78.24居U分榜首(82.88)。无候选赢得全部5用户——U1/U2、U3U5、U4分别偏爱Qwen3-Max(4.37)、Claude Opus 4.8、Claude Sonnet 4.6(3.53),而Qwen3-Max在U4偏低(2.83),证明三轨非单一能力的等比例缩放;开权重中GLM-5.1(82.05)靠均衡进领先梯队,MiniMax M2-her(62.27)、CoSER(54.64)虽定向却靠后;模型排名Spearman相关≥0.959。第三层是人类一致性(Table 3):个性化(含反应)宏平均0.613,高于不含反应的0.551、通用(无0.480/有0.507)与MiniMax基线0.467,五用户均有正增益。

Held-out content-response fidelity of the user simulators.
Table 1: Held-out content-response fidelity of the user simulators.
Main Palate results.
Table 2: Main Palate results.
Within-session pairwise agreement on held-out turns.
Table 3: Within-session pairwise agreement on held-out turns.
查看结构化数据
任务指标本文基线提升
用户模拟器行为保真 2AFC欺骗率(目标0.500) / 身份一致性(0-100) per-user LoRA: 0.561 / 77.6 (宏平均) Prompted LLM 0.180/55.9, LLM+profile 0.242/61.7, Raw Instruct 0.002/15.0 欺骗率比LLM+profile提升+0.319,身份一致性提升+15.9,最接近随机不可区分参考
16候选主评测三轨排名 Overall / U-Score / G-Score (0-100) GPT-5.4 Overall 85.06(Gen 4.73), DeepSeek V4 Pro U-Score 78.24, Claude Sonnet 4.6 Session 4.32 闭源最强GPT-5.4, 开权重最强GLM-5.1(82.05) 揭示跨轨能力错配与用户依赖赢家,无候选赢得全部5个用户,排名Spearman相关≥0.959
留出回合人类满意度一致性 会话内成对一致性(随机0.500) 个性化(含反应)宏平均0.613 通用无反应0.480 / 有反应0.507, MiniMax对齐0.467 比通用最佳(0.507)提升+0.106,比MiniMax基线提升+0.146,五用户均有正增益

局限与改进

作者明确承认的局限是PALATE目前只覆盖5个深度标注用户。由于收集长对话与回合级满意度标注、且反复请同一批人评估每个候选的成本高昂,作者在互不相交的留出会话上验证了用户模拟器的行为保真和个性化评分与人类判断的一致性,但尚无一个覆盖主表中每个候选的端到端人类排名参考;留出实验验证了基准的两个关键组件,主评测则展示了PALATE能为这五个用户揭示的比较结构。我自己的观察:(1)用户面板仅5人,用户依赖结论的统计显著性偏弱,U2偏好通用准则也暗示个性化未必普适主导;(2)主评分判官为GPT-5.5,虽用Claude Opus 4.8与DeepSeek V4 Pro重判,但Session与小顶端差距对判官更敏感;(3)会话评分只评20条完整轨迹,样本量较小,顶端微差未必稳健。

独立分析的弱点

独立分析有四个弱点。第一是用户覆盖不足:5个用户难以支撑'用户依赖赢家'这类需要人群分布的结论,改进方向是规模化众包标注、并设计分层抽样使会话更均匀分布于300卡池。第二是评分仍依赖LLM判官:尽管跨家族重判保住了Personalized和Generic的大幅排序,Session与小顶端差距判官敏感,改进方向是引入更多元判官家族、开发针对长程一致性的判官去偏方法,并补充端到端人类排名作为锚。第三是模拟器偏置可能残留:per-user LoRA虽把2AFC提到0.561、身份一致性77.6,但模拟器仍可能系统性地把候选RPA引向特定行为模式(更配合或更对抗),引入用户侧失真;改进方向是联合训练用户与系统的对抗校准、或用多模拟器集成稀释单人偏置。第四是准则诱导的可解释性:规则集虽禁止表面代理,但'触发条件'是否真反映用户偏好仍需独立的外部验证。

未来方向

作者提出的未来方向是扩大用户面板并针对人类判断校准跨候选排名。基于成果可延伸的方向有:(1)把'行为策略 + 个体效用'的解耦推广到任务型对话、客服、教育辅导等其他需个性化评测的领域,把任务条件化评测与人条件化评测统一;(2)探索在线/持续学习的个性化准则,随用户新增交互动态更新而非一次性冻结;(3)研究多用户集成如何把个性化排名聚合为稳健的人群级排名,同时保留个体差异信号;(4)把PALATE用于RPA训练而非仅评测——把个性化体验信号作为强化学习或DPO的奖励,定向优化'对特定用户更满意'的角色扮演能力;(5)扩展多角色、多用户群组扮演场景的评测,研究角色间互动与群体体验。

复现评估

复现评估如下。数据方面,作者承诺发布PALATE仓库、300张角色卡、五段真实多轮对话与用户体验标注、以及五个冻结的个性化评分准则,并已获参与者知情同意与去标识化授权,这是较强的可复现基础。模型方面,用户模拟器为per-user LoRA权重(基于Qwen3.5-35B-A3B Instruct),作者表示将发布LoRA权重,但候选RPA多为闭源/API(GPT-5.4/5.1、Claude、DeepSeek V4、Gemini等),评测成本高、随API版本漂移。算力与调用方面,主评测每格重复两次、$5 \times 10 \times 16 \times 2$ 条轨迹,每条轨迹还要在40个决策点做Personalized与Generic评分、20条完整轨迹做Session评分,由GPT-5.5判官全部评分,再叠加Claude Opus 4.8与DeepSeek V4 Pro重判,调用规模巨大。难度方面,元提示、准则构建与评分协议在附录D.5-D.6给出,复现门槛中等偏高,主要瓶颈是候选API费用与判官调用成本。