← 返回 2026-09-10

RESCUE-BENCH:面向关系感知的多方情感支持对话基准 RESCUE-BENCH: Towards Relation-Aware Multi-Party Emotional Support Conversation Systems

Haichuan Hu, Yang Xiao, Mingni Tang, Jiawen Duan, Quanjun Zhang, Congqing He, Hao Zhang, Jiashuo Wang, Johan F. Hoorn, Wenjie Li 📅 2026-09-09 👍 5 2026-09-12 18:30
LLM评估 关系建模 基准评测 多方对话 心理治疗 情感支持对话

提出关系感知情感支持对话新任务,用真实伴侣与家庭访谈基准揭示大模型关系推理短板

前置知识

情感支持对话(ESC)

Emotional Support Conversation,指对话系统识别求助者的情绪状态,并以倾听、共情、认知重构等策略给予安慰与引导的任务,代表数据集为 ESConv。传统 ESC 假设一名支持者对一名求助者的一对一交互,支持过程主要围绕改善单个求助者的情绪状态展开,支持策略(如安慰、提问、重构)逐轮施加。

本文正是在传统 ESC 基础上做扩展,理解一对一 ESC 的目标与流程,才能看清“关系感知”这一新设定到底新增了什么。

追求-回避循环(pursue-withdraw)

伴侣治疗中的经典负性互动模式:一方不断追问、施压、要求回应,另一方则沉默、回避、退缩,双方行为互相强化形成稳定循环。EFT 与 Gottman 的研究都以其为伴侣痛苦的核心机制。本文将其作为关系模式标签之一,占伴侣对话实例的 38.7%。

它是 RESCUE-BENCH 关系模式标注体系(基于 EFT、Gottman 理论)的核心例子,理解它才能明白 RPP 任务到底在让模型判断什么。

结构式家庭治疗(SFT)

Minuchin 提出的家庭治疗流派,把家庭问题归因于边界模糊、层级失衡、代际联盟等结构问题,而非个体症状。本文家庭场景的 8 个关系模式标签(如 boundary_hierarchy_strain、cross_generational_coalition)及 join/enact/boundary 等干预策略主要源自该理论。

家庭场景的标签体系与策略空间都由 SFT 定义,且家庭场景呈现与伴侣不同的性能模式,不懂它就读不懂表 8、表 10 与场景对比结果。

LLM-as-judge

用一个强 LLM(本文为 GPT-5.4)按 1-5 分李克特量表,对模型生成文本与金标准答案的语义一致性打分,以替代昂贵的人工评估。本文用 200 个人工样本校验,发现其与人类评分完全一致率为 79.5%,平均绝对误差仅 0.235。

ER、VP 两个生成式任务的核心指标都依赖 LLM-as-judge,其与人类判断的一致性直接决定论文结论的可信度。

Recall@1 与 MRR

排序任务的常用指标。Recall@1 指金标准答案排在候选列表首位的比例;MRR(平均倒数排名)指金标准答案排位倒数 $1/r$ 的均值。本文 STP、SSP 均要求模型输出 top-3 候选列表,再按这两个指标计算。

支持目标与支持策略预测都按 top-3 排序评估;SSP“低召回但相对较高的 MRR”这一现象,必须借助这两个指标的对比才能正确解读。

桶效应与涟漪效应

桶效应(木桶原理)指群体支持效果取决于最脆弱成员(最短的木板);涟漪效应指情绪会沿关键人际关系在群体中传播扩散。二者共同说明:群体层面的支持效果不能只用个体改善的平均值衡量。

这是论文论证“为什么需要关系感知 ESC”的理论出发点,解释了为什么支持目标应是群体最优(先扶起最脆弱的成员),而非个体最优。

研究动机

现有情感支持对话(ESC)研究几乎都建立在一对一的求助者-支持者交互之上,以 ESConv、AugESC、ExTES 为代表;即便扩展到多人场景(如 MPED),也被当作“多个个体各自接受支持”的并行叠加——支持者只关注每个人的独立情绪状态,不建模求助者之间的人际关系,也不考虑关系动态演化对支持过程的影响。但真实的情感困境往往发生在关系之中:伴侣争吵、亲子冲突、家庭联盟,个体的痛苦本身就由关系模式(如一方追问、一方回避的追求-回避循环)组织起来。心理学中的桶效应与涟漪效应进一步表明,群体支持效果受制于最脆弱成员未解决的痛苦,情绪与张力会沿关键关系扩散,只让个体“平均变好”并不等于群体真正得到支持。而 AI 社区对此仅有零星个案研究(如 LLM 作为三方聊天治疗中介、多智能体伴侣冲突治疗模拟),从未系统检验过模型能否理解并利用人际关系来提供支持。

本文的目标是本文要提出并形式化“关系感知情感支持对话”(relation-aware ESC)这一新任务:把情感支持从以个体为中心扩展到以关系为中心的多方场景,要求系统追踪不断演化的个体情绪状态、有向人际态度与群体级关系模式,并在此基础上做出“何时干预、支持谁、用什么策略”的三重决策。为了可量化地评估这种能力,作者从公开纪录片式治疗访谈视频(Couples Therapy 与 Family Therapy)出发构建了 RESCUE-BENCH 基准:191 个样本(174 段伴侣对话 + 17 段家庭对话)、7,079 条标注轮次、共 1,064.8 分钟视频,并设计关系理解(ER/VP/RPP)与关系敏感支持(ITP/STP/SSP)两组共六个任务,用 10 个主流 LLM 的零样本表现刻画现有模型在关系建模与关系敏感支持决策上的能力边界。

与已有工作不同的是,本文的独特切入是把“人际关系”从背景信息提升为基准的核心评测对象。与 ESConv、AugESC、ExTES 等一对一 ESC 基准相比,它引入了有向立场(directed stance)与动态关系模式(dynamic pattern)两种全新信号;与 MELD、MPDD 等多方情绪数据集相比,它不只识别和追踪情绪,还要求把关系理解转化为干预时机、支持目标与策略的决策;与 MentalChat16K、PsyDial 等长期心理健康对话相比,它面向相互关联的多个求助者而非单人咨询。数据上它坚持真实、长时程、多模态:单样本平均 5.57 分钟、最长十几分钟,字幕、音频、视频沿同一时间轴对齐。标签体系并非自造,而是锚定情绪聚焦疗法(EFT)、Gottman 冲突-修复研究、整合行为伴侣治疗(IBCT)、结构式家庭治疗(SFT)、家庭系统理论(FST)等临床理论,使每个“关系模式”标签都有明确的临床含义和操作性定义。

核心方法

论文先把关系感知 ESC 形式化为一个序贯决策过程:设 $V=\{1,\dots,n\}$ 为相互关联的个体集合,第 $t$ 段交互中每个参与者 $i$ 有内部情绪与强度状态 $s_t^i$,全体构成个体状态 $s_t=\{s_t^i\}$;参与者 $i$ 对 $j$ 的有向人际状态(观点、态度、结盟或张力)记为 $g_{ij}^t$,全体构成 $G_t$;群体级关系模式 $\rho_t$(如升级、回避、修复、对齐)概括当前互动构型。支持者需依次决策:是否干预 $z_t\in\{0,1\}$、选择支持对象 $A_t\subseteq V$(可以是个人、冲突双方、子群体或全组)、选择支持策略 $a_t$。附录 B 进一步给出概念性群体目标 $\sigma^\star=\arg\max_\sigma \mathbb{E}[\sum_t \gamma^t U(s_t,G_t)-\lambda\max_{i\in V} d(s_t^i)]$,即最大化群体效用的同时惩罚忽视最痛苦的成员,且支持动作会同时更新个体与关系状态 $(s_{t+1},G_{t+1})=F(x_t,A_t,a_t)$。这条决策链被拆解成六个可观测子任务来评测 LLM。

核心创新是把“关系”作为一等公民纳入情感支持的建模与评测,与传统一对一 ESC 有三点本质区别。其一,状态空间从个体情绪扩展到“个体状态 $s_t$ + 有向人际状态 $G_t$ + 群体关系模式 $\rho_t$”三元组,要求模型理解谁对谁持什么态度、谁与谁结盟或对立、互动正处于升级还是修复。其二,支持决策从“每轮回应求助者”变为三步规划——判断干预时机 $z_t$(治疗师是否应该开口)、选定支持目标 $A_t$(个人、冲突双方还是全家)、匹配策略 $a_t$(追踪、重构、唤起、修复等);在多方场景里,何时开口、先支持谁与说什么同样重要。其三,支持目标从改善个体情绪变为群体最优:依据桶效应优先支持最脆弱的成员、化解关键关系张力,而非让每个人平均变好。对应地,VP、RPP、ITP、STP 四个任务是传统 ESC 完全没有的关系密集型评测维度。

方法步骤详情

数据构建分四步。第一步,从 Couples Therapy 和 Family Therapy 两个公开纪录片式访谈视频源人工切分独立场景片段,过滤短于 2 分钟的片段,得到 191 个样本、7,079 轮、1,064.8 分钟视频(伴侣 174 段/824.9 分钟,家庭 17 段/239.9 分钟)。第二步,将字幕、音频、视频沿共享时间轴对齐,以 Gemini-3.1-Pro 参照视频与字幕做行级预标注,每行覆盖六个维度:时间与实体(起止时间、说话人、目标)、言语内容、个体线索(语气、表情、姿态、内隐情绪)、关系立场(互动行为、有向观点)、治疗师策略(含意图)、关系模式(周期状态、原因、证据行)。第三步,搭建在线审核系统,由 3 名博士级标注者逐行对照原始视频核验修正,丢弃无法可靠核验的片段。第四步,按任务规则过滤构造实例(表 6):ITP 2,722+284 条(伴侣+家庭)、RPP 1,608+525、STP 1,290+347、SSP 1,290+347、ER 844+82、VP 775+80。评估上,ITP 用二分类 P/R/F1,RPP 用多分类 Accuracy,STP/SSP 用 top-3 排序的 Recall@1 与 MRR,ER 取 LLM 判分 $S_{emo}$ 与强度匹配分 $S_{int}=\max(1, 5-|\hat{y}_{int}-y_{int}|)$ 的均值 $S_{ER}=(S_{emo}+S_{int})/2$,VP 用 LLM 判分加 BERTScore。

技术新颖性

技术新颖性体现在四个层面。数据层面:首个从真实治疗访谈视频构建的关系感知 ESC 基准,行级标注以交互功能(说话人、对象、互动功能、情绪含义的变化)而非字幕行为单位,保留了语气、表情、姿态等多模态证据,平均每个样本 37.06 轮、5.57 分钟,远长于常规对话基准。标注层面:LLM 预标注 + 3 名博士级专家逐行核验的半自动流水线,配合自建 Web 审核台与 Argilla 评估界面保证一致性,并用 200 样本人工校验证明 GPT-5.4 判分与人类完全一致率 79.5%、MAE 0.235。任务层面:把临床理论操作化为紧凑标签集——伴侣 6 个关系模式 + 10 个策略、家庭 8 个模式 + 8 个策略,每种标签都有操作性定义与理论出处(EFT/Gottman/IBCT/SFT/FST/WAT),并详细规定相邻标签的判别规则(如 repair_softening 与 constructive_alignment 的稳定度差异)。评测层面:六个任务覆盖“理解—决策”两个维度,首次用时机/目标/策略三个正交维度评测 LLM 的关系敏感支持能力。

Overview of relational interaction dynamics modeling.
Figure 2: Overview of relational interaction dynamics modeling.
Example of the row-level annotation format.
Figure 11: Example of the row-level annotation format.
Overview of the web-based annotation review dashboard.
Figure 12: Overview of the web-based annotation review dashboard.
Row-level verification interface.
Figure 13: Row-level verification interface.

实验结果

10 个 LLM 零样本评测(表 5)呈现清晰的“局部强、关系弱”格局。依赖局部情绪或干预线索的任务表现尚可:ITP 平均 F1 达 82.62%,ER 平均 LLM 判分 4.05/5(BERTScore 0.8223),说明模型常能识别情绪显著时刻。但关系密集任务大幅下滑:RPP 最好仅 45.60%(DeepSeek-V4-Pro),平均 40.45%;VP 的 BERTScore 虽高达 0.861,但 LLM 判分 3.58 显著低于 ER 的 4.05,说明推断“对别人的看法”比识别“自己的情绪”更难;STP 中等(召回 64.34%、MRR 78.35%),SSP 最差(召回仅 31.88%、MRR 44.96%)。单项冠军分散:Qwen3.5-Plus 的 ITP F1 94.60%、ER 4.22 最佳,但 RPP 仅 40.27%,STP/SSP/VP 均非第一;DeepSeek-V4-Pro 在 RPP/STP/SSP 全面领先(45.60%、71.04/82.23、37.26/52.00),DeepSeek-V4-Flash 的 VP 最佳(4.08)。逐标签分析暴露长尾问题:伴侣场景 pursue-withdraw 达 77.38% 准确率而 mixed transition 仅 2.23%;家庭场景 pursue-withdraw 72.73%、cooperative family alliance 54.24%,但 escalation conflict 14.73%、cross-generational coalition 17.25%、mutual disengagement 14.81%;repair softening 虽高频(伴侣 27.0%)却只有 35.45%/48.46% 准确率,说明相邻去升级状态语义重叠导致混淆。失败分析显示 RPP 准确率随对话位置波动而非单调下降(图 4),与关系模式分布随阶段漂移(图 5)呼应——难点是持续追踪动态转移而非长上下文。场景差异不一致:家庭 STP 更难(召回 54.87% vs 66.88%),家庭 SSP 反而更容易(36.83% vs 30.54%),且模型排名在场景间大幅翻转(GPT-4o 的 RPP 从 41.46% 跌至 28.75%,DeepSeek-V4-Flash 从 36.56% 升至 49.56%)。人工评估(表 12)确认 LLM-as-judge 与人类一致率 79.5%、MAE 0.235。

Comparison with representative emotional support, multi-party dialogue, and mental-health support benchmarks.
Table 1: Comparison with representative emotional support, multi-party dialogue, and mental-health support benchmarks.
Task comparison between traditional ESC and relation-aware ESC.
Table 2: Task comparison between traditional ESC and relation-aware ESC.
Dataset statistics across two scenarios.
Table 3: Dataset statistics across two scenarios.
Evaluation metrics for different relation-aware ESC tasks.
Table 4: Evaluation metrics for different relation-aware ESC tasks.
Model performance across relation-aware ESC tasks.
Table 5: Model performance across relation-aware ESC tasks.
Task instance construction statistics.
Table 6: Task instance construction statistics.
Couple relation pattern labels and their main theoretical grounding.
Table 7: Couple relation pattern labels and their main theoretical grounding.
Family relation pattern labels and their main theoretical grounding.
Table 8: Family relation pattern labels and their main theoretical grounding.
Couple support strategy labels and their main theoretical grounding.
Table 9: Couple support strategy labels and their main theoretical grounding.
Family support strategy labels and their main theoretical grounding.
Table 10: Family support strategy labels and their main theoretical grounding.
Scenario-wise performance across relation-aware ESC tasks.
Table 11: Scenario-wise performance across relation-aware ESC tasks.
Human Evaluation Results.
Table 12: Human Evaluation Results.
Gold relation-pattern distribution across relative dialogue position.
Figure 5: Gold relation-pattern distribution across relative dialogue position.
Distribution of relation-pattern labels in couple conversations.
Figure 6: Distribution of relation-pattern labels in couple conversations.
Distribution of relation-pattern labels in family conversations.
Figure 7: Distribution of relation-pattern labels in family conversations.
Distribution of support-strategy labels in couple conversations.
Figure 8: Distribution of support-strategy labels in couple conversations.
Distribution of support-strategy labels in family conversations.
Figure 9: Distribution of support-strategy labels in family conversations.
Screenshot of the human evaluation interface deployed with Argilla on Hugging Face.
Figure 10: Screenshot of the human evaluation interface deployed with Argilla on Hugging Face.
查看结构化数据
任务指标本文基线提升
干预时机预测(ITP,二分类) Precision / Recall / F1(%) F1 94.60(Qwen3.5-Plus 最佳) 10 模型平均 F1 82.62 最佳较平均 +11.98 个百分点
关系模式预测(RPP,多分类) Accuracy(%) 45.60(DeepSeek-V4-Pro 最佳) 10 模型平均 40.45 +5.15 个百分点,但绝对水平仍低(6 类标签)
观点预测(VP,生成式) LLM-as-judge(1-5 分)/ BERTScore 4.08 / —(DeepSeek-V4-Flash 判分最佳) 10 模型平均 3.58 / 0.861(对照 ER 平均 4.05) 较平均 +0.50 分;仍比 ER 低 0.47 分
支持目标预测(STP,top-3 排序) Recall@1 / MRR(%) 71.04 / 82.23(DeepSeek-V4-Pro 最佳) 10 模型平均 64.34 / 78.35 +6.70 / +3.88 个百分点
支持策略预测(SSP,top-3 排序) Recall@1 / MRR(%) 37.26 / 52.00(DeepSeek-V4-Pro 最佳) 10 模型平均 31.88 / 44.96 +5.38 / +7.04 个百分点,召回仍为六任务最低
情绪识别(ER,生成式) LLM-as-judge(1-5 分)/ BERTScore 4.22 / 0.8321(Qwen3.5-Plus 判分最佳) 10 模型平均 4.05 / 0.8223 +0.17 分,属最容易的任务之一

局限与改进

作者承认四点局限:(1) 数据来自公开纪录片式治疗访谈,受媒体制作、剪辑、参与者人口统计与文化语境带来的选择偏差影响;(2) 关系模式、观点、支持目标与策略等高层标签本质上是主观判断,虽用 LLM 预标注+专家核验缓解,仍无法完全消除;(3) 多个任务标签呈长尾分布(伴侣 mixed transition 仅 6.3%、repair 策略仅 0.9%),影响训练与评估,作者认为这也反映真实世界的不平衡;(4) 因版权与隐私不公开原始视频/音频,只能提供标注与受控访问,限制完整多模态复现。我的补充观察:其一,家庭样本仅 17 段(239.9 分钟)而伴侣 174 段,家庭场景结论统计功效有限,且任务实例数在场景间悬殊(ER 844 vs 82);其二,所有评测均为零样本,未微调任何模型,无法区分“能力缺失”与“提示不匹配”;其三,SSP/STP 以单一金标签评估排序,但临床上一条治疗师发言可能同时合理采用多种策略,指标可能系统性低估模型;其四,判分用 GPT-5.4,与部分被测模型可能存在家族相关性;其五,数据为英文美式视频,跨语言跨文化泛化未知;其六,多模态线索虽被标注,主结果看起来主要基于文本与结构化证据输入,模态贡献缺乏消融实验。

独立分析的弱点

独立分析可见四个弱点。第一,基准是“诊断”而非“治疗”:六个任务都是单点静态预测,没有闭环生成与干预效果追踪,模型即使全部答对也不等于会做支持——改进方向是把六任务作为奖励模型或过程监督的组件,接入附录 B 给出的序贯决策目标 $\sigma^\star$ 做策略学习。第二,标签长尾与语义重叠使 RPP/SSP 低分的原因难以解耦:mixed transition 仅 2.23% 的准确率究竟是模型不会,还是标注本身分歧大?改进方向是发布多标注者一致性数据、引入软标签,或采用对比式评估(让模型在两个候选模式间二选一并给出证据行)。第三,金标准以治疗师实际行为为准(ITP 正样本=治疗师真实开口),这会把治疗师的个人风格当作唯一正确答案;改进方向是引入多参考标注或反事实标注(此处是否唯一合理干预点)。第四,家庭场景 STP 系统性更差(召回 54.87% vs 66.88%),说明多成员、多代际结构的组合推理是短板,改进方向是在提示或架构中显式注入关系图/家谱结构约束,或用关系感知的图注意力模块增强,并对跨代联盟、边界层级等结构类标签做针对性训练。

未来方向

作者提出的方向:纳入更多人群与文化背景的自然关系互动数据源,纠正纪录片选择偏差;用更大的标注者池与更细的标注指南提高高层标签可靠性;探索数据增强、类别重平衡或稀有标签评估协议应对长尾;研究隐私保护的数据共享机制与受控访问协议。基于本文成果可延伸的工作:其一,把六任务整合为可优化的策略学习问题,按群体效用目标训练会“看时机、选对象、配策略”的支持智能体,并用模拟环境评估干预的长期效果 $(s_{t+1}, G_{t+1})$;其二,多模态建模——利用已标注的语气、表情、姿态证据评测或训练视频-文本模型,量化非言语线索对关系推理的增益;其三,稀疏标签处理,如对比学习、层次化分类(先判正负周期再细分状态)或基于临床理论先验的约束解码;其四,利用伴侣/家庭两套标签体系的重叠(pursue_withdraw、repair_softening 共享)研究关系理解的跨场景抽象与迁移;其五,把基准用于评估治疗师辅助系统或“模拟来访者”训练系统,与论文引用的多智能体治疗模拟工作(如 Simulating Couple Conflict)衔接。

复现评估

复现条件较好但有保留。代码已在 GitHub(Tomsawyerhu/RESCUE-bench)开源,数据在 HuggingFace(tomhu/relation_therapy)发布,内容包括派生任务数据、说话人标识、标签体系、任务定义、评测脚本、提示词与聚合统计。十个被测模型均为 API 可得的商用或开源模型,全部零样本评测无需训练算力,主要成本是 API 调用费用。关键限制在多模态:因版权与隐私,原始视频、音频、截图不随基准分发,只提供源标识与时间元数据供研究者自行定位公开材料(YouTube 上的 Couples Therapy 频道与 Family Therapy 播放列表),必要时对具备机构资质、研究目的甚至 IRB 批件的合格研究者提供受控访问并要求数据使用协议。因此六个任务的文本条件复现难度中等偏低:标签体系与提示词齐全、指标自动化程度高(LLM-as-judge 已验证与人类一致率 79.5%、MAE 0.235),但完整多模态实验需自行获取视频;且流水线依赖闭源 API(Gemini-3.1-Pro 预标注、GPT-5.4 判分),长期复现稳定性受服务商影响。