← 返回 2026-08-10

OneEmo:面向情感感知、理解与交互的统一多模态推理模型 OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction

Jiahao Huang, Zheng Lian, Jingyi Zhang, Zhide Chen, Xiaojiang Peng, Shaonan Wang 📅 2026-08-06 👍 5 2026-08-15 18:30
GRPO 共情对话生成 多任务学习 多模态情感计算 强化学习 情感识别

用统一强化学习框架打通情感感知、理解与交互三大层次

前置知识

GRPO(Group Relative Policy Optimization)

DeepSeek 提出的强化学习算法,用于激发 LLM 的推理能力。它对每个输入采样 G 个输出,用组内奖励的均值和标准差归一化得到相对优势 $\hat{A}_i$,再结合 PPO 式截断目标函数和 KL 散度正则项优化策略,无需单独训练价值模型,显著降低了 RL 的工程复杂度。

本文 Emo-Chord 以 GRPO 为 RL 优化基础,理解其组内相对优势机制才能理解后续多任务奖励分配如何稳定训练。

多模态大语言模型(MLLM)

由多模态编码器(视觉/音频)、适配器和 LLM 组成的模型架构,能同时处理图像、视频、文本等多种输入并生成文本回复。本文以 Qwen3.5-4B 为骨干,通过 LoRA 微调语言部分并解冻多模态适配器,使其具备视频情感理解能力。

OneEmo 建立在 MLLM 之上,理解其多模态输入处理方式才能明白模型如何从视频中提取情感线索。

情感计算的三个层次:感知、理解、交互

感知(Perception)指识别情绪类别或效价,如表情分类、情感极性判断;理解(Understanding)指推断情绪背后的意图、幽默或讽刺等深层社交语义;交互(Interaction)指基于理解生成共情或情感支持的对话回复。本文首次将三者统一为联合优化目标,覆盖 MSA、B-MER、OV-MER、MIR、MHU、MSU、ERG、ESC 八大任务。

这是本文的核心任务分类框架,八大任务全部归属于这三个层次,理解此划分才能 grasp 全文的统一动机。

课程学习(Curriculum Learning)

一种由易到难的训练策略,先在简单或基础任务上训练,再逐步引入复杂任务。本文第一阶段先训感知+理解任务建立多模态基础,第二阶段才引入 ESC 并加大 ERG 数据比例以衔接交互能力,避免模型同时学习异构任务时互相干扰。

课程学习是 SFT 阶段避免任务干扰的关键设计,也是消融实验(SFT-v5 vs SFT-v3)中证明有效的核心组件。

心理学理论驱动的推理轨迹

本文用经典心理学框架约束模型推理逻辑:基本情绪用 Ekman 六情理论(基于可观测面部表情推断)、幽默与讽刺用不一致-消解理论与讽刺理论(分析期望与实际的反差)、情感交互用 Lazarus 情绪评价理论的四步范式(记忆追踪→状态感知→因果归因→目标制定),ESC 还额外融合 DSM/ICD-11 诊断标准与 CBT/ACT 疗法来规范支持策略选择。

理论驱动的推理轨迹是 EmoWorld-130K 区别于 ECR-Chain、Psyche-R1 等数据集的核心特征,也是奖励函数中思维一致性评判的依据。

研究动机

当前情感计算领域的研究大多聚焦于单一任务的专项优化。例如 R1-Omni、AffectGPT-R1 等工作仅在基础情绪识别上做强化学习;EmpRL、MultiMood 只优化共情对话质量;而 Nano-EmoX、VidEmo 虽尝试了跨任务协同,但仍未将感知、理解和交互作为联合优化目标。更关键的是,现有情感推理数据集(如 ECR-Chain 仅覆盖 2 类文本任务、Psyche-R1 无理论约束)大多局限于感知层面的标签预测,缺乏面向高层认知过程(如意图推断、对话生成)的显式推理轨迹。同时,将强化学习引入这种异构多任务框架面临严重的优化障碍:不同任务的奖励信号差异巨大,直接联合优化会引发梯度冲突和策略崩溃,导致训练难以稳定收敛。这使得构建一个统一的情感基础模型始终是一个悬而未决的难题。

本文的目标是本文的目标是构建一个能在情感感知、理解和交互三个层次上同时具备强能力的统一推理模型 OneEmo。具体而言:首先构建一个覆盖八大情感任务(MSA、B-MER、OV-MER、MIR、MHU、MSU、ERG、ESC)且带高质量推理轨迹的训练集 EmoWorld-130K,使模型能进行可解释的逐步推理;其次设计一种稳定的多任务强化学习策略 Emo-Chord,在释放 MLLM 潜在推理能力的同时避免策略崩溃;最后以仅 4.5B 参数的轻量规模,在感知理解任务上超越 16B 级开源模型,并在交互任务上与 310B 参数的商业模型竞争,证明统一框架不仅能打通任务壁垒,还能通过协同效应实现单任务专项模型难以企及的综合性能。

与已有工作不同的是,本文的独特切入点在于「任务协同」与「推理显性化」的结合。已有的情感 MLLM 要么只做单任务 SFT(如 Emotion-LLaMA、AffectGPT),要么只把 RL 用于感知层面(如 R1-Omni)。本文观察到在 HCI 场景中,情绪感知、意图理解和共情交互是紧密耦合的——准确感知情绪是理解意图的前提,而理解意图又是生成恰当情感支持的基础。作者抓住这一被忽视的协同关系,用心理学理论(Ekman 基本情绪理论、不一致-消解理论、情绪评价理论、DSM/ICD-11 诊断标准)将隐式推理过程显性化为结构化思维链,再用精心设计的多组分奖励函数在 RL 阶段约束推理的事实一致性和逻辑连贯性,从而把「感知→理解→交互」打通为一条可联合优化的推理链路。

核心方法

OneEmo 的整体思路可类比为「培养一个全能的心理咨询师」:先让它广泛学习从察言观色到意图推断的各项基本功(SFT 阶段),再通过反复练习和纠错磨炼高阶推理能力(RL 阶段)。技术路线上,它以 Qwen3.5-4B 为骨干,先用课程学习分两阶段在 EmoWorld-130K 上做 SFT——第一阶段聚焦感知与理解任务(MSA、B-MER、OV-MER、MIR、MHU、MSU 共约 5 万条)建立多模态基础,第二阶段引入 ESC 并加大 ERG 比例以衔接交互能力。随后进入 Emo-Chord 强化学习阶段:先做 5 个 epoch 的离线冷启动(学习率 $1 \times 10^{-5}$),再做 2 个 epoch 的在线策略优化(GRPO 学习率 $2 \times 10^{-6}$,采样组大小 $G=8$,KL 系数 $\beta=0.06$),期间动态混合辅助 SFT 损失(权重 $\mu$ 从 0.5 退火到 0.02),在探索的同时持续回放专家数据以防能力退化。整个训练仅需 2 张 H800 GPU。

核心创新在于 Emo-Chord 策略将「在线探索」与「离线模仿」有机融合,解决了多任务 RL 的策略崩溃难题。总损失设计为 $\mathcal{L}(\theta) = (1-\mu)\mathcal{L}_{GRPO}(\theta) + \mu\mathcal{L}_{SFT}(\theta)$,其中辅助 SFT 项让模型在 RL 探索过程中不断重放专家轨迹,防止已习得能力被遗忘。与直接联合 RL+SFT(RL-v3)不同,Emo-Chord 采用「课程 SFT 第一阶段冷启动 → 在线 RL 混合 SFT」的混合范式:消融表明从课程第一阶段而非第二阶段初始化 RL 效果更好,因为完整监督训练会过度固化次优策略、限制后续探索空间。第二个关键创新是精细化奖励分解 $R = \gamma_f R_{format} + \gamma_t R_{thought} + \gamma_a R_{answer}$(系数 $\gamma_f=0.5, \gamma_t=0.3, \gamma_a=1.0$),其中思维奖励 $R_{thought}$ 特别引入了视觉事实一致性校验——用视频理解模型提取原子级视觉事实,再用 LLM 裁判比对推理是否虚构,从根源上遏制了情感推理中的幻觉问题。

方法步骤详情

完整流程分三大部分。第一部分是数据构建 EmoWorld-130K:从 DFEW、MERR、MER-Caption+、MIntRec 1.0/2.0、MUSTARD、URFunny、AvaMERG、OpenR1-Psy 八个来源出发,以原始标注为锚点,用 Seed-2.0-Lite 在心理学理论模板约束下生成结构化推理轨迹(基本情绪用 Ekman 理论、幽默/讽刺用不一致-消解理论、情感交互用评价理论四步范式:对话记忆追踪→用户状态感知→因果归因→回复目标制定,ESC 还融合 DSM/ICD-11 与 CBT/ACT 疗法);随后用闭环反向验证筛选不一致样本;最后由三名心理学研究生在 AI 修复建议辅助下人工修订,并抽检每任务 10% 子集做质量控制。第二部分是课程 SFT:第一阶段在感知+理解任务上联合微调,第二阶段引入 ESC 并提升 ERG 占比至 18.19%。第三部分是 Emo-Chord RL:离线冷启动 5 epoch 后做在线 GRPO 2 epoch,奖励由格式 $R_{format}$、思维 $R_{thought}=(R_{fact}+R_{coherence})/10$、答案 $R_{answer}$ 三部分加权而成,另引入任务感知线性衰减门控 $\tau$ 对超长输出去奖励化以抑制冗长幻觉,最终 $R_{answer} = R_{answer} \times \min(\tau_{thought}, \tau_{answer})$。

技术新颖性

技术新颖性体现在三个层面。数据层面,EmoWorld-130K 是首个横跨感知-理解-交互三大层次、且推理轨迹严格由心理学理论驱动的情感数据集,与 ECR-Chain(仅 2 类文本任务、5.8K 规模)、Psyche-R1(仅文本、无理论约束)形成本质区别;其轨迹结构化、token 高效且严格上下文感知,避免了 OpenR1-Psy 那种冗长无结构的思考。训练策略层面,Emo-Chord 的「冷启动+混合 SFT 辅助」范式借鉴了 on/off-policy 协同思想,但创新性地将其适配到异构多任务情感场景,并通过课程初始化点选择(从第一阶段而非第二阶段启动 RL)规避策略固化。奖励设计层面,将视觉事实一致性校验嵌入思维奖励,用独立视频模型提取原子事实再交叉验证,这种「多模型协同裁判」机制在情感 RL 中较为罕见,有效阻断了推理模型常见的「编造观察细节」问题。

EmoWorld-130K Dataset:八大情感任务的推理轨迹示例
Fig. 1: EmoWorld-130K Dataset:八大情感任务的推理轨迹示例
OneEmo 整体流程:EmoWorld-130K 构建与 Emo-Chord 训练
Fig. 2: OneEmo 整体流程:EmoWorld-130K 构建与 Emo-Chord 训练
Emo-Chord 的奖励分解与信用分配
Fig. 4: Emo-Chord 的奖励分解与信用分配

实验结果

实验从四个维度全面验证了 OneEmo。感知与理解方面(Table II),OneEmo(+Emo-Chord) 以 4.5B 参数取得 71.22 的六任务均分,显著超越所有开源模型:比 16B 的 Cosmos3-Nano(61.08)高 10.14 分,比同规模 Qwen3.5-4B 基线(54.97)高 16.25 分;多模态情感分析(MSA)仅落后 MiMo-v2.5(310B)0.24 分,意图识别(20/30 类)以 64.47 反超 Gemini-3.1-Pro(61.39)达 3.08 分。交互方面(Table III),ESC 总体效果 4.67 超越 Gemini-3.1-Pro(4.65),但 ERG 信息量和连贯性因参考回复本身偏简洁而略逊于商业模型。人类评估(Table IV)中,对比 Qwen3.5-9B,ESC 拟人度胜率达 84.33%、ERG 达 80.33%;对比 310B 的 MiMo-v2.5 在 ESC 上打成统计平局。消融实验(Table V)显示移除答案/思维/格式奖励分别致均分下降 2.97、1.16、2.7 分,验证了每个奖励组分的必要性。训练策略对比(Fig. 5)显示 Emo-Chord(RL-v4)在所有变体中最优,无冷启动的 RL-v3 在 MIR、MHU 等复杂任务上严重退化。任务协同分析(Fig. 6)证实课程学习(SFT-v5)能避免朴素联合训练(SFT-v3)的灾难性遗忘,实现任务间相互促进。跨骨干泛化(Fig. 7)显示方法在 InternVL-3.5-4B 上同样带来全任务 Pareto 提升。

感知与理解任务的主实验结果
Table II: 感知与理解任务的主实验结果
情感交互任务的自动评估结果(1-5 Likert)
Table III: 情感交互任务的自动评估结果(1-5 Likert)
任务协同分析:不同 SFT 数据组合的影响
Fig. 6: 任务协同分析:不同 SFT 数据组合的影响
查看结构化数据
任务指标本文基线提升
感知+理解六任务平均 Avg (WAF/Hit Rate/EW) 71.22 Cosmos3-Nano 16B: 61.08(最佳开源通用模型) +10.14 分
多模态意图识别 MIR WAF 64.47 Gemini-3.1-Pro: 61.39 +3.08 分
开放词表情绪识别 OV-MER EW F1 68.54 MiMo-v2.5 310B: 65.22 +3.32 分
情感支持对话 ESC 总体效果 Likert 1-5(自动评估) 4.67 Gemini-3.1-Pro: 4.65 +0.02
ESC 拟人化对齐(人类盲评) Win/Tie/Lose % 84.33 / 6.67 / 9.00 Qwen3.5-9B 拟人度胜率 84.33%
基本情绪识别 B-MER(含跨域) Hit Rate 平均 68.61 MiMo-v2.5 310B: 67.11 +1.50 分

局限与改进

作者坦承两点局限:其一,情感表达具有高度的上下文敏感性和文化多样性,而现有可解释数据集大多依赖剧本化的影视片段(如 DFEW、MUSTARD),缺乏真实自然交互场景,可能导致模型在真实场景中泛化不足;其二,框架虽打通了感知-理解-交互,但实际部署需要更广的任务谱系,如连续情绪预测和长期共情陪伴。我额外观察到几个问题:第三,训练和评估高度依赖 LLM 裁判(GPT-4.1-mini、MiMo-v2.5-pro、DeepSeek-v4-flash)打分,裁判模型本身可能存在系统性偏好,文中虽用多裁判取均值缓解,但未充分分析裁判间分歧的来源;第四,ERG 任务在 RL 后信息量反而下降(3.10),作者归因于参考回复简洁,但这暗示奖励信号可能与真实对话质量存在偏差;第五,跨域 B-MER 中 MELD(55.06)和 IEMOCAP(63.15)明显弱于 MER'23/'24(76.03/80.21),说明跨语料泛化仍有较大提升空间。

独立分析的弱点

第一个弱点是 MSU(讽刺理解)样本量极小(仅 552 条,占比 0.4%),可能导致模型在讽刺这一需深层文化语境的任务上泛化脆弱——改进方向是引入更多跨文化讽刺数据并做数据增强。第二个弱点是奖励函数严重依赖外部裁判模型和视频理解模型的质量,$R_{fact}$ 的准确性受限于原子事实提取的覆盖度,若视频模型遗漏关键表情,推理模型可能获得错误的「事实通过」信号——可考虑用多个视频模型集成或引入人类抽检校准。第三个弱点是 ERG 任务 RL 后信息量下降(3.10 vs 商业模型 3.78+),说明当前 S-BERT 语义相似度奖励 $R_{answer}$ 不足以捕捉回复的「有用性」,建议增加信息量或具体性维度的显式奖励。第四个弱点是评估基准仍以英文影视数据为主,缺乏多语言、多文化的真实交互验证,模型在非西方文化场景的适用性存疑——应构建跨文化 in-the-wild 基准。第五个弱点是 ESC 任务明确声明仅为研究原型、不可替代专业诊疗,但模型缺少内置的安全护栏,直接部署存在风险。

未来方向

作者明确提出的未来方向包括:收集多样化的真实世界交互数据、融合生理信号与行为信号、以及扩展到连续情绪预测和长期共情陪伴等更广任务谱系。基于本文成果,我认为还有几个值得延伸的方向:第一,将 OneEmo 的理论驱动推理框架推广到其他需要领域知识的推理任务(如医疗问诊、法律咨询),验证「心理学理论→结构化思维链→RL 奖励」这一范式的通用性;第二,探索在线学习与个性化,使模型能在与用户的长期交互中持续适应该用户的情感模式;第三,研究多任务协同的理论上限——本文实证了协同收益,但尚未给出任务间知识迁移的形式化分析,若能建模任务间梯度冲突与协同的数学关系,可为任务配比设计提供理论指导;第四,将 Emo-Chord 的混合 on/off-policy 策略迁移到其他多模态多任务 RL 场景(如具身智能),检验其作为通用训练范式的普适性。

复现评估

复现友好度较高。代码已开源(github.com/waHAHJIAHAO/OneEmo),附录提供了完整的评估提示词模板、评分细则和训练数据配比表(课程阶段 1/2 与 Emo-Chord 各任务的采样比例),关键超参数(冷启动 5 epoch、学习率 $1 \times 10^{-5}$;RL 2 epoch、GRPO 学习率 $2 \times 10^{-6}$、组大小 8、KL 系数 0.06、$\mu$ 退火 0.5→0.02)均有明确记录。算力门槛适中:仅需 2 张 H800 GPU,骨干为 4.5B 的 Qwen3.5-4B 配合 LoRA 微调,相比动辄数十卡的大模型训练对中小团队友好。数据集 EmoWorld-130K 基于公开数据集构建,且 LoRA 微调已验证可迁移到 InternVL-3.5-4B 等不同骨干。主要复现难点在于:EmoWorld-130K 的构建依赖 Seed-2.0-Lite 生成轨迹和三名心理学研究生的人工修订,完整复刻数据标注成本较高;此外 RL 阶段需要额外的视频理解模型和 LLM 裁判做奖励计算,工程链路较为复杂。