← 返回 2026-08-10

DuplexGen:人机轮替对话的场景自适应合成 DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues

Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim, Dilek Hakkani-Tür 📅 2026-07-28 👍 11 2026-08-15 18:30
LLM校准 人机交互 全双工语音对话 对话数据合成 语音大模型 轮替行为建模

用每场景约20段对话的人类标注校准LLM轮替预测,合成场景自适应的全双工训练数据

前置知识

全双工语言模型(Full-Duplex LM)

支持同时听说、不再严格按一问一答分轮次的语音对话模型,代表如 Moshi、PersonaPlex。模型在用户仍在说话时可随时决定开口插入(barge-in)、附和或继续沉默,通常用流式音频编解码 token(如 12.5Hz 的 Mimi 帧)加文本通道混合建模,PersonaPlex 即基于 Moshi 架构的 Streaming-Transformer,并可通过系统提示控制声音与角色。

本文的最终目标就是让这类模型学到场景自适应的轮替行为;§4.3 的全部实验(PP-DG)都在 PersonaPlex-7B 上进行,理解其工作方式才能读懂数据合成与微调的价值。

话轮转换:floor-taking / backchannel / listen

会话分析(Sacks et al., 1978)的核心概念:说话权(floor)在会话者之间的交接协调。Floor-taking 指听者在转换相关位置(或以打断方式)主动夺取说话权;backchannel(如 uh-huh、I see)是听者表示在听但不夺权的简短反馈,说话人继续;listen/silence 则是保持沉默。三者构成听者响应的基本二分:主动夺权 vs 被动确认。

本文把轮替行为限定为这三种可文本化的听者动作,所有 slot 标注、校准目标、合成标记([TAKE_FLOOR]/[BACKCHANNEL]/[LISTEN])与评测指标都围绕这个动作空间展开。

KL 散度与软标签分布校准

KL 散度 $D_{KL}(P\|Q)=\sum_a P(a)\log\frac{P(a)}{Q(a)}$ 度量两个概率分布的差异。本文不把多人标注压成多数票硬标签,而是将 5 位标注者的投票计数归一化为经验分布 $P_H(a|x,c)$ 作为软标签,训练校准模型最小化 $D_{KL}(P_H\|P_{cal})$,从而保留'多个动作都合适'的人类分歧信息。评价时同样用模型预测分布与人类分布的 KL 作为对齐度。

它既是校准阶段的训练目标函数,又是主实验(Table 6)的核心评价指标,贯穿方法与实验两部分。

口头化置信度(Verbalized Confidence)

让 LLM 直接用文字输出各选项的概率(如 floor_taking=0.2、backchannel=0.5、silence=0.3,约束和为 1),而不是从 token logits 反推置信度。研究发现经 RLHF 微调的 LLM 其 token 概率往往过度自信(Tian et al., 2023),口头化概率能更好地表达模型真实的不确定性,本文用 Pydantic 结构化约束输出格式。

DuplexGen 校准的起点就是 LLM 的口头化轮替预测分布:先让 LLM 猜,再用少量人类标注把这个分布'搬'到人类偏好上。

LoRA 低秩适配微调

冻结预训练权重、只训练低秩增量 $\Delta W=BA$(秩 $r\ll d$)的参数高效微调方法,大幅降低显存与算力需求。本文在两处使用:轮替预测器在 Qwen3 上加分类头用 LoRA r=8、α=16;全双工模型在 PersonaPlex-7B 的 Streaming-Transformer 上用 LoRA r=32、scaling 2.0,嵌入表冻结。

论文所有微调实验都基于 LoRA,理解它才能看懂训练细节、算力开销(1.7B/4B 用 2×48GB GPU,14B 用 4×48GB)以及复现评估。

研究动机

现有全双工语音模型的轮替行为是'一刀切'的,根源在训练数据。第一条路线是人类-人类对话语料(Switchboard、Fisher、CANDOR):它们录到了自然时机现象(Switchboard 超 151 万词、filler 率 3.88%),但语料设计是让互不相识的陌生人聊指定话题,没有任务角色、场景结构和听者动作的 slot 级监督,学不到'此时该不该打断'。第二条路线是启发式规则或 LLM 提示合成的口语对话(Duplex-UltraChat、Behavior-SD、InteractSpeech):可控性和规模都好,但插入的打断与附和从未对照目标场景中的人类偏好做验证——LLM 从预训练继承的轮替先验未经任何校准。结果是家教 AI 和谈判 AI 采用几乎相同的策略:实验中 PROMPT-ONLY 基线在用户几乎每个从句边界都插入 [TAKE_FLOOR]、频繁打断用户;而只用 Switchboard 训练的模型则高估沉默、低估附和。同一句半截话(如 But, I think it is...)在谈判中应立即接话以显主动,在教学中应耐心倾听,现有两类数据都无法表达这种场景依赖性。

本文的目标是本文要构建一个对话合成框架 DuplexGen:只花极小的人工标注预算——每场景约 20 段校准对话、每段抽 2 句、共约 700 个 slot 的五人标注——就把 LLM 的轮替动作预测校准到该场景的人类偏好分布;再用校准后的预测器大规模合成带 [TAKE_FLOOR]/[BACKCHANNEL] 标记的口语对话(最终渲染成 1,623 小时双通道音频),并微调全双工模型 PersonaPlex-7B,使其在 6 个任务上表现出随场景变化、且被人类评估者偏好的轮替行为。核心主张是:让轮替合成'场景化'的关键既不是语料规模,也不是提示设计,而是少量人类校准。

与已有工作不同的是,独特切入是把轮替从'端点预测/延迟最小化'的工程问题重新定义为'场景依赖的社会偏好'问题,并在数据生成侧而非评测侧解决。理论上借鉴会话分析传统(Sacks et al. 1978 的话轮转换理论;Yang 2001 对合作型/竞争型打断的区分),把互动分成合作与竞争两大类、再细化为六个异质任务,使结论覆盖任务导向、知识寻求、社交等不同目标结构和主动权结构。工程上设计'文本对话→口语化改写→候选 slot 识别→人类/LLM 双标注→KL 软标签校准→逐轮合成'的流水线,把人类判断作为校准信号直接注入合成过程。与 temperature scaling 等上下文无关的后处理校准不同,这里的校准函数以对话历史和部分语句为条件,能捕捉轮替的情境性;与 FullDuplexBench、FD-Bench 等基准工作互补,解决的是它们假定的上游问题:场景化轮替训练数据从何而来。

核心方法

直觉:同一个用户半句话,在谈判场景里人类希望 AI 立刻接话显得主动,在教学场景里则希望 AI 附和或沉默以免打断思路——这种判断人类脱口而出,却很难写成通用规则,所以让 LLM 先猜、再用每场景少量人类判断纠正它。技术路线四步:(1) 用 GPT-4.1 把文本对话改写成口语风格转写:用户话轮加缩写、犹豫、filler、自我修复,助手保持清晰无 disfluency;(2) 在用户话轮内识别候选轮替 slot——从句/句子标点边界、犹豫词(um/uh)之后、LLM 标注的逻辑边界,相邻 slot 间隔上限 8 token;(3) 把用户话轮按增量文本块流式呈现给标注者(防回溯偏差),每样本 5 人标注聚成动作分布,同时让 LLM 口头化输出 $P(\text{floor\_taking}, \text{backchannel}, \text{silence})$,再用 Qwen3 加 3 类分类头微调出校准预测器 $P_{cal}(a\,|\,x_{l_j^D},c)$;(4) 合成时逐轮生成对话,在每个候选 slot 用校准预测器决策:插入 [TAKE_FLOOR](截断当前话轮、开启 AI 话轮)或 [BACKCHANNEL](加一句简短附和、话轮继续),否则默认 [LISTEN]。

核心创新是'用分布而非标签做人类校准'。已有资源处于两个极端:人类-人类语料有自然时机但无角色场景监督,提示合成有场景控制但无人类验证;DuplexGen 用极小标注预算把 LLM 对齐到人类偏好分布上。训练目标是 $$\mathcal{L}=\sum_{(c,U^D)\in\mathcal{D}_{cal}}\sum_{l_j\in L^D} D_{KL}\big(P_H(\cdot\,|\,x_{l_j^D},c)\,\|\,P_{cal}(\cdot\,|\,x_{l_j^D},c)\big)$$ 其中 $P_H$ 由 5 位标注者的投票计数归一化得到软标签,保留'多个动作都合适'的人类分歧,而不是丢弃信息的多数票硬标签;校准以对话上下文 $c$ 和部分语句 $x_{l_j^D}$ 为条件,因而能学习情境性差异(对比全局同变换、上下文无关的温度缩放)。与 RLHF 式标量偏好优化也不同:这里对齐的是完整动作分布的形状而不仅是 argmax,这让下游采样能自然复现人类轮替判断的多样性。人类标注仅 120 段对话、LLM 与人类配对即可完成校准,这是与'造更大的语料'在思路上的本质区别。

方法步骤详情

第一步场景策展:按合作/竞争选 6 任务——合作:Socratic 教学(TEA,SocraticLM)、混合主动规划(PLN,MultiWOZ)、面试(INT,Anthropic Interviewer);竞争:谈判(NEG,CraigslistBargain)、说服(PER,DailyPersuasion)、社交闲聊(SOC,SODA 经 LLM 过滤)。第二步口语化改写:GPT-4.1 去括号、加 filler 与重复,对照 Switchboard 验证(用户 filler 3.50% vs 人类 3.88%,重复 0.43% vs 1.39%)。第三步 slot 识别:标点/犹豫词/LLM 插入'|'三路产生候选,连续候选按奇偶位稀疏化,超 8 token 空档每 4 token 补点,平均每话轮 5.57 个 slot。第四步标注与校准:Prolific 招 248 名英美被试,每样本 5 人增量标注;把 Qwen3 的 LM 头换成 $W\in\mathbb{R}^{H\times3}$ 分类头,在候选 slot 的末子词位置对人类软分布算 KL 损失,LoRA r=8、α=16,AdamW lr $2\times10^{-4}$ 训 1 epoch(SWBD+DG 为两阶段课程)。第五步合成与渲染:GPT-4.1-mini 定 slot、Qwen3-32B 写对话、校准预测器插标记,GPT-4.1 零样本分类器过滤角色互换;Chatterbox-TTS(助手)+LibriSpeech(用户)+ElevenLabs(附和)渲染双通道音频,每对话 10 个语音变体,轮间 0.16s、打断为 0.64s 随机重叠,WhisperX 词级对齐,共 1,623 小时。

技术新颖性

三个层面的新颖性。数据层面:首个在 slot 级用人类偏好分布显式校准的场景化轮替合成框架,填补'通用语音语料'与'提示合成对话'之间的空白象限;标注以增量文本块流式呈现,缓解已知的回溯式标注偏差(Umair et al., 2024)。建模层面:把轮替预测从端点二分类/延迟预测升级为上下文条件下的三动作分布匹配,soft-label KL 目标天然容纳轮替的主观性;数据消融显示校准收益在每场景仅 2-6 段对话时就趋于饱和(平均 KL 从 0.412 降到 0.344,全量 20 段为 0.352),说明该框架把'引入人类校准'的边际成本压到极低。系统层面:闭环验证——用合成数据微调 PersonaPlex 后,模型抢话/附和频率的场景间方差显著增大、方向与人类标注规律一致(竞争场景更爱抢话),形成了'偏好→合成→训练→行为'的完整证据链,这是 Duplex-UltraChat 等既往合成数据工作从未做过的验证,也是论文标题里 human calibration 优于 corpus scale 或 prompt design 主张的实证支撑。

Overview of the DUPLEXGEN framework.
Figure 2: Overview of the DUPLEXGEN framework.
Ternary distribution of human annotations for turn-taking actions in the calibration set.
Figure 5: Ternary distribution of human annotations for turn-taking actions in the calibration set.
Example of human turn-taking annotation (backchanneling selected).
Figure 6: Example of human turn-taking annotation (backchanneling selected).
Example of human turn-taking annotation (floor-taking selected).
Figure 7: Example of human turn-taking annotation (floor-taking selected).

实验结果

(1) 场景差异确实存在(§4.1,Figure 3):合作场景附和率更高(TEA 0.32、PLN 0.27、INT 0.25,竞争组约 0.23-0.24),竞争场景抢话率更高(NEG/PER/SOC 0.12/0.12/0.11,合作组 0.05-0.09);成对卡方检验(Holm 校正)显示除竞争组内部外几乎所有场景对差异显著(p<0.05),即竞争任务共享一套轮替规范。(2) 校准大幅提升预测(§4.2,Table 6):评价集上人类-模型分布的 $D_{KL}$,4B 的 SWBD+DUPLEXGEN 平均 0.335,优于 PROMPT-ONLY 0.458(降约 27%)、DG-ONLY 0.616、SWBD-ONLY 0.752(降约 55%);14B 上为 0.360 vs 0.681 vs 1.472。Table 7 揭示 PROMPT-ONLY 的失败模式:其竞争-合作抢话率差仅 +0.008(人类 +0.056、SD 0.032),对场景几乎不敏感;SWBD+DG 恢复到 +0.052(SD 0.029),复现人类分布形状。SWBD-ONLY 虽用 2.4K 段对话(远大于校准集),仍系统性高估沉默、低估附和。(3) 标注预算消融(Table 9):每场景 2 段对话 KL 0.412(比全量差 17.1%),6 段(30%)即 0.344,收益快速饱和。(4) 全双工行为(Figure 4):PP-DG 在 200 个用户话轮上的抢话/附和频率场景间变化明显大于 Moshi 与 PP,竞争场景(NEG/PER/SOC)抢话更强,与 (1) 的人类规律一致。(5) 人评(Table 8):6 场景各 25 段对话,GPT-4.1 评指令遵循平均 PP-DG 3.69 > PP 3.55 > Moshi 2.61(TEA:3.40/2.96/1.44);MTurk 3 人听测轮替自然度 3.56 > 3.48 > 3.41,Welch's t 检验 PP-DG 显著优于 PP(p=0.034)与 Moshi(p=0.0026)。

Cooperative and competitive conversational tasks with reference text datasets.
Table 1: Cooperative and competitive conversational tasks with reference text datasets.
An example of spoken-style utterance.
Table 2: An example of spoken-style utterance.
Proportion of spoken-style aspects with comparison to Switchboard.
Table 3: Proportion of spoken-style aspects with comparison to Switchboard.
Dataset statistics in §4.2.
Table 4: Dataset statistics in §4.2.
The number of turn-taking slots for calibration and evaluation sets across six turn-taking tasks.
Table 5: The number of turn-taking slots for calibration and evaluation sets across six turn-taking tasks.
Mean and SEM of KL divergence on the evaluation split across six turn-taking scenarios.
Table 6: Mean and SEM of KL divergence on the evaluation split across six turn-taking scenarios.
Distribution difference and standard deviation from competitive to cooperative scenarios (4B).
Table 7: Distribution difference and standard deviation from competitive to cooperative scenarios (4B).
Multi-turn dialogue evaluation on a 5-point Likert scale.
Table 8: Multi-turn dialogue evaluation on a 5-point Likert scale.
Effect of the amount of calibration data on test KL divergence.
Table 9: Effect of the amount of calibration data on test KL divergence.
Floor-taking and backchannel frequencies per user turn in full-duplex dialogues.
Figure 4: Floor-taking and backchannel frequencies per user turn in full-duplex dialogues.
查看结构化数据
任务指标本文基线提升
轮替动作分布预测(6 场景平均) KL 散度 $D_{KL}(\text{Human}\|\text{Model})$,越低越好 SWBD+DUPLEXGEN(Qwen3-4B):0.335;14B:0.360 PROMPT-ONLY:0.458(4B);SWBD-ONLY:0.752(4B) 较 PROMPT-ONLY 降低约 27%,较 SWBD-ONLY 降低约 55%
场景区分度(竞争 vs 合作行为差) 抢话率差 $\Delta$ 及标准差 SD(4B 模型,应接近人类) SWBD+DG:$\Delta$=+0.052,SD 0.029 PROMPT-ONLY:$\Delta$=+0.008,SD 0.014;人类参考:$\Delta$=+0.056,SD 0.032 把近乎为零的场景行为差恢复到人类水平的约 93%
全双工模型指令遵循(6 场景,GPT-4.1 评分) 5 分制平均分 PP-DG 3.69 PersonaPlex 3.55;Moshi 2.61 较 PP +0.14,较 Moshi +1.08(Moshi 在教学场景仅 1.44)
全双工轮替自然度(6 场景人工听测) 5 分 Likert 平均(每段对话 3 人评估) PP-DG 3.56 PersonaPlex 3.48;Moshi 3.41 Welch's t 检验显著优于两者(p=0.034 / p=0.0026)
校准数据量消融(6 场景平均) 测试 KL 散度 每场景 2 段对话:0.412;6 段:0.344 全量 20 段:0.352 10% 标注即与全量仅差 17.1%,30% 起收敛,证明标注预算极低

局限与改进

作者承认三点:数据多样性——合成语料只覆盖 6 类场景与两种互动类型,扩大场景面可能同时改善泛化与更广的社会得体轮替行为;训练敏感性——全双工模型行为对数据与超参(轮换延迟、停顿时长、学习率)高度敏感(引 Abe et al., 2026),尚缺稳健训练配方;文本接地监督——校准只消费增量转写文本,未条件化于韵律、停顿时长、语速、重叠或视觉线索,且听测虽然评的是音频输出,并未验证文本偏好与音频条件偏好之间的相关性。我的补充观察:(a) 校准与评价都基于同类型 5 人 Prolific 标注,未报告标注者间一致性,美英被试群体与真实全球用户的文化差异未讨论;(b) 附和的具体措辞由模板约束(mhm/uh-huh 等 10 个候选词),语音表现力受限;(c) PP-DG 每场景训练一个 checkpoint,真实系统需先做场景识别,场景错配的级联误差未被评估;(d) 自然度平均提升 0.08-0.15,统计显著但感知幅度较小;(e) 单轮行为分析用 ChatTTS 重合成用户语音,与真实用户韵律分布存在差距。

独立分析的弱点

(1) 三动作空间过窄:没有'边说边保留话轮'、纠错性打断、礼貌性让话等,而教学中导师打断纠错很常见,backchannel/floor-taking 二分无法表达。改进:扩展为 dialogue-act 更丰富的动作本体并重新校准。(2) slot 识别先于偏好判断:候选点由句法规则决定(8 token 上限、4 token 补点均为经验设定),若人类合意的接话点不在候选集内则无能为力,对长从句语言可能失配。改进:让校准模型在任意 token 位置提出接话点,用弱监督对齐。(3) 无韵律条件:人类是否接受打断强烈依赖语调(升调=话未说完),纯文本校准学不到这类信号。改进:接入音频特征做文本+韵律联合校准(作者也列为未来方向)。(4) 每场景独立 checkpoint:六个 PP-DG 无法在无场景标签时部署,开放域需先做场景路由,引入额外误差源。改进:训练场景条件化的单一模型,用系统提示指定 persona(PersonaPlex 本身支持该机制)。(5) 指标自洽风险:校准目标与评价指标同为 KL 分布匹配,天然偏爱本校准框架;人评自然度提升 0.08-0.15 虽显著但幅度小,提示 slot 级对齐到音频行为存在迁移损耗,需要更多行为级下游评测。

未来方向

作者明确提出三个方向:扩展场景与互动类型的多样性以提升泛化和社会得体性覆盖;开发对轮换延迟、停顿时长、学习率稳健的全双工训练配方;开展配对文本/音频标注与多模态校准(韵律、停顿、语速、重叠、视觉线索)。基于本文成果还可延伸:(1) 跨语言与文化:把框架用于轮替规范不同的语言(如日语密集的 aizuchi 附和、汉语更高的话轮重叠容忍度),检验校准信号的文化可迁移性;(2) 在线自适应校准:从对话中用户的实时反应(打断、负面反馈、重复请求)持续更新轮替策略,实现个性化 turn-taking 而非静态场景规范;(3) 与 FullDuplexBench、FD-Bench、Talking Turns 等基准串联,形成'合成→校准→评测'的标准数据闭环;(4) 用偏好优化(DPO/RLAIF)替代监督式 KL 校准,直接以人类分布或成对偏好为奖励信号;(5) 解释性研究:探究为何竞争场景共享统一轮替规范(Figure 3 中竞争组内部无显著差异),抽象出对抗性对话的通用规律;(6) 将修复行为(repair、澄清、道歉)纳入动作空间,覆盖会话分析中更完整的听者响应谱系。

复现评估

复现门槛中等偏高但路径清晰。有利因素:项目网站 duplexgen.github.io;6 个源数据集全部公开且许可明确(Apache:SocraticLM;MIT:MultiWOZ、CraigslistBargain;CC-BY-4.0:Anthropic Interviewer、SODA;CC-BY-SA-4.0:DailyPersuasion);附录给出算法伪代码、全部 7 个提示词(口语化、slot 识别、口头化估计、逐轮合成、附和插入、SODA 过滤)、标注指南与界面、训练细节(预测器 LoRA r=8/α=16、AdamW lr 2e-4、1 epoch;全双工 LoRA r=32、lr 1e-5、OneCycle 5% warmup、bf16、FSDP)与算力(1.7B/4B 用 2×48GB GPU,14B 用 4×48GB)。不利因素:需组织真实人类标注(248 名 Prolific 被试、每样本 5 人、20 题约 12 分钟酬 £2),流程与质控繁琐;依赖 GPT-4.1/4.1-mini、Qwen3-32B、Chatterbox-TTS、ElevenLabs、WhisperX、PersonaPlex-7B 等闭源或较新组件,语音工程链长;1,623 小时音频的合成、存储与微调成本可观;论文未明确承诺代码与标注数据开源(仅项目网站),KL 类指标需原始标注才能逐位复现。总体:文本侧复现容易,语音侧与统计验证需数周级工程与数千美元预算。