Gander:统一全模态感知、实时全双工交互与智能体执行的端到端交互智能体技术报告 Omni Interaction Agent Technical Report
双脑架构+流式分块扁平化,让一个端到端模型同时胜任全双工语音交互和长程智能体任务。
前置知识
全双工交互(Full-Duplex Interaction)
指语音对话系统不再严格遵循「用户说完—系统再答」的轮次制(turn-based),而是像人一样可以边听边说:用户可随时打断模型,模型也可主动插话、给出简短附和(backchannel,如「嗯嗯」「对」)。系统需要自行判断当前该继续听、开口说话还是中断自己正在说的内容,这些「交互时机」决策本身就是建模对象。
本文的核心命题就是「交互性必须是模型的内在能力」,全双工是理解其分块建模与控制 token 设计的前提。
Thinker-Talker 架构
一种语音大模型解耦设计:Thinker 是 LLM 主干,负责理解与文本规划;Talker 是轻量语音解码器,把 Thinker 的隐状态转成离散语音 token 再合成波形。这样 LLM 不必逐帧自回归生成高帧率的音频 token,既保住语言能力又降低解码开销。MiniCPM-o、Qwen-Omni 等均采用此设计。
Gander 的小脑(前端交互模型)正是建立在 Thinker-Talker 之上,理解它才能看懂 3.3 节的架构与语音生成管线。
语义语音 token 与流匹配(Flow Matching)
神经语音编码器(如语义离散 token)把语音压缩成单码本、低码率的离散单元,适合自回归预测;流匹配则是一种生成式建模方法,学习从噪声到目标梅尔谱的连续概率流速度场,逐步把噪声「搬运」成谱图,再经声码器得到波形,可做流式分块解码。
Gander 的语音生成是「语音 token 解码器 + 流式流匹配解码器」两段式,零样本音色控制也来自参考音频条件化,读懂语音输出路径需要这两个概念。
智能体编排(Agent Orchestration / Harness)
指把 LLM 变成能执行长程任务的智能体所需的外围系统:任务生命周期管理、工具调用、权限控制、并发与工作区隔离、结果回传等。典型如 Codex、Claude Code 的后端运行时,通过 task 状态机和 worker 适配器把「请求」变成可持续推进、可中途纠正的执行过程。
Gander 的大脑就是免训练复用这类现成智能体,中间的编排运行时是全文架构三大件之一,不懂它就看不懂脑-小脑协作。
流式多模态感知与 token 预算
实时系统中视频、音频以固定窗口持续到达,编码器必须增量产出 token;由于 LLM 上下文和算力有限,需要压缩(如时间下采样、视觉 token 重采样)来控制每秒 token 数,使感知速率与解码吞吐匹配。常见做法包括任意分辨率切分、query-based resampler、MLP 时间降采样等。
Gander 小脑要做到持续监听画面与声音,其视觉 16 倍压缩、音频 5 倍降采样等设计都是围绕实时 token 预算展开的。
研究动机
当前人类与 AI 的交互仍以文本化、轮次制为主:用户发指令、模型应答,一次一个来回。这与人类之间流畅协作的沟通方式——边听边说、随时打断、观察环境、主动插话——存在本质差距。现有语音对话系统大多依赖外部 VAD(语音活动检测)和 ASR 级联来决定「何时轮到模型说话」,例如典型流水线是 Whisper 转写 + GPT-4o + TTS,端点检测只看声学静音,一旦用户思考停顿就会被抢话,论文在 Full-Duplex-Bench v3 上实测这类级联系统的打断率高达 33.0%。而在复杂场景(多人对话、背景噪声、附和语「嗯嗯」并不代表任务结束、任务执行中用户追加约束)下,这些外部模块几乎无法可靠工作。另一个矛盾是:实时对话要求低延迟即时响应,而复杂智能体工作流要求长程推理、规划与工具执行,把两种需求塞进一个单体模型会造成响应速度与智能水平的内在权衡——对话模型不够聪明,聪明的模型不够快。论文由此提出两个根本问题:交互性到底是外部编排层的功能,还是必须内生于模型?单一模型能否同时提供实时交互的低延迟和长程智能体任务的深度推理?
本文的目标是本文要构建一个名为 Gander 的端到端全模态交互智能体(Omni Interaction Agent),在单一框架内同时实现三项能力:(1)覆盖语音、视觉、文本的全模态流式感知与理解;(2)连续、低延迟、双向的全双工交互,支持用户随时打断、模型主动反馈与追问,并在噪声、多人对话等复杂声学环境下保持鲁棒;(3)面向上下文推理、自主规划、工具调用与任务执行的智能体能力。关键设计目标是让交互时机决策内生于模型自回归过程(无需外部 VAD),同时让负责复杂推理的大脑可以免训练、即插即用地替换升级——底座推理模型变强,整个系统直接受益,无需重训交互模型。评测上覆盖对话能力、全模态理解、交互能力和智能体四个维度,并在 Full-Duplex-Bench v3 的 100 个场景中与 GPT-Realtime、Gemini Live 等商业系统直接对比。
与已有工作不同的是,本文的独特切入角度有二。其一是把「交互性」从系统外挂变成模型内生:不同于 BayLing-Duplex 仅用少量状态 token 处理语音轮次、也不同于依赖 VAD 的级联方案,Gander 把用户输入和模型输出统一拉平到同一时间轴上的分块 token 流,让模型在每个 1 秒块内先预测一个控制 token(听/说/打断),把「要不要说」和「说什么」解耦成两步预测,交互行为直接从感知流中涌现。其二是脑-小脑解耦的规模化视角:已有语音智能体(如 Qwen Audio Agent)把语音仅当作外部智能体的输入输出接口,交互状态与任务执行彼此割裂;Gander 则让小脑持续维护活交互上下文、通过结构化工具调用(task_start/task_send/task_resolve)把任务委派给免训练的大脑,并用中间编排运行时把任务目标绑定到经过认证的用户输入上,而非小脑自行生成的工具参数——这解决了语音智能体「听到的话」与「执行的任务」不一致的隐患。此外,配套构建了 260.8K 条显式标注打断与附和事件的全双工训练数据,而轮次制语料中这类事件天然缺失。
核心方法
打个比方:Gander 像一个有「小脑」和「大脑」的人。小脑负责脱口而出的对话——边听边说、插话附和、察言观色;大脑负责慢工出细活——查资料、写代码、跑测试。中间还有一个「神经传导系统」(智能体编排运行时)负责传令与协调。技术路线分三层:前端小脑是一个 9B 的实时全双工全模态模型(基于 MiniCPM-o 4.5 初始化的 Thinker-Talker 架构),流式接收语音、摄像头和屏幕输入,自回归地决定听、说、简短反馈、打断或调用工具;后端大脑是免训练的通用任务执行智能体,用 Codex 或 Claude Code 这类现成系统实例化(实验中由 GPT-5.6 驱动的 Codex worker 实现);中间的编排运行时统一管理实时多模态推理调度与异步后台任务编排,把小脑发出的任务操作绑定到传输层确认的用户轮次上。小脑持续维护活交互上下文,遇到需要长程推理的任务就通过结构化工具调用委派大脑,大脑异步执行并通过 share 接口回传中间进展或最终结果,小脑再把结果合成为口语化的自然回复。
最核心的创新是「流式分块扁平化」(Streaming Chunk Flattening)。Gander 把连续交互切分成固定 1 秒窗口,每窗口组装一个 chunk,chunk 是三段按时间对齐的扁平拼接:该秒内观测到的音频+视觉 token、一个控制 token、以及模型选择输出的 $N$ 个文本 token($N$ 可为 0)。所有 chunk 串成一条因果 token 序列交给标准 LLM 主干消费——用户请求不再是特权角色,感知输入成了「持续观测的世界状态」。每个 chunk 内模型先注意最新感知 token 再生成输出,控制 token 取三值之一:listen(本秒保持沉默继续观察,无文本输出)、speak(本秒生成语音内容)、interrupt(当上下文变化使正在进行的回答过时时主动叫停)。由于「是否说话」的离散决策先于「说什么」的内容生成,二者解耦,作者发现这比在一步中纠缠两者能得到更稳定的全双工行为——打断时机可以推迟到语义完整而非仅声学安静的时刻,这正是级联系统 VAD 做不到的。配合 128 chunk(约 2 分钟)的滑动上下文窗口,推理成本在任意长会话中保持恒定。另一关键设计是大脑免训练即插即用,推理能力升级可直接传导到整个系统。
方法步骤详情
完整流程如下。第一步流式感知:视觉通路对每帧做任意分辨率切分(最高 448×448),每个切片经 SigLIP ViT 独立编码,再用 query-based resampler 压缩到每片少量固定 token(相对原始 patch 网格约 16 倍压缩,远激进于以往全模态模型的 4 倍);声学通路由流式分块语音编码器输出约每秒 50 帧特征,经轻量 MLP 做 5 倍时间降采样至约 10 token/秒。第二步分块组装:每 1 秒窗口把两类 token 与控制 token、生成的文本 token 扁平化为一个 chunk,128 chunk 滑窗维护约 2 分钟上下文。第三步交互决策:主干预测控制 token,listen 则本块无输出;speak 则输出 $N$ 个文本 token 送往语音合成;interrupt 则中止当前播报;需要委派时输出形如 {"name": "tool_state", ...} 的工具调用。第四步语音生成:主干末层隐状态经投影后与文本 token 一起送入小型自回归语音 token 解码器(监督语义 token、单码本低码率),再由流式流匹配解码器以系统提示中的参考音频为条件重建梅尔谱并渲染波形,分块因果地边到边播,实现零样本音色控制。第五步任务委派:task_start 创建后台任务,task_send(main 注入主任务 / fork 只读旁路查询)支持中途追加约束,task_resolve(cancel/allow_once/allow_session/deny)做确定性生命周期控制。第六步大脑执行:编排网关管理 Project/Task/Run/WorkerEvent/Delivery 五类实体,默认经 Codex app server 以持久线程执行,大脑可用 context_fetch、memory_search、share 三个运行时接口;小脑最后把结果总结为口语化回复交付。
技术新颖性
与已有工作的本质区别体现在三处。其一,相对 Moshi、GPT-Live 这类并行双流全双工模型和 BayLing-Duplex 的状态 token 方案,Gander 的分块扁平化把视觉、听觉、文本输入与输出统一进单一因果序列,且控制决策显式前置——「预测先于生成」的解耦设计是其全双工稳定性的来源,也与 MiniCPM-o 4.5(其基座,Omni Flow 但无智能体层)形成代际差异。其二,相对把语音仅当接口的 Qwen Audio Agent 和 Claude Voice Mode 等产品化方案,Gander 把交互状态内建模:打断、附和、多人场景下的倾听状态都由模型在 chunk 级自行学习,任务委派通过特殊 token 包裹的结构化工具调用暴露,且运行时把任务目标锚定在认证过的用户轮次而非小脑自由生成的参数上,这在安全性和一致性上是新的工程贡献。其三,数据层面,InteractionSpeech 流水线显式合成竞争性打断(带「隐藏续写」——被截断的话在文本上保留但绝不合成出声)与支持性附和(严格定义为嵌入对方话语内、中文 8 字/英文 6 词以内的短应答,配 266 中文+170 英文双语词库),并给每个回合标注全局起始时间、时长和重叠区间,使交互时机成为显式监督信号,这在此前语料中并不存在。
实验结果
评测用单一 Gander checkpoint(9B),小脑系统提示与训练时逐字节一致,无任何针对基准的调参。第一,全双工交互(Full-Duplex-Bench v3,100 个含工具调用的口语服务场景):Gander 取得全表最佳轮次行为——100.0% 的场景在恰当时机接话(与级联基线并列第一),提前打断仅 8.0%,远优于 GPT-Realtime 的 13.5% 和最弱基线 Ultravox 的 47.9%;四个任务精度指标略落后(Pass@1 0.400 vs GPT-Realtime 0.600,ToolSel 0.759 vs 0.876)。关键的消融是「仅大脑」行:绕过小脑和语音通路、直接用转写文本驱动同一 Codex 智能体时,ToolSel 达 0.934 超过包括 GPT-Realtime(0.876)在内的所有系统,Pass@1 0.520、RespQual 0.740——证明执行层不是瓶颈,端到端差距来自「何时委派」的决策与 ASR 转写误差(RespQual 从 0.740 掉到 0.490 与此一致)。51.6% 的填充词率是唯一未领先的交互指标,作者解释为系统在委派任务运行期间不能沉默、需持话等待,反映委派频率而非时机缺陷。第二,口语对话(SpokenQA + VoiceBench 共 2,052 条):在全双工组内 Llama Questions 75.60、Web Questions 59.30 均列第一,领先 Audio-Interaction 8.29 和 4.96 分、领先 Moshi 逾 13 和 33 分;放在九个系统全场(含非流式轮次制模型)仍排第二(比 Baichuan-Omni-1.5 低 2.90、比 Qwen2.5-Omni-7B 低 3.50),说明逐帧流式约束本身没有损耗基座的知识;但 AlpacaEval 3.96 和 SD-QA 46.84 仅列全双工组第二。整个过程大脑零次被调用,路由策略只升级长程工具任务。第三,全模态理解(WorldSense 3,172 题 + Daily-Omni 1,197 题,共 13,107 次推理):Gander 得 49.62/78.53,Daily-Omni 距基座 MiniCPM-o 4.5(80.20)仅差 1.67 分且领先 Qwen3-Omni 的 70.70,WorldSense 回退 6.08 分——视觉塔全程冻结逐位不变,回归主要因交互语料中的视频多为「无关上下文」负样本。模态消融显示真实融合:Daily-Omni 上音视频联合 78.53 对最佳单模态 59.40 提升 19.13 分,WorldSense 提升 5.01 分,且两单模态基线仅差约 1.5 分,说明并非依赖单一主导模态。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 全双工工具交互(Full-Duplex-Bench v3,100 场景) | 接话时机正确率 Take-turn ↑ | 100.0 | GPT-Realtime 96.0;级联 Whisper→GPT-4o→TTS 100.0 | 与级联基线并列第一,超过 GPT-Realtime 4 个百分点 |
| 全双工工具交互(Full-Duplex-Bench v3) | 过早打断率 Interrupt ↓ | 8.0% | GPT-Realtime 13.5%;Gemini Live 3.1 19.2%;Ultravox 47.9% | 全表最低,比 GPT-Realtime 低 5.5 个百分点 |
| 全双工工具交互(Full-Duplex-Bench v3) | 工具选择 F1(ToolSel) | 0.759(端到端);仅大脑 0.934 | GPT-Realtime 0.876;Gemini Live 3.1 0.817 | 端到端落后 0.117,但文本驱动大脑通道全表第一 |
| 全双工工具交互(Full-Duplex-Bench v3) | 严格 Pass@1(工具多重集与参数全对) | 0.400(端到端);仅大脑 0.520 | GPT-Realtime 0.600;级联 0.450 | 端到端落后 0.200,文本通道超级联 0.070 |
| 口语知识问答(SpokenQA Llama Questions) | 准确率 % | 75.60 | 全双工组最佳 Audio-Interaction 67.31;全场最佳 Baichuan-Omni-1.5 78.50 | 全双工组 +8.29 分;全场第二(-2.90) |
| 口语知识问答(SpokenQA Web Questions) | 准确率 % | 59.30 | Audio-Interaction 54.34;Moshi 26.30;Qwen2.5-Omni-7B 62.80 | 全双工组 +4.96 分;全场第二(-3.50) |
| 全模态视听理解(Daily-Omni,n=1,197) | 准确率 % | 78.53 | 基座 MiniCPM-o 4.5 80.20;Qwen3-Omni 70.70 | 仅回退 1.67 分(保留率 98%),领先 Qwen3-Omni 7.83 分 |
| 全模态视听理解(WorldSense,n=3,172) | 准确率 % | 49.62 | 基座 MiniCPM-o 4.5 55.70;Qwen3-Omni 54.00 | 回退 6.08 分(作者归因于交互语料以无关视觉负样本为主) |
| 模态融合消融(Daily-Omni) | 融合增益 AV − max(Video, Audio) | +19.13(78.53 vs 视频 59.40 / 音频 57.81) | 最佳单模态 59.40 | 证明真跨模态融合,且两单模态仅差 1.59 分 |
局限与改进
作者承认的局限:其一,端到端的任务精度指标落后(Pass@1 0.400 vs GPT-Realtime 0.600),但通过与仅大脑行(0.520)对比把瓶颈定位在委派决策与语音链路 ASR 误差,而非架构本身;其二,51.6% 填充词率偏高,系统在委派任务运行期间无法保持沉默;其三,WorldSense 回退 6.08 分,作者坦承这是当前权衡——交互语料奖励的「联合演化流推理」(Daily-Omni 类)几乎无损保留,而它从不奖励的静态片段细粒度属性检查(计数、定位)承当了全部代价;其四,两脑之间目前主要靠 ASR 派生文本信号通信,丢弃了副语言信息;其五,尚未做 on-policy 蒸馏或强化学习后训练,也没有统一的 Omni Interaction Agent 评测基准(现有基准把理解、双工、智能体割裂评估,各表分数不可互换比较)。我自己的观察:填充词率 51.6% 与打断率 8.0% 的组合其实暴露「宁可不打断也要等」的保守策略,在需要快速抢话的场景(紧急叫停)可能反应迟滞;448×448 的分辨率上限直接制约 WorldSense 这类细粒度视觉任务;所有交互能力证据都来自单一内部评测套件与项目网站演示,缺少多人/噪声场景的公开定量结果。
独立分析的弱点
第一,大脑依赖闭源外部服务:实验中大脑由 GPT-5.6 驱动的 Codex 实现,意味着开源的 Gander 权重开箱并不能复现论文报告的智能体成绩,且部署方需承担 API 成本、延迟和数据外泄风险;改进方向是为大脑训练一个开源中等规模推理模型,或至少提供本地可跑的 worker 模式并报告其性能梯度。第二,两脑通信是有损压缩:传给大脑的是「转写文本 + 相关末帧」,副语言线索(犹豫、情绪、紧迫感)和完整视觉历史全部丢失,用户在嘈杂环境中低声补充的约束很可能传达失真;改进方向是让大脑可回放原始音视频片段(context_fetch 已有雏形,可扩展为多模态事件检索),或训练小脑输出结构化任务简报而非裸转写。第三,2 分钟/128 chunk 的滑动窗口与长程任务天然矛盾:一个跑 20 分钟的代码任务期间,用户早前的关键约束会被滑出窗口,只能靠 memory_search 挽救,论文未评估超长会话下的遗忘行为;改进方向是把任务状态外置为显式 Task Ledger 并在每次委派时强制注入。第四,委派与总结的鲁棒性依赖数据分布:agentic 数据中 omni 类仅 36K 条(占 1.33%),复杂视听工作流的泛化能力存疑,改进方向是扩大 GUI/视觉智能体轨迹数据并引入在线 RL。第五,无外部可比的多人/噪声定量基准:Table 2 有 8.8K 多方对话和 64.7K 抗干扰数据,但实验章节没有任何对应指标,这部分能力目前只有定性 demo 支撑。
未来方向
作者在结论中列出五个方向:(1)数据与模型Scaling——智能体调用与对话行为对训练数据分布仍敏感,将在工业级基座模型 Hy-Realtime 上做系统性扩展;(2)稳定后训练——引入 on-policy 蒸馏(OPD)与强化学习处理长程全模态交互场景,重点解决奖励设计、credit assignment 和优化稳定性,尤其是双脑架构下「局部交互质量」与「全局任务目标」的协调;(3)脑-小脑架构探索——超越 ASR 派生信号,构建更丰富的结构化双向通信,包括大脑到小脑的信息传递和小脑到大脑的有效反馈;(4)记忆与长上下文管理——面向长多模态历史、工具调用与演化任务状态,开发跨长时交互保留与检索任务相关信息的机制;(5)统一评测——现有基准割裂评估全模态理解、双工交互和智能体执行,无法度量脑-小脑协作质量,急需统一的 Omni Interaction Agent 评测框架。基于本文成果可延伸的方向:把免训练大脑替换为经过交互对齐的开源推理模型以摆脱闭源依赖;将 chunk 级控制 token 推广到具身机器人或 AR 眼镜的低延迟多模态交互;利用 Task Ledger 结构做跨会话任务恢复与多人协作调度。
复现评估
复现条件中上。有利因素:作者承诺开源模型权重、代码和数据(GitHub 与项目页面),前端小脑是 9B 模型(基座 MiniCPM-o 4.5 公开),全双工评测用公开的 Full-Duplex-Bench v3 及其未修改的评分脚本,口语与理解评测均用公开基准和官方 harness, decoding 参数、流式单元格式全部固定,WorldSense/Daily-Omni 评测是确定性贪心解码。不利因素:其一,大脑默认经 Codex app server 由 GPT-5.6 驱动,Table 3 的智能体成绩依赖闭源 API,完整复现需要付费访问;其二,数据管线依赖 DeepSeek-V4-Pro、Qwen3.5-297B-A17B、Qwen3-TTS 等模型做对话合成、时间对齐和配音,即便数据开源,从头重建 2.7M 语料需要大量 API 预算;其三,论文完全未披露训练算力(GPU 数量、时长、训练超参),从头预训练/继续训练 9B 模型处理 2.7M 样本需要可观的集群资源;其四,交互能力中多人对话、抗噪、附和等只有内部人评和网站 demo,第三方难以客观验证。综合判断:微调或基于其权重的应用开发可行性高;完整复现论文指标需要闭源 API + 多卡训练资源,难度中等偏高。
论文图表
用五组场景速览展示 Gander 的能力面:边聊边干活的智能体工作(修 bug 时可中途追加「保持 Python 3.12 兼容」约束)、屏幕对话(解释文件超限警告)、附和与打断(「嗯嗯」附和不终止任务、随时叫停修改 Slide 4)、多人对话与噪声鲁棒性(总结讨论时聚焦发布风险)、主动视觉提醒(持续监控幻灯片并在结果页出现时告知用户)。图中区分了实时交互(LIVE INTERACTION)与异步执行(ASYNCHRONOUS EXECUTION)两条时间线。
一图定义了「全模态交互智能体」这个新范式的完整能力清单,是理解论文要做什么、后文数据构造和评测维度为何如此设计的总纲。