GigaChat Audio:时间感知的大型音频语言模型 GigaChat Audio: Time-aware Large Audio Language Model
提出GigaChat Audio,支持120分钟长音频的时间锚定问答与摘要
前置知识
音频条件化大语言模型(Audio LLM)
指一类把音频/语音作为输入条件直接接入大语言模型、使其能对音频内容做指令遵循、问答、转写等任务的多模态系统。典型架构含音频编码器→子采样器→投影器,把连续音频嵌入对齐到文本嵌入空间(本文用 160ms 帧率),再由 LLM 自回归处理。代表模型有 Qwen3-Omni、Voxtral、GPT-4o、Gemini。
本文在此架构上做时间感知改造,理解音频 token 如何进入 LLM 才能理解为什么要插入 inter-timing 标记
时间接地(Temporal Grounding)
指模型把一段自然语言描述的事件定位到音频/视频中具体时间区间(start, end)的能力,常用 mIoU(预测与参考区间的交并比)和区间中点 MAE(秒)评估。它是可验证性原语:用户据此跳转到支撑证据。本文聚焦长录音(最长 120 分钟)的时间接地。
时间接地是本文三类核心任务之一,也是绝大多数实验与消融的评估对象,读懂它才能理解所有表格
混合专家模型(MoE)
Mixture-of-Experts 是一种稀疏激活架构,每个 token 只激活少数专家子网络,从而在扩大总参数量的同时控制计算量。本文基座为 $10B\text{-}A1.8B$ 的 MoE 文本模型,意为总参 100 亿、每 token 激活约 18 亿参数,并配 256k token 上下文窗口。
理解基座规模与上下文长度,才能理解为何能处理 120 分钟音频、以及 inter-timing token 开销对上下文的挤占
Inter-timing(间时标记)
本文核心机制:在连续音频 token 流中周期性插入的时间标记,作为模型可引用的时间锚点,可写成纯文本 hh:mm:ss 或专用 timing token。默认每 60 秒插入一次,并在每段音频末尾追加一个最终标记。消融证明它是长录音接地的关键。
这是论文最核心的创新点与命名由来,所有频率/格式/token 化消融都围绕它展开
级联合成数据流水线
用文本 LLM(GPT-OSS-120B)在带时间戳的转录上批量生成 (Q,A) 监督的流程:先把长录音切成约 10 分钟转录片段(缓解问题前载偏置),再生成问答对,最后用一个独立的全局验证器读取完整转录并过滤不一致的生成;评估集还对同一问题采样五个答案并用中位重叠阈值剔除错误样本。
长录音人工标注成本极高,这套流水线是让时间监督规模化训练的关键,也是本文主要贡献之一
研究动机
现有的音频条件化大语言模型(如 GPT-4o、Gemini、Qwen3-Omni、Voxtral)虽能直接从语音和音频执行指令,但在长录音场景下的时间接地能力仍不可靠。会议、播客、讲座、呼叫中心日志等通过交互界面消费的长录音中,用户需要提问、请求摘要并导航到特定证据片段,此时时间接地不是装饰性功能而是可验证性的基础原语——系统不仅要回答'发生了什么',还要回答'何时发生',让用户能跳转到支撑证据。然而现有模型常生成看似合理的内容,却输出无法解析的时间戳、过于粗糙的时间引用或无依据的时间声明。核心挑战在于时间并未在标准音频 token 流中自然表示,长录音进一步加剧了模型内部表示与面向用户时间戳输出之间的失配。具体数据上,Qwen3-Omni 在 20–40 分钟接地任务上 mIoU 跌至 3.6,在 AMI 会议语料上区间 MAE 高达 290.5 秒;TimeAudio 在超过两分钟的音频上退化,频繁产生 UNK 和不可解析时间戳。
本文的目标是本文的目标是提出 GigaChat Audio,一个时间感知的音频条件化大语言模型,支持最长 120 分钟的输入,并产生带显式时间戳的回答、片段描述和摘要。作者围绕三个实践问题展开:(i) 在音频 LLM 的输入输出接口中,表示时间的最小且稳健方式是什么?(ii) 对人工标注成本极高的长录音,应如何大规模生成时间监督?(iii) 仅在单一时长区间训练的时间模型能否泛化到其他长度?整体目标是在保持端到端音频理解能力的同时,为长录音提供可验证、可解析、粒度精确到秒的时间接地能力,使模型能在长达两小时的音频中准确指出事件发生的时间区间,并支撑片段描述与多段时间锚定摘要。
与已有工作不同的是,本文的独特切入角度是在连续音频 token 之间周期性地插入'inter-timing'(间时)标记作为时间锚点,并用级联合成数据流水线从带时间戳转录生成监督。与 WhisperX、VibeVoice-ASR、MOSS Transcribe Diarize 等聚焦转写为中心目标的方法不同,本文聚焦开放式问答和摘要且显式锚定在时间上;与 TimeAudio、Clotho-Moment、CASTELLA 等聚焦短音频事件接地的方法不同,本文聚焦长达 120 分钟的长录音并系统研究时间表示、锚点频率、token 化和时长混合等设计选择。此外,作者通过切片生成(约 10 分钟转录片段)缓解问题生成的前载偏置,用全局验证器强制一致性、多采样聚合提升评估鲁棒性,这些都是已有 LALM 工作较少系统分析的方面。
核心方法
方法整体思路是给一个 $10B\text{-}A1.8B$ 的混合专家文本基座(256k 上下文)挂接一个音频前端,再在带显式时间信号的音频 SFT 数据上微调。音频栈采用编码器→子采样器→投影器结构,配合 FlashAttention 和编码器中的分块注意力(8 秒块、40ms 步长),产生与文本嵌入空间在 160ms 帧率对齐的连续音频嵌入。音频编码器预训练沿用前作 GigaAM 的 HuBERT 式设置,用 2M 小时未标注多语种音频、以 KMeans 分布作为蒸馏目标。为显式表示时间,模型在连续'音频 token'间以每 60 秒一次的频率插入 inter-timing 标记(可写纯文本 hh:mm:ss 或专用 timing token),并在每段音频序列末尾追加一个最终标记。基座后训练数据覆盖字幕、多轮对话、情感识别和通用语音任务的异质混合,并在所有时间消融中保持该基座混合固定以隔离时间设计的影响。
核心创新点是'周期性时间锚点'这一表示机制,及与之配套的级联合成监督流水线。与已有方法本质不同:既不依赖事后对齐(如 WhisperX 词级时间戳),也不像音频瞬间检索那样在短片段上接地,而是把时间标记直接编织进输入 token 流,使模型在自回归生成中能引用这些锚点。作者用文本 GPT-OSS-120B 在约 10 分钟转录切片上生成 (Q,A) 对,切片是为缓解问题集中在录音开头的强前载偏置;独立的全局验证器读取完整带时间戳转录并过滤不一致生成;训练/评估在音频级别划分以避免泄漏。评估集上对同一问题采样五个答案变体、提高采样温度,并用区间重叠中位数阈值剔除错误样本,其余任务用基于 LLM 的聚合。这套机制让大规模、可控的时间监督成为可能。
方法步骤详情
完整流程分若干阶段。数据准备:取 YODAS2 六个英语分片(24k 小时),用 SpeechBrain VoxLingua107 ECAPA-TDNN 过滤保留 $p(\text{English})>0.7$ 的样本(得 16k 小时),再用 WhisperX 得词级时间戳并估算静音比,按阈值过滤(得 14k 小时),按时长(≤20/20–40/≥40 分钟)分桶并平衡。音频编码器预训练后进入音频 SFT,固定 $\mathrm{lr}_{dec}=5\times10^{-6}$、$\mathrm{lr}_{enc}=10^{-4}$。合成数据生成:对长录音用约 10 分钟切片喂给 GPT-OSS-120B 生成 (Q,A),全局验证器读取完整转录并过滤不一致项。三类时间任务:时间接地(预测事件区间)、片段描述(给定区间生成描述)、带时间戳摘要(模型自定分段边界)。评估:接地用 mIoU 和区间中点 MAE;描述与摘要改用可访问完整转录的 LLM-as-judge 协议,摘要另报 Tm/Acc/Err/Style 四维及 round segments 比例。
技术新颖性
技术新颖性体现在四点。其一,把周期性 inter-timing 标记作为输入流中的显式时间锚点是本文区别于其他 LALM 的核心机制,消融证明移除它会使 20–40 分钟长录音接地 mIoU 从 53.8 崩塌到 14.2。其二,切片生成 + 全局验证器 + 多采样聚合的级联流水线系统缓解了长录音合成数据的前载偏置与噪声。其三,对时间表示做细粒度解耦消融:纯文本 hh:mm:ss 在大多数 timing 数据比例下优于专用 timing token(后者需约 50% 比例才追平),分钟索引格式在压缩 token 开销的同时接近 hh:mm:ss。其四,时长混合训练的长度外推分析揭示不对称泛化:仅在短音频上训练无法外推到长录音,仅在长音频上训练损害短音频表现,需混合时长。这些都是已有时间感知音频工作很少系统提供的证据。
实验结果
核心发现集中在 Table 1–4 与 Figure 3。Table 1 显示强短片段表现不能转化为长录音接地:Qwen3-Omni 在 20–40 分钟 TGr 仅 3.6 mIoU、AMI MAE 290.5 秒,本文(inter=60s)保持 53.8 mIoU、AMI MAE 3.5 秒;inter=7s 后长录音 TGr 升至 65.2。摘要时间结构 Tm 达 76.7,远超 Qwen3-Omni 的 43.7。移除 inter-timings 后长录音 TGr 暴跌至 14.2,印证锚点关键。Table 2 显示专用 timing token 需约 50% 比例才追平纯文本在 16.7% 处的 57.5 mIoU。Table 3 表明锚点越密越好但更耗 token:7s 锚点 mIoU 63.0、MAE 1.5 秒、占比 16%,60s 锚点 mIoU 50.9、MAE 3.0 秒、占比 1.9%。Table 4 表明纯秒格式严重退化(20.9 mIoU),分钟索引接近基线。Figure 3 揭示外推不对称,混合时长训练在各评估长度上最优。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 长录音时间接地 TGr(20–40 分钟) | mIoU | 53.8(inter=60s)/ 65.2(inter=7s) | Qwen3-Omni-30B: 3.6 | +50.2 / +61.6(inter=7s) |
| AMI 会议语料短语定位(15–50 分钟) | 区间 MAE(秒,↓) | 3.5(inter=60s)/ 1.5(inter=7s) | Qwen3-Omni-30B: 290.5 | -98.8% |
| 长录音时间接地(消融:移除 inter-timing) | mIoU(20–40 分钟) | 53.8(含 inter-timing) | 本文 w/o inter-timings: 14.2 | +39.6,证明锚点不可或缺 |
| 带时间戳摘要(20–40 分钟) | 时间结构得分 Tm | 76.7(inter=60s)/ 79.0(inter=7s) | Qwen3-Omni-30B: 43.7 | +33.0 / +35.3 |
| Inter-timing 频率权衡(同一模型) | mIoU | 63.0(7s 锚点) | 31.0(240s 锚点) | +32.0,但 token 占比从 0.5% 升到 16.0% |
局限与改进
作者承认 TimeAudio 仅在其原始设定匹配的时长上报告结果(长于两分钟退化严重),且部分任务依赖 LLM-as-judge 这种主观协议。从我的观察看,主要局限还包括:数据全部来自 YODAS2 并过滤到英语($p(\text{English})>0.7$),仅覆盖英语,多语种和非语音音频的接地能力未验证;合成监督完全由 GPT-OSS-120B 生成,可能继承该模型的世界知识与偏置,全局验证器只能检查转录一致性而无法发现转录本身的事实错误;评估最长到 120 分钟但训练时长分桶较粗(≤20/20–40/≥40),超长录音边界行为不明;论文未报告实时推理延迟与显存开销,对实际部署关注不足;round segments 比例等指标偏启发式。
独立分析的弱点
独立分析有几处弱点。首先,仅英语训练限制跨语种泛化,改进方向是引入多语种 YODAS2 分片并做多语种时长分桶。其次,专用 timing token 在低比例数据下表现远逊纯文本(16.7% 比例下纯文本 57.5 vs 专用 token 50.0),说明初始化或训练动态欠优,可改进为从对应数字与冒号嵌入初始化后做更长预热或课程学习。第三,Inter-timing 频率与 token 开销呈线性增长(7s 时额外 token 占比 16%),对两小时录音会显著挤占 256k 上下文,改进方向是自适应或层级化锚点(先分钟、必要时秒级精化)。第四,合成数据依赖 GPT-OSS-120B,未做分布外鲁棒性检验,建议加入真实人工标注的小规模验证集做夹紧评估。第五,缺少端到端延迟、流式推理和显存基准,难以判断部署可行性。
未来方向
作者明确指出会发布开放权重与 10k+ 小时数据集以促进研究,并强调需在时长混合训练和锚点设计上继续探索。基于成果可延伸的方向包括:第一,多语种与跨域时间接地,把流水线扩展到英语之外的 YODAS2 分片和呼叫中心、播客等专业域;第二,更高效的 timing token,研究层级化或自适应频率锚点以在精度与算力间更好权衡,目标是把 7s 级精度的 token 成本压到接近 60s 的 1.9%;第三,流式与在线接地,把分块注意力(8 秒块、40ms 步长)扩展为可流式消费的增量锚点机制;第四,把 LLM-as-judge 协议与人工标注对齐,量化 judge 偏差;第五,将时间锚点思想迁移到视频 LLM 的时刻定位,验证其通用性;第六,研究更长(>120 分钟)或更细(亚秒)接地边界下的退化规律。
复现评估
复现性总体良好。作者在 HuggingFace 发布了开放权重模型(ai-sage/GigaChat3.1-Audio-10B-A1.8B)和 10k+ 小时数据集,承诺支持后续研究。方法描述相当详细:给出音频栈结构(编码器→子采样器→投影器、160ms 帧率、8 秒块/40ms 步长)、预训练设置(HuBERT 式、2M 小时、KMeans 蒸馏)、SFT 学习率($\mathrm{lr}_{dec}=5\times10^{-6}$、$\mathrm{lr}_{enc}=10^{-4}$)、数据过滤阈值($p(\text{English})>0.7$、静音比过滤)和流水线各组件(GPT-OSS-120B 生成、全局验证器、五采样聚合)。主要复现挑战在于:训练一个 $10B\text{-}A1.8B$ 的 MoE 音频 LLM 算力门槛高(仅用数据并行、无张量/序列并行),合成数据流水线依赖 GPT-OSS-120B 闭源行为可能不可精确复现,且部分评估(Gemini 3 Flash 基线、LLM-as-judge)依赖闭源模型。核心算法与消融可在中等规模做概念验证。
论文图表