← 返回 2026-08-25

TLive-Omni:面向电商直播的全模态理解模型 TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

Yibo Hu, Yu Qian, Mao Gu, Yingfan Tao, Yuhao Chen, Yongdong Luo, Zhuoqun Liu, Meiguang Jin, Junfeng Ma 📅 2026-08-21 👍 58 2026-08-30 18:30
GRPO 全模态大模型 强化学习后训练 数据引擎 电商直播 音视频时间对齐

阿里开源的电商直播全模态理解模型,用音视频时间对齐与忠实强化微调实现多项直播任务开源最佳。

前置知识

全模态大模型

在单一语言模型接口下统一处理图像、视频、音频与文本输入的多模态大模型。典型做法是给每种模态配一个编码器(视觉编码器、音频编码器),把编码特征通过轻量对齐器(通常是MLP)投影到语言模型的词嵌入空间,让LLM像处理文本token一样处理多模态token,最终以文本形式输出答案。

TLive-Omni就是一个只输出文本的全模态理解模型,其架构(Qwen3.5骨干+外接音频编码器)、训练分阶段策略都建立在这个范式之上,不理解该范式就看不懂它为何冻结/解冻某些组件。

GRPO(组相对策略优化)

一种强化学习后训练算法:对同一提示采样一组 $G$ 个候选回答,用组内奖励的相对优势 $\hat{A}_{i,g}=\frac{R_{i,g}-\mathrm{mean}_{g'}(R_{i,g'})}{\mathrm{std}_{g'}(R_{i,g'})+\epsilon_s}$ 替代价值网络作为基线,配合裁剪比率和KL惩罚更新策略。若组内所有回答奖励相同,优势为零,该组不产生学习信号。

本文的Faithful-RFT阶段直接构建在GRPO之上,其近零方差组重采样、任务条件奖励路由都是针对GRPO奖励信号特性的改造,不懂GRPO就无法理解这些设计动机。

ASR 与 CER/cpWER

ASR即自动语音识别。CER(字错误率)定义为 $\mathrm{CER}=(S+D+I)/N$,$S,D,I$ 分别为替换、删除、插入的字符数,$N$ 为参考转录字数。cpWER(拼接最小置换词错误率)先把各说话人的转录段分别拼接,再在预测说话人与真实说话人的所有配对中取总词错误最小的匹配,用于评估「谁在什么时候说了什么」的说话人归因转写。

直播电商中主播语音承载大量商品事实,ASR和说话人归因ASR是论文的核心评测任务(Table 1、Table 9),看不懂指标就无法判断模型在直播语音上的真实水平。

视觉定位与时间定位

视觉定位按文本描述在图像中预测目标的边界框,常用 $\mathrm{IoU}=\frac{|P\cap G|}{|P\cup G|}\ge 0.5$ 的AP评估。时间定位在视频时间轴上预测事件/商品出现的起止区间,用区间级IoU的均值mIoU评估,多区间样例需逐对匹配而非并集IoU。

「商品在哪些画面里」「卖点在直播的哪几秒出现」是电商直播的标志性需求,Per-vGrid的设计、Table 3和TimeLens-Bench的结果都围绕这两类任务展开。

三阶段SFT与模态对齐器

模态对齐器是连接编码器输出与语言模型嵌入空间的小网络(本文音频侧为两层)。分阶段SFT按「先对齐、再强化单模态、后联合训练」的顺序训练:每阶段冻结不需要更新的模块,只训练当前目标所需的模块,从而把模态对齐、能力学习、多模态联合适应解耦,控制训练不稳定与灾难性遗忘。

论文的三阶段SFT配方(5M ASR→26M音频→14M多模态)以及各阶段冻结哪些组件,是理解其训练流程和算力开销的主线。

研究动机

电商直播是一个信号嘈杂、时间线很长、以商品为中心的全模态理解场景:一个商品的关键事实(价格、材质、促销机制、上身效果)可能分散在主播的口播语音、某个瞬间的视频画面、商品主图、画面叠加文字和弹幕提问中,且这些证据出现在直播流的不同时刻,模型必须联合解读异构信号并把音视觉证据对齐到以商品为中心的时间段上。现有系统在这个场景下表现严重失灵:论文自建评测显示 MiniCPM-o 2.6 的直播帧商品定位 Live AP 仅 3.82、商品图定位 Prod AP 仅 1.77,MiniCPM-o 4.5 的文字定位 F1 只有 5.43,Qwen3-Omni(30B-A3B)的时间定位 mIoU 仅 39.22;即便是强大的闭源模型,Gemini 2.5 Flash 在直播 ASR 上字错误率也高达 16.30。直播语音本身也很难标注和建模:主播语速快、频繁出现品牌名/材质/颜色/型号等低频领域词,通用 ASR 容易错;说话人重叠和短感叹词又让单遍端到端说话人分离不可靠。同类工作 Valley3 虽把建模扩展到电商,但没有围绕直播场景的细粒度原子能力来组织数据与评测。

本文的目标是本文的目标是构建一个面向电商直播的全模态理解模型 TLive-Omni,具体拆成四件事:其一,把图像、视频、音频、文本映射进统一表示空间,基于 Qwen3.5 骨干并嫁接 Qwen3-Omni 的预训练音频编码器,支持 256K token 的多模态上下文以覆盖长直播片段;其二,在输入序列层面做显式的音频-视频时间对齐,让模型能直接识别「哪一秒说了什么」与「哪一秒画面展示了什么」的对应关系;其三,输出必须对感知证据忠实,同时足够快以满足实时直播理解,因此不采用冗长的显式思维链;其四,能力按场景组织成原子能力分类学——语音识别、说话人分析、商品视觉定位、文字识别/定位/分类、时间定位、密集视频描述、全模态问答等,并配一条把直播音频/图像/视频流批量转化为训练信号的数据生产引擎。最终目标是产出 4B 与 9B 两个规格的模型,在自建直播电商评测上大幅领先,同时在通用多模态基准上不退化。

与已有工作不同的是,本文的独特切入是「场景导向的端到端协同设计」,而不是先做通用全模态模型再领域微调。它把四个层面全部对齐到直播场景:架构上设计 Per-vGrid 时间戳音视频网格组织,直接服务于长时间流的时间对齐;数据上建了模态特异的数据引擎,针对直播语音的领域词、重叠说话人和电商图像的杂乱背景分别设计构建与质控管线;训练目标上提出 Faithful-RFT,与主流奖励推理探索的 RL 后训练反其道而行——用任务可验证奖励直接给最终答案打分,主动抑制显式 think 标签,不奖励推理长度与内容,因为实时直播场景要的是「忠实且及时」;评测上自建直播电商套件并采用 cpWER、区间级 mIoU、幻觉率等场景化指标。这种把模型设计、数据构建、训练目标、评测协议四者拧成一股绳对准单一垂直场景的做法,是它与通用全模态模型(Qwen3-Omni、MiniCPM-o 等)和泛电商模型(Valley3)的本质区别。

核心方法

先说直觉:直播理解的本质是在时间轴上把「听到的」与「看到的」钉在一起,再用可验证的反馈教会模型只说自己真正听到、看到的东西。技术路线上,TLive-Omni 以 Qwen3.5(4B/9B)作为视觉-语言骨干:图像经空间合并后贡献 $(h/32)\times(w/32)$ 个视觉 token,采样 $f$ 帧的视频贡献 $\lceil f/2\rceil\times(h/32)\times(w/32)$ 个视觉 token;音频侧嫁接 Qwen3-Omni 的 AuT 音频编码器(在 2000 万小时音频上从头训练,输入 16kHz 下的 128 维 mel 谱,输出约 13 token/秒,可变长),通过两层 MLP 对齐器投影进骨干嵌入空间,整体支持 256K token 上下文。输入序列用 Per-vGrid 组织成带文本时间戳的音视频网格。训练分三阶段 SFT:Stage 1 冻结语言模型与音频编码器,仅用 500 万 ASR 样本训练音频对齐器,建立声学表示到词嵌入空间的初始映射;Stage 2 用 2600 万音频样本(ASR+音频描述+音频QA)训练音频编码器与对齐器,把音频通路从转写扩展到声音事件、音乐与说话人线索;Stage 3 用 1400 万多模态样本联合微调两个对齐器与语言模型(编码器保持冻结)。最后是 Faithful-RFT 强化微调:基于 GRPO,任务条件奖励路由 + 近零方差组动态重采样,vLLM 负责 rollout 生成,最终得到 TLive-Omni-4B 与 TLive-Omni-9B 两个模型。

核心创新有三。其一,Per-vGrid 时间对齐组织:与 Qwen3-Omni 的交错组织相比,它为每个视频网格显式前置文本时间戳、用边界 token 标出网格边界、保证每格的音视频 token 在序列中连续、相邻网格在序列级分离;更关键的是时间戳与音频跨度从「实际采样到的帧索引」推导而非请求采样率——例如 119 帧、30FPS 的源视频(约 3.97 秒)请求 2 FPS 采样时,实际采样帧索引为 [0,20,39,59,79,98,118],真实采样率是 $7/119\times 30\approx 1.76$ FPS,两帧一格后每格实际跨越约 $2/1.76\approx 1.13$ 秒,对应音频约 14–15 个 token 而非按请求率算出的 13 个,避免了整数取整带来的系统性时间偏差。其二,Faithful-RFT:GRPO 的组相对优势 $\hat{A}_{i,g}=\frac{R_{i,g}-\mathrm{mean}_{g'}(R_{i,g'})}{\mathrm{std}_{g'}(R_{i,g'})+\epsilon_s}$ 中的奖励 $R_{i,g}$ 由任务条件路由聚合而来,只用可验证信号给最终答案打分,并用格式约束显式抑制 think 标签——与奖励长思维链的推理型 RFT 有本质区别。其三,同步长度分组采样器:不做 sequence packing,按模态分区内按 token 长度排序切全局批,所有 worker 用相同 seed+epoch 同步调度,在不合并样本的前提下同时保住全局批大小固定、低 padding、跨 worker 负载均衡。

方法步骤详情

第一步,数据引擎按模态分三条路径构建监督信号。音频路径:VAD 与归一化后,用 ASR 模型集成做跨模型一致性投票产生伪标签,LLM 从转录中挖掘品牌名等低频领域词、构建直播关键词词典用于 in-context ASR;说话人标签由纯音频时域分离模型与 MLLM(基于 ASR 转录加视觉线索)两路独立生成,经时间 IoU 一致性检查,不一致段再用视频帧与唇动验证;音频描述拆成声音、音乐、语音内容、说话人节奏四维由音频 LLM 集成生成、LLM 融合成 caption 与音频 QA。图像路径:VLM Detector–Judger 循环生成商品定位框,判别器剔除的错框留作拒绝样本数据;Markdown/HTML 解析结果重新渲染并与原图比对而非直接信任;推理增强 QA 由强 VLM 生成带推理链答案,经规则/LLM 评判与答案-推理一致性检查后保留。视频路径:TransNet V2 按物理镜头边界切分生成密集描述(ASR 提取语音、VLM 描述画面、LLM 融合),按语义事件边界切分生成视频 QA 与时间定位标注,再经场景导向重采样、时间校准与 VLM 判定器的事实/逻辑/时间戳一致性质控。第二步,三阶段 SFT:优化器 AdamW($\beta_1=0.9,\beta_2=0.95$)、cosine 学习率、权重衰减 0.1、梯度裁剪 1、DeepSpeed ZeRO-3 加梯度检查点;三阶段学习率分别为 $1\times10^{-4}$、$1\times10^{-5}$、$4\times10^{-6}$,全局批大小 1024/2048/1024,warmup 比例 0.01/0.01/0.05,各训一个 epoch,依次训练音频对齐器(5M ASR)→ 音频编码器与对齐器(26M 音频)→ 两个对齐器与语言模型(14M 多模态)。第三步,Faithful-RFT 从 Stage 3 模型直接开始(无冷启动 SFT),四条数据流(图像流、带音频视频流、无音频视频流、音频流)混合在同一个 GRPO 阶段:每提示采样 $G=8$ 个候选,奖励按任务路由后聚合 $R_{i,g}=\sum_{j:v_{i,g,j}=1}\tilde{w}_{i,g,j}r_{i,g,j}$,裁剪下界 $\epsilon_l=0.2$、上界 $\epsilon_h=0.28$,KL 系数 $\beta=0.1$,平滑常数 $\epsilon_s=10^{-4}$;奖励方差近零的候选组被调整生成设置或改写提示后重新生成,以维持有效的相对优势信号,rollout 由 vLLM 引擎承担。

技术新颖性

单点理论突破不多,但面向同一场景约束的工程与方法论创新密度很高。Per-vGrid 的「采样感知」时间戳看似细节实则重要:帧采样中的整数取整会让实际采样率系统性偏离请求值,若直接按请求率换算时间戳与音频跨度,误差会随直播时长累积,显式按真实采样帧索引推导是对既有交错式组织的精细化修正。Faithful-RFT 是对 RFT 范式的方向性调整——把奖励从「推理过程的质量与长度」移回「最终答案对感知证据的忠实度」,在实时多模态产品语境下是有意的反共识设计;任务条件奖励路由(每个奖励函数声明适用任务集 $T_j$,不适用者返回无效哨兵并在聚合前剔除、权重在有效奖励上重归一化 $\tilde{w}_{i,g,j}=\frac{v_{i,g,j}w_j}{\sum_k v_{i,g,k}w_k}$)让单一 GRPO 阶段能同时容纳 ASR、定位、OCR、开放式 QA 等正确性定义迥异的任务。同步长度分组采样器用「分区+排序+同步随机态」三件套,在不做 packing、不引入块对角注意力与位置 ID 复杂性的前提下同时满足固定源样本数、固定 token 预算利用、低 padding、跨 worker 负载均衡四个约束,是可直接迁移到其他多模态训练的基础设施贡献。场景导向的原子能力分类学与配套数据引擎则是可复用的垂直领域建模方法论。

The architectural overview of TLive-Omni. It is built upon a Qwen3.5 backbone and extended with the AuT audio encoder through a lightweight audio aligner. The inset illustrates the Per-vGrid token organization that groups each video grid with its temporally corresponding audio within explicit boundary tokens.
Figure 1: The architectural overview of TLive-Omni. It is built upon a Qwen3.5 backbone and extended with the AuT audio encoder through a lightweight audio aligner. The inset illustrates the Per-vGrid token organization that groups each video grid with its temporally corresponding audio within explicit boundary tokens.
TLive-Omni three-stage SFT data construction framework. Modality-specific generation and quality control transform audio, image, and video sources into task-grounded supervision for the three-stage SFT recipe.
Figure 2: TLive-Omni three-stage SFT data construction framework. Modality-specific generation and quality control transform audio, image, and video sources into task-grounded supervision for the three-stage SFT recipe.

实验结果

直播电商评测(Table 1–3)是主战场。音频上(Table 1),TLive-Omni-9B 直播 ASR 字错误率 CER 低至 6.46、4B 为 6.66,为全部受测模型最低(闭源最强的 Gemini 3 Pro 为 12.09,Qwen3-Omni 30B-A3B 为 6.75);说话人归因 ASR 的 cpWER 为 12.27/12.88,仅略高于 Gemini 3 Pro 的 11.67,显著优于 Qwen3-Omni 的 27.84;音频描述任务幻觉率 21.00/20.97 优于 Qwen3-Omni 的 30.22,音频 QA 准确率 76.28/72.60。图像上(Table 2),商品图定位 Prod AP 达 91.45/89.96,比最强闭源 Gemini 3.5 Flash 的 74.89 高出约 16.5 个点,比 Qwen3-Omni 的 68.88 高 22.6 个点;文字定位 F1 87.59、识别归一化编辑距离低至 4.24、电商语义分类准确率 79.85,均为开源最佳;直播帧定位 Live AP 82.85 略低于 Gemini 3.5 Flash 的 84.15。视频上(Table 3),时间定位 mIoU 达 81.49/77.63,远超 Qwen3-Omni 的 39.22;密集描述准确率 74.63、幻觉率仅 8.76、视频 QA 准确率 93.23(超过闭源 Gemini 2.5 Pro 的 92.62),镜头理解在机位与内容分类上开源第一。通用基准上(Table 4–8)模型没有为领域牺牲泛化:MMBench 88.9 与 RealWorldQA 77.7(4B)开源最佳,HallusionBench 77.7(4B)领先,OCRBench 90.3、CC-OCR 81.3、RefCOCO 90.0、EmbSpatial 80.4 均为开源前列;视频侧 9B 在 MLVU 80.9、Video-MME 75.6、LongVideoBench 69.9、MMVU 67.1 领先开源,4B 在 VideoMMMU 73.9 领先;TimeLens-Bench 上 4B 三项时间定位全部开源最高(57.0/58.2/69.2);全模态基准 9B 在 AVUT 80.0、WorldSense 56.0、DailyOmni 80.5、FutureOmni 58.5 开源最佳。In-Context ASR(Table 9)显示关键词提示同时提升召回与降低 CER:9B 在所有非零关键词规模下 CER 最低(50 词时 5.18),并在 200–1000 词规模下保持最高关键词召回(1000 词时 74.31 对 Qwen3-Omni 的 70.56),而 Qwen3-ASR-Flash 在 1000 词时 CER 恶化到 10.68,说明其对长关键词列表的干扰更鲁棒。

Live-commerce image evaluation covering product visual grounding and text understanding.
Table 2: Live-commerce image evaluation covering product visual grounding and text understanding.
General image benchmark results on HallusionBench, AI2D, OCRBench, CC-OCR, CharXiv(RQ), RefCOCO, ERQA, and EmbSpatialBench.
Table 5: General image benchmark results on HallusionBench, AI2D, OCRBench, CC-OCR, CharXiv(RQ), RefCOCO, ERQA, and EmbSpatialBench.
Temporal grounding results on TimeLens-Bench, reported as mIoU on Charades-TL, ActivityNet-TL, and QVHighlights-TL.
Table 7: Temporal grounding results on TimeLens-Bench, reported as mIoU on Charades-TL, ActivityNet-TL, and QVHighlights-TL.
Qualitative live-commerce examples of TLive-Omni.
Figure 3: Qualitative live-commerce examples of TLive-Omni.
Qualitative general-capability examples of TLive-Omni.
Figure 4: Qualitative general-capability examples of TLive-Omni.
查看结构化数据
任务指标本文基线提升
直播电商 ASR(语音识别) CER(字错误率,越低越好) 6.46(9B)/ 6.66(4B) Qwen3-Omni 30B-A3B:6.75;Gemini 3 Pro:12.09 以约三分之一参数量超过 30B-A3B 的 Qwen3-Omni,绝对值再降 0.29;相对闭源 Gemini 3 Pro 降低 5.63 个点
说话人归因 ASR cpWER(越低越好) 12.27(9B)/ 12.88(4B) Gemini 3 Pro:11.67;Qwen3-Omni:27.84 开源最佳,较 Qwen3-Omni 降低 15.57 个点,仅比最强闭源高 0.6 个点
商品视觉定位(商品图) AP@IoU=0.5 91.45(4B)/ 89.96(9B) Gemini 3.5 Flash:74.89;Qwen3-Omni:68.88 领先最强闭源 +16.56、领先最强开源 +22.57
视频时间定位(直播流) mIoU 81.49(9B)/ 77.63(4B) Qwen3-Omni 30B-A3B:39.22;Gemini 3 Pro:77.90 较最强开源翻倍(+42.27),并超过全部闭源模型
直播视频问答 Acc(准确率) 93.23(9B)/ 92.31(4B) Gemini 2.5 Pro:92.62;MiniCPM-o 4.5:84.62 开源第一并超过所有受测闭源模型,幻觉率同时最低(8.76)
通用多模态理解 MMBench EN-DEV-v1.1 88.9(9B)/ 87.0(4B) Qwen3.5 9B 骨干:87.7;MiniCPM-o 4.5:87.6 开源最佳,较自身骨干 +1.2,说明领域训练未损伤通用能力
通用视频时间定位 TimeLens-Bench mIoU(Charades/ActivityNet/QVHighlights) 57.0 / 58.2 / 69.2(均为 4B) VideoChat3 4B:56.1 / 54.6 / 67.0;Qwen3.5 9B:52.0 / 54.0 / 57.2 4B 版本三项全部开源最高,验证 Per-vGrid 的对齐能力可迁移
领域词 in-context ASR(1000 关键词) 关键词召回 / CER 74.31 / 5.53(9B) Qwen3-Omni:70.56 / 7.54;Qwen3-ASR-Flash:56.81 / 10.68 长关键词列表下召回最高且 CER 几乎不恶化,抗干扰能力显著

局限与改进

作者明确承认的局限有三点:模型专注于理解,不支持生成或全双工实时交互;公共基准上的评测覆盖仍需扩展;对更长、更嘈杂、更多样的真实直播流的鲁棒性有待加强,尤其是不完整或模糊多模态输入下的时间证据校准仍需改进。我的补充观察有四点:其一,直播电商评测套件完全自建,密集描述与音频描述采用「评测 LLM 仅凭模型生成的文本来答预制选择题」的协议,评测 LLM 与训练数据引擎大量使用同类 LLM/VLM,存在同源偏置与自评风险,且评测集未公开、第三方难以复核;其二,论文没有给出 Faithful-RFT 的消融实验——所有表格都是最终模型对比,无法分辨 Table 1–3 的领先有多少来自 RL 阶段、多少来自三阶段 SFT 与数据引擎;其三,通用推理型基准上专业化代价隐约可见,9B 的 MMMU 73.4 略低于 Qwen3.5 9B 骨干的 74.2,MathVista 81.9 对 82.2、DynaMath 73.3 对 74.6 也基本持平略降,说明「多数指标超过骨干」主要集中在感知与定位类任务;其四,直播帧定位 Live AP 82.85/82.33 仍输给 Gemini 3.5 Flash 的 84.15,复杂杂乱直播背景下的细粒度定位还有提升空间。

独立分析的弱点

第一,缺乏 Faithful-RFT 的消融与缩放分析:论文声称 RL 阶段提升忠实度与表达质量,但没有公布 SFT-only 基线在直播任务上的成绩,读者无法量化该阶段的边际贡献,也无法判断近零方差组重采样实际把有效组比例提升了多少——改进方向是补充 SFT-only 对比表与重采样触发率统计。第二,评测协议同源化:密集描述/音频描述依赖评测 LLM 打分,而训练数据引擎同样依赖 LLM/VLM 生成与过滤,模型可能隐式学会了迎合评测 LLM 的判分风格——改进方向是公开评测集、加入人工盲评并报告与自动评分的相关性。第三,流式能力缺位:模型以离线片段为输入,直播真正的实时场景需要在音频流入时增量输出,Per-vGrid 的网格边界设计目前只为对齐服务,未探索增量解码与流式时间戳——改进方向是结合流式 ASR 的块级 Per-vGrid 与早停机制。第四,长直播的 token 经济性:音频约 13 token/秒、视频按网格叠加 token,一小时直播即便 256K 上下文也只够数个十分钟级片段,长程一致性(跨小时的价格变动、返场商品)无解——改进方向是层次化摘要索引或检索式证据选择,只把相关片段送入上下文。第五,数据引擎的误差传播:ASR 伪标签、VLM 生成 caption 与 QA 一旦有系统性错误会通过三阶段 SFT 固化进模型,论文虽有多重投票与判定器,但没有报告伪标签噪声率的量化估计——改进方向是抽样人工审核并估计各路径的标签噪声上限。

未来方向

作者提出的方向包括:扩展更广泛公共基准上的评测覆盖;提升对更长、更嘈杂、更多样直播场景的鲁棒性;强化不完整或模糊多模态输入下时间证据的校准。基于论文成果可以自然延伸的方向有:其一,从理解走向交互与生成,把 Per-vGrid 的时间对齐接入全双工语音对话,让直播助手能在正确的时间点插话回答弹幕问题;其二,从理解走向行动,基于原子能力分类学构建下游应用——直播切片自动剪辑(时间定位+密集描述)、实时违规与夸大宣传检测(幻觉感知+OCR)、商品知识库自动回填(ASR+视觉定位交叉验证);其三,把 Faithful-RFT 的任务条件奖励路由推广为通用的多任务 RL 后训练框架,允许新任务以「注册奖励函数」的方式接入而不必重开训练阶段;其四,Per-vGrid 的采样感知时间对齐可迁移到会议记录、体育赛事、安防监控等一切「长时流+音视频证据关联」场景,值得作为独立贡献形式化;其五,结合检索增强做小时级乃至天级直播回放的长程问答,检验 256K 上下文与外部索引的配合上限。

复现评估

可复现性中等偏上但完整复现门槛极高。开源情况:模型权重已在 HuggingFace 发布(TaoLiveAIGC/TLive-Omni-4B 与 TLive-Omni-9B),GitHub 组织 TaoLiveAIGC 下有代码仓库;论文透明度细节相当充足——附录给出了三阶段 SFT 完整超参(AdamW 参数、学习率 $1\times10^{-4}/1\times10^{-5}/4\times10^{-6}$、全局批 1024/2048/1024、warmup、ZeRO-3)、Faithful-RFT 全部超参($G=8$、$\epsilon_s=10^{-4}$、$\epsilon_l=0.2$、$\epsilon_h=0.28$、$\beta=0.1$)以及通用基准的逐条评测 prompt。数据是最大缺口:三阶段合计约 4500 万条训练样本(5M ASR + 26M 音频 + 14M 多模态)与整个直播电商评测套件均未公开,数据引擎中使用的具体 ASR/VLM/LLM 模型身份也未完全披露,因此从零复现训练不可行。算力方面,三阶段 SFT 需 ZeRO-3 多机集群,GRPO 阶段还要常驻 vLLM 引擎做每提示 8 路的动态重采样 rollout,只有大厂级算力可承担。对普通研究者的务实路径是:下载 4B 权重做推理复现与微调实验(感知类任务对显存友好),或基于论文方法描述在自己的垂直领域数据上复刻「分阶段对齐+任务条件奖励 GRPO」的配方。