LibriBrain100:面向大规模神经语音解码的百小时广深兼备MEG数据集 LibriBrain100: One Hundred Hours of Broad and Deep MEG Data for Neural Speech Decoding at Scale
百小时MEG数据集:80小时单被试深度+32人广度,刷新非侵入式语音解码纪录
前置知识
MEG(脑磁图)
脑磁图是一种非侵入式脑成像技术,利用超导量子干涉器件(SQUID)在磁屏蔽室内探测大脑皮层神经元同步放电产生的微弱磁场。本文使用牛津OHBA的MEGIN TRIUX neo系统,306个传感器分为102个磁力计和204个梯度计,原始采样率1kHz,时间分辨率达毫秒级,预处理后降采样到250Hz以保留70-125Hz高伽马频段。与fMRI相比时间分辨率高得多,与侵入式电极相比完全无创。
本文全部数据与解码任务都建立在MEG信号之上,理解其传感器布局、采样率与信噪比特点,是理解数据集设计和词分类输入(306通道×T时间点)的前提。
top-10 balanced accuracy
一种应对类别不平衡的分类指标:对词表 $V$ 中每个词分别计算真实标签落在模型top-10预测内的准确率,再对所有类取平均,即 $\frac{1}{|V|}\sum_{w \in V} \text{Top-10}(w)$。本文使用50词词表,因此随机猜测水平为0.2(10/50),这解释了为何0.478已属强信号而0.585接近上限。
论文所有实验结果都用该指标报告,不懂它就无法判断数字好坏——例如0.2是随机基线,0.478与0.329之间约15个百分点的差距意味着什么。
深度优先 vs 广度优先数据设计
指神经数据集在单被试录制时长(深度)与被试数量(广度)之间的取舍。MOUS、MEG-MASC、Le Petit Prince属广度优先(27-96人、每人不足2小时),Armeni与LibriBrain属深度优先(每人10-52.3小时、仅1-3人)。d'Ascoli et al. 2025发现每被试小时数比总小时数更能预测词分类性能。
这是LibriBrain100设计哲学的核心:约80小时单被试加32人各约40分钟,正是对这一权衡的回应,也直接对应论文中被试内与跨被试两种评测设定。
预训练-微调范式与MEG-XL
先在海量数据上自监督预训练,再用少量标注数据做监督微调的迁移学习范式。MEG-XL是本文使用的脑信号基础模型,借鉴LLM思路把时间上下文扩展5-300倍,先在MOUS、Cam-CAN、SMN4Lang约300小时、800名被试的数据上预训练,再在LibriBrain上微调,是跨被试MEG词分类的当前最先进骨干。
论文所有基线结果都来自微调MEG-XL,理解预训练/微调的划分才能看懂任务二、三中带不带Subject 0数据联合训练的实验设计及其含义。
BIDS与HDF5数据格式
BIDS(Brain Imaging Data Structure)是神经影像社区的标准目录组织规范,规定文件命名与元数据结构,本文以BIDS+FIF格式发布原始数据;HDF5是面向大规模数值数组的科学存储格式,本文把预处理后的数据序列化为float32 HDF5,可视为 $306 \times T$ 的矩阵,直接供PyTorch等框架使用。
双格式发布是本文降低社区使用门槛的关键卖点,理解二者区别才能明白它如何同时服务神经科学家(保留原始灵活性)与ML研究者(即取即用)。
研究动机
非侵入式脑到文本解码正处于类似ImageNet诞生前夜的境地:深度学习已有实效(侵入式电极在瘫痪患者中词错误率已低于5%,如Card et al. 2024),但领域缺乏共享基准、公开数据与标准评测协议,难以判断真实进展、该在什么之上构建以及进展速度。数据层面存在明显的广度-深度失衡:MOUS、MEG-MASC、Le Petit Prince等广度优先数据集覆盖27-96名被试但每人不足2小时;Armeni et al.每人约10小时、LibriBrain每人约52.3小时却只有1-3名被试。前代LibriBrain仅包含单一被试听夏洛克·福尔摩斯侦探小说这一题材,既无法回答跨被试泛化——真实BCI应用要求新用户数据采集量最小化的关键问题——也因刺激单一而使音素与语义层面的精细解码研究不足。同时已有分析显示LibriBrain上的性能尚无饱和迹象,更多数据应能带来更大收益。
本文的目标是构建迄今最大的MEG语音解码数据集LibriBrain100,同时沿深度与广度两个轴扩展:深度上把单被试(subject 0)数据从约50小时扩展到约80小时,广度上新增32名被试、每人约40分钟,总计超过100小时。配套提供标准化词分类基准——把评测课程从语音检测、音素分类推进到能同时利用语音与语义信息的50词分类——以及覆盖全部子数据集的train/validation/test标准划分、基于MEG-XL的可复现基线、HuggingFace开放数据(原始BIDS加序列化HDF5双格式)、pnpl Python库,并同期举办公开机器学习竞赛与排行榜。作者的最终目标是把这套基础设施变成领域共享底座,加速实用化非侵入式脑机接口的研发,让重度瘫痪患者恢复交流能力。
与已有工作不同的是,本文的独特切入是深度优先、兼顾广度的设计哲学与声学-语义刺激轴的系统覆盖。已有证据(d'Ascoli et al. 2025)表明每被试数据小时数比总小时数更能驱动词分类性能,因此作者把约80小时压在单被试上创下纪录——比次大的Armeni数据集深约8倍、比其余数据集深约80倍——再以32名被试每人约40分钟补足跨被试泛化研究。刺激设计直接对齐两条文献线:TIMIT与MOCHA-TIMIT控制音素与音素对分布,与Mesgarani、Anumanchipalli、Makin等侵入式BCI研究使用相同材料,可直接对比;30个The Moth播客故事沿用Tang et al. 2023年fMRI语义解码所用材料,支持跨模态比较。数据集、基准、工具链与竞赛打包发布的整体思路,则是有意复刻ImageNet的成功路径。
核心方法
这是一个数据集、基准、基线三位一体的工作。数据采集在牛津OHBA的MEGIN TRIUX neo系统上完成,306个SQUID传感器(102个磁力计加204个梯度计)在磁屏蔽室内以1kHz采样记录皮层电磁活动,预处理时降采样到250Hz以保留高伽马振荡。数据组织为 $X \in \mathbb{R}^{306 \times T}$ 的多通道时间序列:深度组件为subject 0的80.5小时(福尔摩斯全集68.1小时、TIMIT 5.3小时、MOCHA-TIMIT 1.1小时、The Moth播客6.0小时),广度组件为32名被试各约44分钟的福尔摩斯两章(共23.7小时),总计104.2小时,按78.6/12.5/13.1小时划分为训练/验证/测试。评测以MEG-XL为骨干微调,设计三个词分类实验:多对一(被试内,用足量数据冲SOTA)、一对多(跨被试,验证深数据能否提升浅数据新被试)、数据效率递减(把微调数据压到25%看性能是否保持)。
核心创新是被论文表述为from one-to-many的迁移配方:深单被试联合训练显著提升浅多被试性能。与以往把采集预算摊到几十个被试的广度优先设计相反,作者押注单被试深度才是性能第一驱动力——Armeni在d'Ascoli et al. 2025的词分类中大幅领先总时长更大的广度数据集,LibriBrain又进一步超越Armeni——然后用约80小时的深数据作为锚,提升每人仅40分钟的32名新被试的解码性能。第二层创新是刺激材料的声学-语义双轴工程:TIMIT/MOCHA-TIMIT提供音素受控对比,播客叙事提供语义覆盖,使数据集不仅能刷榜,还能回答MEG语音解码究竟由声音表征还是语义表征驱动这一科学问题。词分类基准也比语音检测、音素分类更接近brain-to-text的终极目标。
方法步骤详情
第一步,数据采集:33名英语熟练被试在OHBA磁屏蔽室内听连续语音,306通道、1kHz采样。第二步,刺激与标注:福尔摩斯有声书(LibriVox,补齐9本全集,尽量同一叙述者以控制口音变异)、TIMIT/MOCHA-TIMIT(音素与音素二元组分布平衡)、30个The Moth播客;由音频生成时间锁定的TSV事件标注(词、音素、语音/非语音起始时间戳)。第三步,预处理与发布:校正头动、滤波、降采样到250Hz,以原始BIDS/FIF与float32 HDF5双格式发布到HuggingFace。第四步,标准划分:福尔摩斯第11、12章分别作验证与测试(原竞赛专用的13、14章公开并入训练集),TIMIT采用24说话人核心测试集与Kaldi 50说话人开发集,MOCHA-TIMIT按互斥句子拆分A-D组防止泄漏。第五步,基准任务:50词分类,标签 $y \in V$,pnpl库的WordClassification任务按tmin=0.2、tmax=0.6秒切出MEG窗口作为输入。第六步,微调MEG-XL并以top-10 balanced accuracy评测三个任务。
技术新颖性
技术新颖性体现在四点。其一,规模纪录:80小时单被试是此前最大非LibriBrain数据集(Armeni,约10小时)的8倍、约80倍于其他数据集,直接验证深度扩展仍有收益。其二,结构创新:首次在同系列数据集中同时提供深度与广度组件(33名被试、总计104.2小时),使跨被试泛化第一次成为该数据系列的一等基准任务,被试数在同类中排第三。其三,刺激工程:把ASR社区的TIMIT(630说话人、8方言区)、侵入式BCI使用的MOCHA-TIMIT、以及fMRI语义解码使用的播客叙事纳入同一被试的录制计划,建立了与侵入式研究和fMRI研究的可比桥梁。其四,工程完成度:BIDS加HDF5双格式、pnpl库的按需下载与subjects/corpus选择器(例如subjects='deep'只取80小时深数据)、公开MEG-XL checkpoint与竞赛排行榜,把可复现性做成了基础设施而非附带说明。
实验结果
三个实验均以50词分类、top-10 balanced accuracy报告,随机水平为0.2。任务一(多对一,被试内):在subject 0的福尔摩斯听书测试集上,仅用subject 0训练即取得最佳0.585,联合32名新被试反而降到0.501,仅用福尔摩斯子集训练为0.519;而在TIMIT、MOCHA-TIMIT与播客等分布外刺激上,加入广度数据有助泛化,各设置数值约在0.39-0.46区间(TIMIT约0.431-0.464,播客约0.393-0.399),显著性用Mann-Whitney U检验。任务二(一对多,跨被试):对32名被试聚合,与subject 0联合训练达0.478,去掉则降到0.329,提升约15个百分点(***p<.001),逐被试结果显示提升在全部32人上一致存在。任务三(数据效率):把每被试微调数据压到100%/50%/25%(约40/20/10分钟),带subject 0时性能仅从0.492微降到0.482,不带时为0.334/0.337/0.332,差异均不显著——说明跨被试迁移贡献了绝大部分性能,约10分钟校准已具临床可行性。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 跨被试50词分类(32名被试聚合,福尔摩斯测试集) | top-10 balanced accuracy(随机水平0.2) | 0.478(与Subject 0的80小时数据联合训练微调MEG-XL) | 0.329(同样的微调流程但排除Subject 0训练数据) | +14.9个百分点(***p<.001,Mann-Whitney U检验,且在全部32名被试上一致提升) |
| 数据高效跨被试50词分类(每被试仅25%微调数据,约10分钟) | top-10 balanced accuracy | 0.482(带Subject 0联合训练);100%与50%数据时分别为0.492/0.488 | 0.332(不带Subject 0,25%数据);不带时各比例为0.334/0.337/0.332 | +15个百分点量级;且25%数据相对100%数据几乎无损失(各比例差异均不显著) |
| 被试内50词分类(Subject 0,福尔摩斯听书测试集) | top-10 balanced accuracy | 0.585(仅用Subject 0训练数据微调MEG-XL) | 0.501(Subject 0加Subjects 1-32联合训练);仅福尔摩斯子集训练0.519 | 仅用深数据反超联合训练约8个百分点,说明主体语料上广度数据略有稀释效应 |
局限与改进
作者坦承两点局限:其一,所有数据均为被动聆听范式采集,而真实BCI需要用户主动产出或想象语音,后者的信号特性与刺激-响应对齐难度完全不同(团队正在采集内语数据计划后续发布);其二,本次发布刻意不含brain-to-text基线,理由是该开放问题的进展快而不均,尚无足够稳定的结果可锚定社区基准。我补充几点观察:跨被试聚合0.478距离实用字级解码仍远,且仅覆盖50词小词表,开放词表能力完全未验证;32名广度被试只听了福尔摩斯两章,刺激多样性远低于subject 0,广度组件其实相当窄;所有被试为健康且英语熟练的志愿者,患者群体(失语症、运动皮层损伤等)上的迁移效果未知;MEG设备昂贵且对运动敏感,即使数据方案可行,硬件可及性与佩戴成本仍是产业瓶颈;此外数据集只覆盖英语,跨语言泛化无从谈起。
独立分析的弱点
独立分析可见以下弱点。第一,被试间解剖结构与脑磁信号模式差异巨大,0.478的跨被试上限提示单纯微调可能正在逼近天花板,改进方向是引入结构对齐(如把各被试源估计映射到公共解剖空间)或为每个新被试训练轻量adapter而非全模型微调。第二,广度被试的40分钟只含福尔摩斯一种题材,模型可能学到题材线索而非真正的语音泛化表征,应扩展多题材的广度采集以验证广度组件的实质价值。第三,top-10 balanced accuracy适合50词封闭集,但真实交流需要开放词表解码,建议补充基于语言模型的连续评测(如词错误率或困惑度类指标)。第四,被动聆听与言语产出之间的认知鸿沟未被量化,可在同一被试上并行采集听、说、想象三模态数据做对照分析。第五,论文未报告微调MEG-XL的算力成本与训练配方细节,数百GB数据上的微调门槛对社区不低,可提供蒸馏小模型或LoRA微调配方降低复现成本。
未来方向
作者明确规划的方向包括:发布多个内语(inner speech)数据集,从聆听迈向产出式BCI;待方法成熟后在后续版本加入brain-to-text基线;依托公开竞赛与排行榜累积社区进展。基于本文成果可自然延伸的研究:利用TIMIT、MOCHA-TIMIT、播客三个子数据集系统分析MEG解码中声学表征与语义表征的相对贡献,并与Tang et al. 2023的fMRI语义解码结果做跨模态对齐;把one-to-many迁移配方推进到零样本新被试——完全不用其数据、仅靠解剖先验或公共空间映射完成校准;结合大语言模型做开放词表的brain-to-text解码;围绕约10分钟校准数据设计临床落地流程并在患者群体中验证安全性;以及把深度优先的数据设计哲学复制到EEG等更廉价、可穿戴的模态上,验证结论的模态无关性。
复现评估
复现条件在同类工作中属于最好的一档。数据在HuggingFace完全开放(pnpl/LibriBrain与pnpl/LibriBrain2两个仓库的并集),提供原始BIDS/FIF与序列化HDF5双格式;pnpl库(pip install pnpl)封装了LibriBrain100数据集类与Speech/Phoneme/Word任务包装器,支持subjects与corpus选择器按需下载,避免一次性拉取数百GB全量数据;标准train/val/test划分随数据发布,MEG-XL checkpoint也在HuggingFace公开(pnpl/MEG-XL),并配套公开竞赛与排行榜。实际成本主要在三处:全量数据数百GB的存储与下载、微调MEG-XL所需的多卡GPU时间、以及只有配备MEG设备的实验室才能复现数据采集(但使用公开数据复现全部解码实验并不需要设备)。对ML研究者而言,跑通基准的整体难度中等偏低。
论文图表