← 返回 2026-08-27

LibriBrain100:面向大规模神经语音解码的百小时广深兼备MEG数据集 LibriBrain100: One Hundred Hours of Broad and Deep MEG Data for Neural Speech Decoding at Scale

Francesco Mantegna, Dulhan Jayalath, Gereon Elvers, Tasha Kim, Benjamin Ballyk, Alex Fung, SungJun Cho, Teyun Kwon, Luisa Kurth, Miran Özdogan, Gilad Landau, Pratik Somaiya, Natalie Voets, Mark Woolrich, Oiwi Parker Jones 📅 2026-08-25 👍 3 2026-09-01 18:30
MEG 数据集与基准 脑机接口 语音解码 迁移学习

百小时MEG数据集:80小时单被试深度+32人广度,刷新非侵入式语音解码纪录

前置知识

MEG(脑磁图)

脑磁图是一种非侵入式脑成像技术,利用超导量子干涉器件(SQUID)在磁屏蔽室内探测大脑皮层神经元同步放电产生的微弱磁场。本文使用牛津OHBA的MEGIN TRIUX neo系统,306个传感器分为102个磁力计和204个梯度计,原始采样率1kHz,时间分辨率达毫秒级,预处理后降采样到250Hz以保留70-125Hz高伽马频段。与fMRI相比时间分辨率高得多,与侵入式电极相比完全无创。

本文全部数据与解码任务都建立在MEG信号之上,理解其传感器布局、采样率与信噪比特点,是理解数据集设计和词分类输入(306通道×T时间点)的前提。

top-10 balanced accuracy

一种应对类别不平衡的分类指标:对词表 $V$ 中每个词分别计算真实标签落在模型top-10预测内的准确率,再对所有类取平均,即 $\frac{1}{|V|}\sum_{w \in V} \text{Top-10}(w)$。本文使用50词词表,因此随机猜测水平为0.2(10/50),这解释了为何0.478已属强信号而0.585接近上限。

论文所有实验结果都用该指标报告,不懂它就无法判断数字好坏——例如0.2是随机基线,0.478与0.329之间约15个百分点的差距意味着什么。

深度优先 vs 广度优先数据设计

指神经数据集在单被试录制时长(深度)与被试数量(广度)之间的取舍。MOUS、MEG-MASC、Le Petit Prince属广度优先(27-96人、每人不足2小时),Armeni与LibriBrain属深度优先(每人10-52.3小时、仅1-3人)。d'Ascoli et al. 2025发现每被试小时数比总小时数更能预测词分类性能。

这是LibriBrain100设计哲学的核心:约80小时单被试加32人各约40分钟,正是对这一权衡的回应,也直接对应论文中被试内与跨被试两种评测设定。

预训练-微调范式与MEG-XL

先在海量数据上自监督预训练,再用少量标注数据做监督微调的迁移学习范式。MEG-XL是本文使用的脑信号基础模型,借鉴LLM思路把时间上下文扩展5-300倍,先在MOUS、Cam-CAN、SMN4Lang约300小时、800名被试的数据上预训练,再在LibriBrain上微调,是跨被试MEG词分类的当前最先进骨干。

论文所有基线结果都来自微调MEG-XL,理解预训练/微调的划分才能看懂任务二、三中带不带Subject 0数据联合训练的实验设计及其含义。

BIDS与HDF5数据格式

BIDS(Brain Imaging Data Structure)是神经影像社区的标准目录组织规范,规定文件命名与元数据结构,本文以BIDS+FIF格式发布原始数据;HDF5是面向大规模数值数组的科学存储格式,本文把预处理后的数据序列化为float32 HDF5,可视为 $306 \times T$ 的矩阵,直接供PyTorch等框架使用。

双格式发布是本文降低社区使用门槛的关键卖点,理解二者区别才能明白它如何同时服务神经科学家(保留原始灵活性)与ML研究者(即取即用)。

研究动机

非侵入式脑到文本解码正处于类似ImageNet诞生前夜的境地:深度学习已有实效(侵入式电极在瘫痪患者中词错误率已低于5%,如Card et al. 2024),但领域缺乏共享基准、公开数据与标准评测协议,难以判断真实进展、该在什么之上构建以及进展速度。数据层面存在明显的广度-深度失衡:MOUS、MEG-MASC、Le Petit Prince等广度优先数据集覆盖27-96名被试但每人不足2小时;Armeni et al.每人约10小时、LibriBrain每人约52.3小时却只有1-3名被试。前代LibriBrain仅包含单一被试听夏洛克·福尔摩斯侦探小说这一题材,既无法回答跨被试泛化——真实BCI应用要求新用户数据采集量最小化的关键问题——也因刺激单一而使音素与语义层面的精细解码研究不足。同时已有分析显示LibriBrain上的性能尚无饱和迹象,更多数据应能带来更大收益。

本文的目标是构建迄今最大的MEG语音解码数据集LibriBrain100,同时沿深度与广度两个轴扩展:深度上把单被试(subject 0)数据从约50小时扩展到约80小时,广度上新增32名被试、每人约40分钟,总计超过100小时。配套提供标准化词分类基准——把评测课程从语音检测、音素分类推进到能同时利用语音与语义信息的50词分类——以及覆盖全部子数据集的train/validation/test标准划分、基于MEG-XL的可复现基线、HuggingFace开放数据(原始BIDS加序列化HDF5双格式)、pnpl Python库,并同期举办公开机器学习竞赛与排行榜。作者的最终目标是把这套基础设施变成领域共享底座,加速实用化非侵入式脑机接口的研发,让重度瘫痪患者恢复交流能力。

与已有工作不同的是,本文的独特切入是深度优先、兼顾广度的设计哲学与声学-语义刺激轴的系统覆盖。已有证据(d'Ascoli et al. 2025)表明每被试数据小时数比总小时数更能驱动词分类性能,因此作者把约80小时压在单被试上创下纪录——比次大的Armeni数据集深约8倍、比其余数据集深约80倍——再以32名被试每人约40分钟补足跨被试泛化研究。刺激设计直接对齐两条文献线:TIMIT与MOCHA-TIMIT控制音素与音素对分布,与Mesgarani、Anumanchipalli、Makin等侵入式BCI研究使用相同材料,可直接对比;30个The Moth播客故事沿用Tang et al. 2023年fMRI语义解码所用材料,支持跨模态比较。数据集、基准、工具链与竞赛打包发布的整体思路,则是有意复刻ImageNet的成功路径。

核心方法

这是一个数据集、基准、基线三位一体的工作。数据采集在牛津OHBA的MEGIN TRIUX neo系统上完成,306个SQUID传感器(102个磁力计加204个梯度计)在磁屏蔽室内以1kHz采样记录皮层电磁活动,预处理时降采样到250Hz以保留高伽马振荡。数据组织为 $X \in \mathbb{R}^{306 \times T}$ 的多通道时间序列:深度组件为subject 0的80.5小时(福尔摩斯全集68.1小时、TIMIT 5.3小时、MOCHA-TIMIT 1.1小时、The Moth播客6.0小时),广度组件为32名被试各约44分钟的福尔摩斯两章(共23.7小时),总计104.2小时,按78.6/12.5/13.1小时划分为训练/验证/测试。评测以MEG-XL为骨干微调,设计三个词分类实验:多对一(被试内,用足量数据冲SOTA)、一对多(跨被试,验证深数据能否提升浅数据新被试)、数据效率递减(把微调数据压到25%看性能是否保持)。

核心创新是被论文表述为from one-to-many的迁移配方:深单被试联合训练显著提升浅多被试性能。与以往把采集预算摊到几十个被试的广度优先设计相反,作者押注单被试深度才是性能第一驱动力——Armeni在d'Ascoli et al. 2025的词分类中大幅领先总时长更大的广度数据集,LibriBrain又进一步超越Armeni——然后用约80小时的深数据作为锚,提升每人仅40分钟的32名新被试的解码性能。第二层创新是刺激材料的声学-语义双轴工程:TIMIT/MOCHA-TIMIT提供音素受控对比,播客叙事提供语义覆盖,使数据集不仅能刷榜,还能回答MEG语音解码究竟由声音表征还是语义表征驱动这一科学问题。词分类基准也比语音检测、音素分类更接近brain-to-text的终极目标。

方法步骤详情

第一步,数据采集:33名英语熟练被试在OHBA磁屏蔽室内听连续语音,306通道、1kHz采样。第二步,刺激与标注:福尔摩斯有声书(LibriVox,补齐9本全集,尽量同一叙述者以控制口音变异)、TIMIT/MOCHA-TIMIT(音素与音素二元组分布平衡)、30个The Moth播客;由音频生成时间锁定的TSV事件标注(词、音素、语音/非语音起始时间戳)。第三步,预处理与发布:校正头动、滤波、降采样到250Hz,以原始BIDS/FIF与float32 HDF5双格式发布到HuggingFace。第四步,标准划分:福尔摩斯第11、12章分别作验证与测试(原竞赛专用的13、14章公开并入训练集),TIMIT采用24说话人核心测试集与Kaldi 50说话人开发集,MOCHA-TIMIT按互斥句子拆分A-D组防止泄漏。第五步,基准任务:50词分类,标签 $y \in V$,pnpl库的WordClassification任务按tmin=0.2、tmax=0.6秒切出MEG窗口作为输入。第六步,微调MEG-XL并以top-10 balanced accuracy评测三个任务。

技术新颖性

技术新颖性体现在四点。其一,规模纪录:80小时单被试是此前最大非LibriBrain数据集(Armeni,约10小时)的8倍、约80倍于其他数据集,直接验证深度扩展仍有收益。其二,结构创新:首次在同系列数据集中同时提供深度与广度组件(33名被试、总计104.2小时),使跨被试泛化第一次成为该数据系列的一等基准任务,被试数在同类中排第三。其三,刺激工程:把ASR社区的TIMIT(630说话人、8方言区)、侵入式BCI使用的MOCHA-TIMIT、以及fMRI语义解码使用的播客叙事纳入同一被试的录制计划,建立了与侵入式研究和fMRI研究的可比桥梁。其四,工程完成度:BIDS加HDF5双格式、pnpl库的按需下载与subjects/corpus选择器(例如subjects='deep'只取80小时深数据)、公开MEG-XL checkpoint与竞赛排行榜,把可复现性做成了基础设施而非附带说明。

Decoding words from LibriBrain100
Figure 1: Decoding words from LibriBrain100
数据集可视化总览(附录A.1)
Figure 5: 数据集可视化总览(附录A.1)

实验结果

三个实验均以50词分类、top-10 balanced accuracy报告,随机水平为0.2。任务一(多对一,被试内):在subject 0的福尔摩斯听书测试集上,仅用subject 0训练即取得最佳0.585,联合32名新被试反而降到0.501,仅用福尔摩斯子集训练为0.519;而在TIMIT、MOCHA-TIMIT与播客等分布外刺激上,加入广度数据有助泛化,各设置数值约在0.39-0.46区间(TIMIT约0.431-0.464,播客约0.393-0.399),显著性用Mann-Whitney U检验。任务二(一对多,跨被试):对32名被试聚合,与subject 0联合训练达0.478,去掉则降到0.329,提升约15个百分点(***p<.001),逐被试结果显示提升在全部32人上一致存在。任务三(数据效率):把每被试微调数据压到100%/50%/25%(约40/20/10分钟),带subject 0时性能仅从0.492微降到0.482,不带时为0.334/0.337/0.332,差异均不显著——说明跨被试迁移贡献了绝大部分性能,约10分钟校准已具临床可行性。

LibriBrain100 data sources and standard splits
Table 1: LibriBrain100 data sources and standard splits
与现有MEG数据集的对比(附录A.2)
Table 2: 与现有MEG数据集的对比(附录A.2)
Subject 0 performance on held-out test data
Figure 2: Subject 0 performance on held-out test data
Fine-tuning MEG-XL on subjects 1-32, with and without training alongside Subject 0
Figure 3: Fine-tuning MEG-XL on subjects 1-32, with and without training alongside Subject 0
Performance as a function of fine-tuning data size
Figure 4: Performance as a function of fine-tuning data size
查看结构化数据
任务指标本文基线提升
跨被试50词分类(32名被试聚合,福尔摩斯测试集) top-10 balanced accuracy(随机水平0.2) 0.478(与Subject 0的80小时数据联合训练微调MEG-XL) 0.329(同样的微调流程但排除Subject 0训练数据) +14.9个百分点(***p<.001,Mann-Whitney U检验,且在全部32名被试上一致提升)
数据高效跨被试50词分类(每被试仅25%微调数据,约10分钟) top-10 balanced accuracy 0.482(带Subject 0联合训练);100%与50%数据时分别为0.492/0.488 0.332(不带Subject 0,25%数据);不带时各比例为0.334/0.337/0.332 +15个百分点量级;且25%数据相对100%数据几乎无损失(各比例差异均不显著)
被试内50词分类(Subject 0,福尔摩斯听书测试集) top-10 balanced accuracy 0.585(仅用Subject 0训练数据微调MEG-XL) 0.501(Subject 0加Subjects 1-32联合训练);仅福尔摩斯子集训练0.519 仅用深数据反超联合训练约8个百分点,说明主体语料上广度数据略有稀释效应

局限与改进

作者坦承两点局限:其一,所有数据均为被动聆听范式采集,而真实BCI需要用户主动产出或想象语音,后者的信号特性与刺激-响应对齐难度完全不同(团队正在采集内语数据计划后续发布);其二,本次发布刻意不含brain-to-text基线,理由是该开放问题的进展快而不均,尚无足够稳定的结果可锚定社区基准。我补充几点观察:跨被试聚合0.478距离实用字级解码仍远,且仅覆盖50词小词表,开放词表能力完全未验证;32名广度被试只听了福尔摩斯两章,刺激多样性远低于subject 0,广度组件其实相当窄;所有被试为健康且英语熟练的志愿者,患者群体(失语症、运动皮层损伤等)上的迁移效果未知;MEG设备昂贵且对运动敏感,即使数据方案可行,硬件可及性与佩戴成本仍是产业瓶颈;此外数据集只覆盖英语,跨语言泛化无从谈起。

独立分析的弱点

独立分析可见以下弱点。第一,被试间解剖结构与脑磁信号模式差异巨大,0.478的跨被试上限提示单纯微调可能正在逼近天花板,改进方向是引入结构对齐(如把各被试源估计映射到公共解剖空间)或为每个新被试训练轻量adapter而非全模型微调。第二,广度被试的40分钟只含福尔摩斯一种题材,模型可能学到题材线索而非真正的语音泛化表征,应扩展多题材的广度采集以验证广度组件的实质价值。第三,top-10 balanced accuracy适合50词封闭集,但真实交流需要开放词表解码,建议补充基于语言模型的连续评测(如词错误率或困惑度类指标)。第四,被动聆听与言语产出之间的认知鸿沟未被量化,可在同一被试上并行采集听、说、想象三模态数据做对照分析。第五,论文未报告微调MEG-XL的算力成本与训练配方细节,数百GB数据上的微调门槛对社区不低,可提供蒸馏小模型或LoRA微调配方降低复现成本。

未来方向

作者明确规划的方向包括:发布多个内语(inner speech)数据集,从聆听迈向产出式BCI;待方法成熟后在后续版本加入brain-to-text基线;依托公开竞赛与排行榜累积社区进展。基于本文成果可自然延伸的研究:利用TIMIT、MOCHA-TIMIT、播客三个子数据集系统分析MEG解码中声学表征与语义表征的相对贡献,并与Tang et al. 2023的fMRI语义解码结果做跨模态对齐;把one-to-many迁移配方推进到零样本新被试——完全不用其数据、仅靠解剖先验或公共空间映射完成校准;结合大语言模型做开放词表的brain-to-text解码;围绕约10分钟校准数据设计临床落地流程并在患者群体中验证安全性;以及把深度优先的数据设计哲学复制到EEG等更廉价、可穿戴的模态上,验证结论的模态无关性。

复现评估

复现条件在同类工作中属于最好的一档。数据在HuggingFace完全开放(pnpl/LibriBrain与pnpl/LibriBrain2两个仓库的并集),提供原始BIDS/FIF与序列化HDF5双格式;pnpl库(pip install pnpl)封装了LibriBrain100数据集类与Speech/Phoneme/Word任务包装器,支持subjects与corpus选择器按需下载,避免一次性拉取数百GB全量数据;标准train/val/test划分随数据发布,MEG-XL checkpoint也在HuggingFace公开(pnpl/MEG-XL),并配套公开竞赛与排行榜。实际成本主要在三处:全量数据数百GB的存储与下载、微调MEG-XL所需的多卡GPU时间、以及只有配备MEG设备的实验室才能复现数据采集(但使用公开数据复现全部解码实验并不需要设备)。对ML研究者而言,跑通基准的整体难度中等偏低。