网易首页 > 网易号 > 正文 申请入驻

牛津大学脑机接口团队发布史上最大规模MEG语音解码数据集

0
分享至


2024年,一台植入式脑机接口设备让一位瘫痪多年的患者重新"开口说话",词错误率低于5%,比很多语音识别软件还准。这听起来像科幻电影,但代价是要在脑子里动手术,植入电极。这条路能救人,却没法普及。真正的希望在另一条路上:不开颅、不动刀,只靠戴在头上的设备读懂大脑信号。这条路走得慢得多,而牛津大学的PNPL实验室觉得,慢的原因之一,是这个领域一直没有一个像样的"共同题库"。

你可能没意识到,计算机视觉能在过去十年突飞猛进,一个被低估的原因是ImageNet的出现。

在ImageNet之前,不同实验室各自收集小规模数据、各自定义评测标准,谁也说不清哪个方法真的更强。ImageNet给了所有人同一套题目、同一把尺子。脑机接口领域,尤其是非侵入式的那部分,至今没有这样一把尺子。牛津团队这次发布的LibriBrain100,想做的正是这件事。

先说清楚这个数据集在测什么。它记录的是脑磁图信号,英文缩写MEG。

MEG*:全称脑磁图(magnetoencephalography),一种非侵入式脑成像技术,通过头皮外的超导传感器捕捉大脑神经活动产生的微弱磁场,不需要开颅,受试者只需戴上一个像头盔一样的设备。

具体的实验场景是:让志愿者戴着这个"头盔",听有声书、听新闻播客、听经过语音学设计的句子,同时记录他们大脑的磁场变化。研究者想知道,能不能从这些磁场信号里,反推出这个人当时听到的是哪个词。这个任务叫词分类。

一件事的规模,决定了它能撬动多大的杠杆

这个数据集最引人注目的数字是:一个人贡献了将近80个小时的脑磁图数据。

这不是笔误。研究团队把这个人称为"0号受试者",让他反复来实验室录了将近80小时的脑活动记录,是此前同类数据集里最深纪录的8倍,是绝大多数同类数据集的80倍。

这里有个问题必须先解释清楚:为什么要死磕一个人的数据量,而不是多找些人分摊时间?

答案藏在此前一系列研究的发现里。2025年发表在《自然-通讯》上的一篇论文做了个对比实验:同样的总录制时长,分给很多人录一点点,还是集中在少数人身上录很多,哪种效果更好?结果是后者碾压前者。一个录了10小时的单人数据集,解码效果显著超过总时长更长但分散在几十个人身上的数据集。

这背后的道理其实不难理解。每个人的大脑长得不完全一样,脑区位置、信号强弱、噪声模式都有个体差异。如果你想让一个模型学会从某个人的脑电信号里读出词义,你需要给它足够多这个人的样本,让它把这个人的"信号方言"学透。你今天录10分钟,明天换一个人再录10分钟,模型永远在学新方言,学不精。

打个比方,这就像你想学会听懂一个人的口音。如果你和这个人朝夕相处一整年,你会越来越熟悉他说话的节奏、习惯、含糊不清的地方。但如果你每天换一个陌生人聊十分钟,一年下来你接触的人更多,但你对任何一个人的口音都停留在"刚认识"的阶段。如果不集中在少数人身上积累深度数据,模型学到的永远是浅层的、泛化性差的东西,这正是为什么团队宁可让一个人重复来实验室几十次,也不愿意分散精力多找几十个人各录一点。

原来的LibriBrain数据集(可以理解成LibriBrain100的上一代版本)已经做到了单人50多小时,这次的LibriBrain100把这个数字推到了80小时,并且把整套福尔摩斯探案集九本书全部读完(上一版只读了七本),同时加入了两类新素材:一是专为控制语音学变量设计的TIMIT和MOCHA-TIMIT语料库,二是30期播客故事。

TIMIT*:一套专门为语音识别研究设计的美式英语语料库,句子经过精心挑选,让每个音素(也就是英语里最小的发音单位,比如"b""t""ee"这些)出现的频率尽量均衡,常被用来研究大脑如何处理具体的发音细节。

MOCHA-TIMIT*:TIMIT的英式英语版本,增加了男女两位英国口音说话人的录音,同样服务于语音学层面的精细分析。

为什么要额外加这两个语料库?因为福尔摩斯探案集虽然量大,但题材单一,反复读九本侦探小说,听多了会发现语言风格、词汇分布高度重复。这样的数据能训练模型识别"这个人在这种叙事风格下大脑是什么反应",但没法回答"大脑对不同发音方式的敏感度"或者"大脑如何处理陌生的语义内容"这类问题。TIMIT和MOCHA-TIMIT专门控制了音素分布,播客则带来了从津巴布韦独立到战时巴格达、从丧亲之痛到科学考察等五花八门的话题,补上了语义多样性这一课。

一个人不够,32个人来凑

深度数据固然重要,但现实世界里,你不可能要求每个想用脑机接口的人先来实验室躺80个小时。这在临床应用上完全不现实,病人没有这个精力,医院也没有这个资源。

于是团队做了第二件事:找来32位新的志愿者,每人只录了大约40分钟。这构成了数据集的"广度"部分,和0号受试者的"深度"部分形成互补。

这个设计思路,其实很像手机厂商做AI语音助手的策略。厂商不可能让每个用户先对着手机说满100个小时的话来"训练专属模型",那样没人会买账。他们的做法通常是先用海量通用语料训练出一个大模型,让新用户只需要说几句话做"个性化微调",体验就能大幅提升。如果没有这个大模型打底,每个新用户从零开始训练,效果会差很多,而且门槛高到没人愿意用。LibriBrain100里那80小时的深度数据,扮演的正是这个"打底大模型"的角色,32人的浅层数据则是用来验证:有了这个底子,新用户只需要很少的数据就能被识别。

这套组合拳到底管不管用?团队用一个叫MEG-XL的预训练模型做了三组实验来验证。

MEG-XL*:一个先在多个数据集(包括约300小时、800名受试者的脑电和脑磁数据)上预训练,再针对具体任务做微调的语音解码模型,借鉴了大语言模型"先海量预训练、后小样本微调"的思路。

第一组实验测的是:把32个新人的数据也拿来一起训练,对0号受试者自己的解码效果有没有帮助?结果有点意思,在听有声书这个任务上,加入32人数据后,准确率从52.5%(相当于79万比特每词左右,这里简化成百分比表述)提升到58.5%;但如果测试的是TIMIT这种控制过的语音材料,加进32人数据反而效果更好,准确率从39.3%提升到43.1%。唯独在有声书这个任务上,如果只用0号受试者自己的福尔摩斯数据训练,反而比加入32人数据表现更好一点点,达到49.2%,不过差距很小。

这说明什么?说明"用别人的数据帮自己"这件事不是无脑加法,得看任务性质。福尔摩斯小说这种高度个性化、风格固定的素材,0号受试者自己的历史数据已经足够精准地刻画这种模式,别人的数据反而可能引入一些"噪声"或者说是不完全对齐的模式。但在TIMIT这种更标准化、跨说话人共性更强的任务上,多样化的训练数据反而能帮模型学到更稳健的规律。

第二组实验反过来测:0号受试者的80小时深度数据,能不能反哺32个新人,让新人的解码效果变好?

结果非常干脆。加入0号受试者数据训练后,32人的平均准确率是47.8%,不加入则只有32.9%,整整差了15个百分点。而且这个提升在32个人身上几乎是普遍现象,不是靠某几个"天赋异禀"的受试者拉高平均值。

这15个百分点意味着什么?意味着如果不用0号受试者的深度数据打底,新用户每猜10次里大概能猜对3次多一点;而用了这个底子之后,10次里能猜对将近5次。对一个想靠脑机接口交流的人来说,这个差距可能就是"勉强能用"和"根本没法用"的区别。

第三组实验更进一步追问:能不能把32人身上需要的数据量继续压缩,压到10分钟左右,还能不能保持效果?

团队把32人分成三组,第一组用100%的可用训练数据微调,第二组只用50%,第三组只用25%(大约相当于10分钟)。结果显示,三组的解码准确率几乎没有差别,分别是49.2%、48.8%、48.2%。真正拉开差距的,始终是"有没有加入0号受试者的数据",而不是"新用户自己录了多少分钟"。

这个结果如果成立,对未来的临床应用是个好消息。如果一个瘫痪患者只需要贡献10分钟左右的脑活动数据,就能获得接近于用了几十分钟数据的解码效果,那对患者的负担会小很多。当然,团队在论文里也很谨慎地提醒,这些数据全部来自健康志愿者听讲的场景,离真正给病人用还有距离。

顺带一提,团队还用一种叫OVMI的信息论指标,把这套非侵入式方案和2021年一个真正用在瘫痪患者身上的植入式脑机接口做了对比。

OVMI*:一种衡量脑机接口"信息传输效率"的指标,单位是每次尝试传递多少比特信息,数值越高说明这套系统能更快、更准地把使用者的意图转化成可理解的输出。

植入式方案那边измеряется出的数值是0.259比特每词尝试,而这次非侵入式的MEG-XL模型是0.075,如果换成专门优化过的词汇表能到0.147。差距还很大,但团队也坦承,这个对比只是个参照系,毕竟一边测的是"听懂了什么词",另一边测的是真正的"意图表达",不是同一件事。这更像是给整个领域立一个路标:我们现在走到哪儿了,离那个植入式的里程碑还有多远。

数据从哪来,又能怎么用

聊了这么多实验结果,回到最基础的问题:这些数据长什么样,普通研究者要怎么拿到手用?

原始数据是306个传感器同时记录、每秒采样1000次的脑磁场信号,经过降采样处理后变成每秒250次,这个降采样保留了高伽马频段(70到125赫兹)的振荡信息,这个频段被认为和语言处理密切相关。数据配有详细的时间标注文件,精确到每个词、每个音素的起止时间点,这样研究者才能把"某个时间点的脑活动"和"当时正在听的具体词语"对应起来。

为了让这套流程真正可用,团队专门做了一个叫pnpl的Python工具库,一行pip install pnpl就能装上,内置了下载、预处理、按需筛选数据的功能,连深度学习框架需要的数据格式都封装好了。这个细节其实很重要,因为一个数据集如果只是扔在网上一堆文件,真正能用起来的研究者会少很多。工具链完善,才能真正降低门槛。

整个标注工作花了超过200个小时的人工核对,先用自动化的语音活动检测和强制对齐工具打底,再人工逐条修正边界不准的地方,尤其是人名、外语引用、口语中的重复和修正这些自动化工具容易出错的地方。这种"机器打草稿、人工精修"的模式,某种程度上很像现在很多AI数据标注的常见做法,只不过这里标的不是图片里的猫和狗,而是脑磁波形里每一个词的起止时刻。

写在后面

看完这份工作,我印象最深的一点不是那80小时的数据量,而是那15个百分点的对比实验。它其实在回答一个更根本的问题:一个人的深度经验,到底能不能被"打包"送给另一个几乎没有经验的人?

在人类社会里,这个问题有很多现成的答案,老师傅带徒弟、老中医传方子、老司机教新手上路,靠的都是经验的迁移,而不是每个人从零开始摸索。这次实验用数字证明了同样的逻辑在大脑信号解码上也成立:一个人攒下的80小时经验,能实实在在地帮另一个只花了10分钟的人,把准确率从32.9%拉到47.8%。这不是一句励志的比喻,是一组真实测出来的数字。

另一个让我反复想的细节是,团队特意提到,他们同时也在收集"内心默念"而不是"听声音"的数据,准备在未来发布。这提醒我们,LibriBrain100测的其实是相对容易的场景,人听懂了一句话,大脑的反应本来就比较清晰、信噪比高。真正难的是让一个人默默地"想"一句话,或者尝试发声却发不出来,这才是瘫痪患者真正需要的场景。这份数据集是一块扎实的地基,但离真正的"意念打字",中间还隔着一段没人走完的路。

Q&A

Q1:LibriBrain100数据集是什么?

A:LibriBrain100是牛津大学团队发布的大规模脑磁图(MEG)数据集,总时长超过100小时,其中一位受试者贡献了约80小时的深度数据,另外32位受试者各贡献约40分钟,专门用于研究非侵入式脑机接口的语音解码,数据来自志愿者听有声书、播客和语音学语料库时的脑活动记录。

Q2:为什么要让一个人录80小时数据,而不是找更多人分摊时间?

A:研究发现单人深度数据比分散在多人身上的浅层数据解码效果更好,因为每个人大脑信号存在个体差异,模型需要足够多同一个人的样本才能精准学习其"信号特征",实验证实用0号受试者数据打底后,新用户解码准确率提升了15个百分点。

Q3:这份数据集离真正能用的脑机接口还有多远?

A:目前还有距离。这份数据记录的是"听懂语音"时的脑活动,信噪比较高,而真正的脑机接口需要解码"内心默念"或"尝试发声却发不出来"的场景,难度更大,团队表示正在收集这类数据,未来会陆续发布。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本一家公共澡堂发生盗窃案:18岁中国少年被捕,查获170把钥匙......

日本一家公共澡堂发生盗窃案:18岁中国少年被捕,查获170把钥匙......

日本窗
2026-10-09 20:44:41
飞天奖落幕:3人出尽风头,2人镀金成功,1人翻红,唯她不如不来

飞天奖落幕:3人出尽风头,2人镀金成功,1人翻红,唯她不如不来

旧史新谭
2026-10-10 01:02:34
女儿被渣土车碾压身亡后,赣州父亲跟踪调查货车通行乱象:补一块漏洞,悲剧就能少一桩

女儿被渣土车碾压身亡后,赣州父亲跟踪调查货车通行乱象:补一块漏洞,悲剧就能少一桩

潇湘晨报
2026-10-09 13:43:40
每年吃掉3千只蚊子,8年才能长大,但被人类作为美食大量捕捉!

每年吃掉3千只蚊子,8年才能长大,但被人类作为美食大量捕捉!

史之铭
2026-10-10 00:18:00
局势彻底变天了!中日对峙一天天拖下去,越来越多国家终于意识到:中日若兵戎相见,不会像俄乌冲突那样给第三方牟利的机会,而是一场血战

局势彻底变天了!中日对峙一天天拖下去,越来越多国家终于意识到:中日若兵戎相见,不会像俄乌冲突那样给第三方牟利的机会,而是一场血战

林杰论事
2026-10-03 02:28:50
开始查普通医生!中纪委划4条红线,第1种直接被点名,第3种常见

开始查普通医生!中纪委划4条红线,第1种直接被点名,第3种常见

职场资深秘书
2026-10-09 15:14:01
上海出身的顶级富二代获诺贝尔奖后,美国总统说:全世界都欠你一个大人情!

上海出身的顶级富二代获诺贝尔奖后,美国总统说:全世界都欠你一个大人情!

华人星光
2026-10-08 09:17:25
梅尔滕斯刚横扫斯瓦泰克,郑钦文“利好”真能转化为胜势吗?

梅尔滕斯刚横扫斯瓦泰克,郑钦文“利好”真能转化为胜势吗?

蔺玄觞
2026-10-10 04:58:46
第35届飞天奖,王仁君击败于和伟爆冷获视帝,宋佳“一串三”创历史,《小巷人家》再陪跑

第35届飞天奖,王仁君击败于和伟爆冷获视帝,宋佳“一串三”创历史,《小巷人家》再陪跑

娱君坠星河
2026-10-09 22:58:08
人老了,只剩一个人的时候,千万要记住:1、不要再找老伴儿;2、不去养老院;3、不雇保姆,干不动了,就…

人老了,只剩一个人的时候,千万要记住:1、不要再找老伴儿;2、不去养老院;3、不雇保姆,干不动了,就…

犀利强哥
2026-10-09 16:28:16
追平生涯纪录!郑钦文2-0横扫斯维托丽娜 时隔两年重返中网四强

追平生涯纪录!郑钦文2-0横扫斯维托丽娜 时隔两年重返中网四强

醉卧浮生
2026-10-09 16:56:21
品牌价值8.5亿欧元!C罗若退出国家队,葡萄牙足协恐遭商业巨震

品牌价值8.5亿欧元!C罗若退出国家队,葡萄牙足协恐遭商业巨震

星耀国际足坛
2026-10-09 21:36:15
欧洲坚持要在2027年停用俄罗斯,中国将成俄罗斯天然气唯一大买家

欧洲坚持要在2027年停用俄罗斯,中国将成俄罗斯天然气唯一大买家

抽象派大师
2026-10-09 00:22:43
艾米 :她的黄金时代来了!

艾米 :她的黄金时代来了!

芭莎珠宝
2026-10-08 17:46:11
葡萄牙足协纪律委员会发布多则处罚声明,但未提及C罗

葡萄牙足协纪律委员会发布多则处罚声明,但未提及C罗

懂球帝
2026-10-10 01:57:50
中储粮集团广西分公司党委书记、总经理余珂被查

中储粮集团广西分公司党委书记、总经理余珂被查

新京报
2026-10-09 16:14:13
【油价大跌】0.8元/升,今年最大油价下跌后,10月的油价“再下降”,10月15日或“大跌270元/吨”

【油价大跌】0.8元/升,今年最大油价下跌后,10月的油价“再下降”,10月15日或“大跌270元/吨”

油价早知道
2026-10-09 09:47:05
“干嘛呢?作秀呢?”这位北京社区书记被当面指责之后——

“干嘛呢?作秀呢?”这位北京社区书记被当面指责之后——

BRTV新闻
2026-10-09 15:52:51
影视表演艺术家彭玉逝世 享年93岁

影视表演艺术家彭玉逝世 享年93岁

北青网-北京青年报
2026-10-08 17:28:03
网友喊话“恢复49.9元优惠”,创始人直呼:“不敢了,九月份大学生活动亏了近千万”

网友喊话“恢复49.9元优惠”,创始人直呼:“不敢了,九月份大学生活动亏了近千万”

山西晚报
2026-10-09 17:16:31
2026-10-10 06:24:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
10075文章数 570关注度
往期回顾 全部

科技要闻

华为小米手机同日涨价,最高涨1000元

头条要闻

白宫新任新闻秘书人选公布 现任特朗普"真实社交"顾问

头条要闻

白宫新任新闻秘书人选公布 现任特朗普"真实社交"顾问

体育要闻

与C罗硬碰硬,一个72岁老人的倔强

娱乐要闻

吴奇隆宣布重要决定,走上谢霆锋老路

财经要闻

时隔12年,公募基金运作办法修订

汽车要闻

2027款深蓝L06及追风版上市 限时权益价11.49万元起

态度原创

时尚
艺术
亲子
家居
军事航空

时尚早知道!2027春夏十大流行趋势

艺术要闻

天造地设的才子佳人,凭什么声名传播700余年?真相太震撼!

亲子要闻

请叫我呆萌小可爱 骗你生女儿

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

直击南部战区海军某部重装空投训练

无障碍浏览 进入关怀版