位置:首页  >  详情页
牛津大学脑机接口团:队发布史上最大规模MEG语音解码数据集
来源:72G手游网 编辑:陈珍杰 2026-09-22 20:33:14


2024年,一台植入式脑机接口设备让一位瘫痪多年的患者重新"开口说话",词错误率低于5%,比很多语音识别软件还准。这听起来像科幻电影,但代价是要在脑子里动手术,植入电极。这条路能救人,却没法普及。真正的希望在另一条路上:不开颅、不动刀,只靠戴在头上的设备读懂大脑信号。这条路走得慢得多,而牛津大学的PNPL实验室觉得,慢的原因之一,是这个领域一直没有一个像样的"共同题库"。

你可能没意识到,计算机视觉能在过去十年突飞猛进,一个被低估的原因是ImageNet的出现。

在ImageNet之前,不同实验室各自收集小规模数据、各自定义评测标准,谁也说不清哪个方法真的更强。ImageNet给了所有人同一套题目、同一把尺子。脑机接口领域,尤其是非侵入式的那部分,至今没有这样一把尺子。牛津团队这次发布的LibriBrain100,想做的正是这件事。

先说清楚这个数据集在测什么。它记录的是脑磁图信号,英文缩写MEG。

MEG*:全称脑磁图(magnetoencephalography),一种非侵入式脑成像技术,通过头皮外的超导传感器捕捉大脑神经活动产生的微弱磁场,不需要开颅,受试者只需戴上一个像头盔一样的设备。

具体的实验场景是:让志愿者戴着这个"头盔",听有声书、听新闻播客、听经过语音学设计的句子,同时记录他们大脑的磁场变化。研究者想知道,能不能从这些磁场信号里,反推出这个人当时听到的是哪个词。这个任务叫词分类。

一件事的规模,决定了它能撬动多大的杠杆

这个数据集最引人注目的数字是:一个人贡献了将近80个小时的脑磁图数据。

这不是笔误。研究团队把这个人称为"0号受试者",让他反复来实验室录了将近80小时的脑活动记录,是此前同类数据集里最深纪录的8倍,是绝大多数同类数据集的80倍。

这里有个问题必须先解释清楚:为什么要死磕一个人的数据量,而不是多找些人分摊时间?

答案藏在此前一系列研究的发现里。2025年发表在《自然-通讯》上的一篇论文做了个对比实验:同样的总录制时长,分给很多人录一点点,还是集中在少数人身上录很多,哪种效果更好?结果是后者碾压前者。一个录了10小时的单人数据集,解码效果显著超过总时长更长但分散在几十个人身上的数据集。

这背后的道理其实不难理解。每个人的大脑长得不完全一样,脑区位置、信号强弱、噪声模式都有个体差异。如果你想让一个模型学会从某个人的脑电信号里读出词义,你需要给它足够多这个人的样本,让它把这个人的"信号方言"学透。你今天录10分钟,明天换一个人再录10分钟,模型永远在学新方言,学不精。

打个比方,这就像你想学会听懂一个人的口音。如果你和这个人朝夕相处一整年,你会越来越熟悉他说话的节奏、习惯、含糊不清的地方。但如果你每天换一个陌生人聊十分钟,一年下来你接触的人更多,但你对任何一个人的口音都停留在"刚认识"的阶段。如果不集中在少数人身上积累深度数据,模型学到的永远是浅层的、泛化性差的东西,这正是为什么团队宁可让一个人重复来实验室几十次,也不愿意分散精力多找几十个人各录一点。

原来的LibriBrain数据集(可以理解成LibriBrain100的上一代版本)已经做到了单人50多小时,这次的LibriBrain100把这个数字推到了80小时,并且把整套福尔摩斯探案集九本书全部读完(上一版只读了七本),同时加入了两类新素材:一是专为控制语音学变量设计的TIMIT和MOCHA-TIMIT语料库,二是30期播客故事。

TIMIT*:一套专门为语音识别研究设计的美式英语语料库,句子经过精心挑选,让每个音素(也就是英语里最小的发音单位,比如"b""t""ee"这些)出现的频率尽量均衡,常被用来研究大脑如何处理具体的发音细节。

MOCHA-TIMIT*:TIMIT的英式英语版本,增加了男女两位英国口音说话人的录音,同样服务于语音学层面的精细分析。

为什么要额外加这两个语料库?因为福尔摩斯探案集虽然量大,但题材单一,反复读九本侦探小说,听多了会发现语言风格、词汇分布高度重复。这样的数据能训练模型识别"这个人在这种叙事风格下大脑是什么反应",但没法回答"大脑对不同发音方式的敏感度"或者"大脑如何处理陌生的语义内容"这类问题。TIMIT和MOCHA-TIMIT专门控制了音素分布,播客则带来了从津巴布韦独立到战时巴格达、从丧亲之痛到科学考察等五花八门的话题,补上了语义多样性这一课。

一个人不够,32个人来凑

深度数据固然重要,但现实世界里,你不可能要求每个想用脑机接口的人先来实验室躺80个小时。这在临床应用上完全不现实,病人没有这个精力,医院也没有这个资源。

于是团队做了第二件事:找来32位新的志愿者,每人只录了大约40分钟。这构成了数据集的"广度"部分,和0号受试者的"深度"部分形成互补。

这个设计思路,其实很像手机厂商做AI语音助手的策略。厂商不可能让每个用户先对着手机说满100个小时的话来"训练专属模型",那样没人会买账。他们的做法通常是先用海量通用语料训练出一个大模型,让新用户只需要说几句话做"个性化微调",体验就能大幅提升。如果没有这个大模型打底,每个新用户从零开始训练,效果会差很多,而且门槛高到没人愿意用。LibriBrain100里那80小时的深度数据,扮演的正是这个"打底大模型"的角色,32人的浅层数据则是用来验证:有了这个底子,新用户只需要很少的数据就能被识别。

这套组合拳到底管不管用?团队用一个叫MEG-XL的预训练模型做了三组实验来验证。

MEG-XL*:一个先在多个数据集(包括约300小时、800名受试者的脑电和脑磁数据)上预训练,再针对具体任务做微调的语音解码模型,借鉴了大语言模型"先海量预训练、后小样本微调"的思路。

第一组实验测的是:把32个新人的数据也拿来一起训练,对0号受试者自己的解码效果有没有帮助?结果有点意思,在听有声书这个任务上,加入32人数据后,准确率从52.5%(相当于79万比特每词左右,这里简化成百分比表述)提升到58.5%;但如果测试的是TIMIT这种控制过的语音材料,加进32人数据反而效果更好,准确率从39.3%提升到43.1%。唯独在有声书这个任务上,如果只用0号受试者自己的福尔摩斯数据训练,反而比加入32人数据表现更好一点点,达到49.2%,不过差距很小。

这说明什么?说明"用别人的数据帮自己"这件事不是无脑加法,得看任务性质。福尔摩斯小说这种高度个性化、风格固定的素材,0号受试者自己的历史数据已经足够精准地刻画这种模式,别人的数据反而可能引入一些"噪声"或者说是不完全对齐的模式。但在TIMIT这种更标准化、跨说话人共性更强的任务上,多样化的训练数据反而能帮模型学到更稳健的规律。

第二组实验反过来测:0号受试者的80小时深度数据,能不能反哺32个新人,让新人的解码效果变好?

结果非常干脆。加入0号受试者数据训练后,32人的平均准确率是47.8%,不加入则只有32.9%,整整差了15个百分点。而且这个提升在32个人身上几乎是普遍现象,不是靠某几个"天赋异禀"的受试者拉高平均值。

这15个百分点意味着什么?意味着如果不用0号受试者的深度数据打底,新用户每猜10次里大概能猜对3次多一点;而用了这个底子之后,10次里能猜对将近5次。对一个想靠脑机接口交流的人来说,这个差距可能就是"勉强能用"和"根本没法用"的区别。

第三组实验更进一步追问:能不能把32人身上需要的数据量继续压缩,压到10分钟左右,还能不能保持效果?

团队把32人分成三组,第一组用100%的可用训练数据微调,第二组只用50%,第三组只用25%(大约相当于10分钟)。结果显示,三组的解码准确率几乎没有差别,分别是49.2%、48.8%、48.2%。真正拉开差距的,始终是"有没有加入0号受试者的数据",而不是"新用户自己录了多少分钟"。

这个结果如果成立,对未来的临床应用是个好消息。如果一个瘫痪患者只需要贡献10分钟左右的脑活动数据,就能获得接近于用了几十分钟数据的解码效果,那对患者的负担会小很多。当然,团队在论文里也很谨慎地提醒,这些数据全部来自健康志愿者听讲的场景,离真正给病人用还有距离。

顺带一提,团队还用一种叫OVMI的信息论指标,把这套非侵入式方案和2021年一个真正用在瘫痪患者身上的植入式脑机接口做了对比。

OVMI*:一种衡量脑机接口"信息传输效率"的指标,单位是每次尝试传递多少比特信息,数值越高说明这套系统能更快、更准地把使用者的意图转化成可理解的输出。

植入式方案那边измеряется出的数值是0.259比特每词尝试,而这次非侵入式的MEG-XL模型是0.075,如果换成专门优化过的词汇表能到0.147。差距还很大,但团队也坦承,这个对比只是个参照系,毕竟一边测的是"听懂了什么词",另一边测的是真正的"意图表达",不是同一件事。这更像是给整个领域立一个路标:我们现在走到哪儿了,离那个植入式的里程碑还有多远。

数据从哪来,又能怎么用

聊了这么多实验结果,回到最基础的问题:这些数据长什么样,普通研究者要怎么拿到手用?

原始数据是306个传感器同时记录、每秒采样1000次的脑磁场信号,经过降采样处理后变成每秒250次,这个降采样保留了高伽马频段(70到125赫兹)的振荡信息,这个频段被认为和语言处理密切相关。数据配有详细的时间标注文件,精确到每个词、每个音素的起止时间点,这样研究者才能把"某个时间点的脑活动"和"当时正在听的具体词语"对应起来。

为了让这套流程真正可用,团队专门做了一个叫pnpl的Python工具库,一行pip install pnpl就能装上,内置了下载、预处理、按需筛选数据的功能,连深度学习框架需要的数据格式都封装好了。这个细节其实很重要,因为一个数据集如果只是扔在网上一堆文件,真正能用起来的研究者会少很多。工具链完善,才能真正降低门槛。

整个标注工作花了超过200个小时的人工核对,先用自动化的语音活动检测和强制对齐工具打底,再人工逐条修正边界不准的地方,尤其是人名、外语引用、口语中的重复和修正这些自动化工具容易出错的地方。这种"机器打草稿、人工精修"的模式,某种程度上很像现在很多AI数据标注的常见做法,只不过这里标的不是图片里的猫和狗,而是脑磁波形里每一个词的起止时刻。

写在后面

看完这份工作,我印象最深的一点不是那80小时的数据量,而是那15个百分点的对比实验。它其实在回答一个更根本的问题:一个人的深度经验,到底能不能被"打包"送给另一个几乎没有经验的人?

在人类社会里,这个问题有很多现成的答案,老师傅带徒弟、老中医传方子、老司机教新手上路,靠的都是经验的迁移,而不是每个人从零开始摸索。这次实验用数字证明了同样的逻辑在大脑信号解码上也成立:一个人攒下的80小时经验,能实实在在地帮另一个只花了10分钟的人,把准确率从32.9%拉到47.8%。这不是一句励志的比喻,是一组真实测出来的数字。

另一个让我反复想的细节是,团队特意提到,他们同时也在收集"内心默念"而不是"听声音"的数据,准备在未来发布。这提醒我们,LibriBrain100测的其实是相对容易的场景,人听懂了一句话,大脑的反应本来就比较清晰、信噪比高。真正难的是让一个人默默地"想"一句话,或者尝试发声却发不出来,这才是瘫痪患者真正需要的场景。这份数据集是一块扎实的地基,但离真正的"意念打字",中间还隔着一段没人走完的路。

Q&A

Q1:LibriBrain100数据集是什么?

A:LibriBrain100是牛津大学团队发布的大规模脑磁图(MEG)数据集,总时长超过100小时,其中一位受试者贡献了约80小时的深度数据,另外32位受试者各贡献约40分钟,专门用于研究非侵入式脑机接口的语音解码,数据来自志愿者听有声书、播客和语音学语料库时的脑活动记录。

Q2:为什么要让一个人录80小时数据,而不是找更多人分摊时间?

A:研究发现单人深度数据比分散在多人身上的浅层数据解码效果更好,因为每个人大脑信号存在个体差异,模型需要足够多同一个人的样本才能精准学习其"信号特征",实验证实用0号受试者数据打底后,新用户解码准确率提升了15个百分点。

Q3:这份数据集离真正能用的脑机接口还有多远?

A:目前还有距离。这份数据记录的是"听懂语音"时的脑活动,信噪比较高,而真正的脑机接口需要解码"内心默念"或"尝试发声却发不出来"的场景,难度更大,团队表示正在收集这类数据,未来会陆续发布。

探索首尔百家乐的魅力,理解游戏背后的深层次逻辑【哔哩哔哩】_【bilibili】 牛津大学脑机接口团:队发布史上最大规模MEG语音解码数据集
首尔百家乐

https://xin.abies.asia/ArTitle/DeTails/241780.sHtML

「活动」首次登录送38积分

631.68MB
版本V0.41.02
下载首尔百家乐安装你想要的应用 更方便 更快捷 发现更多
喜欢 85%好评(13人)
评论 68
探索首尔百家乐的魅力,理解游戏背后的深层次逻辑 首尔百家乐截图1 首尔百家乐截图2 首尔百家乐截图3 首尔百家乐截图4
详细信息
  • 软件大小 278.13MB
  • 最后更新 2026-09-22 20:33:14
  • 最新版本 V3.58.92
  • 文件格式 apk
  • 应用分类 ios-Android手机版pc28客户端下载
  • 使用语言 中文
  •  需要联网
  • 系统要求 7.15以上
应用介绍
一.11选5开奖结果北京  选择六安seo网络推广效果好的公司,提升品牌知名度与曝光率 澳门老虎机1597官网
二.ag视讯  武汉互联网营销首选乐云seo包满意,提升品牌影响力与客户转化率
三.威尼斯反水AV网站  南京百度百科实力乐云seo的应用前景,探讨南京百度百科实力乐云seo的影响因素
四.SG神灯  百科创建费用首荐乐云seo,深度剖析与实际应用场景
五.金冠账号体育  如何进行seo万金手指花总二,掌握关键技巧提升网站流量
六.摩登平台官网  深圳百度霸屏,唯辛乐云seo带来的新机遇上海百度推广茄尉T乐云seo的市场现状,分析其潜在价值与应用
七.必发彩票app官网  百度推广销售好做吗,seo黑帽手法的风险与挑战
八.捕鱼能下分  百度 SEO 工具的选择与使用,掌握技巧提升网站排名

【联系我们】
客服热线:400-5466-8483
加载更多
版本更新
V3.64.64
薛城抖音搜索关键词seo优化排名的重要性与实施策略

类似软件

猜你喜欢

包含 97久久香蕉国产线看观看 的应用集
评论
  • 掌握搜索引擎优化技巧,学习seo零基础入门教程百度云 3天前
    提供兴安盟seo优化一站式服务,助力企业网络营销提升
  • 长安区电子seo服务销售价格分析,了解市场行情与实际效果 6天前
    掌握关键词seo万金手指科杰二二,提升网站流量与排名
  • 网站推广知名,乐云seo万词霸屏专家带你探索优化之道 5天前
    谷歌SEO优化零基础自学B2B,掌握实用技巧助力业务增长
  • 北京网络广告行业的现状与发展,乐云SEO十年的历程与启示 3天前
    探索seo快速荚卫伈CJ111602一线的潜力与应用场景,解析其在行业中的重要性
  • 百度爱采购排名实力分析,乐云seo如何提升效果 3天前
    南昌网站推广v1一戈seo24,深度剖析网站优化的实际应用
  • 提升武汉市SEO关键词排名优化代理实力,掌握市场动向与策略 4天前
    百度霸屏费用逐渐透明化,品牌乐云seo助力效果提升
  • 提升蚌埠市关键词seo排名优化的策略与实践,探索蚌埠市关键词seo排名优化的应用价值 7天前
    小米官网产品相关的SEO文章怎么写,提升产品曝光度与用户体验
  • 威海seo织梦dedecms模板第五期,探讨其应用与发展方向 9天前
    北京网址优化丷乐云seo十年,探索行业变迁与未来方向
  • 长春seo关键词排名优化团购,提升网站流量与转化率 2天前
    选择seo服务公司赌得,云23速23捷让网站更具竞争力
  • 成都网络接单都选乐云seo十年,助力企业数字转型与品牌提升 2天前
    法库电商抖音SEO优化要多少钱,影响因素与实际应用场景分析