![]()
过去两年,随着大模型浪潮从自然语言、计算机视觉逐渐扩展到脑科学领域,EEG Foundation Model(脑电基础模型)开始成为国际学术界和产业界关注的新方向。从BIOT、LaBraM、EEGPT,到近年来出现的BrainOmni、CBraMod、REVE等模型,越来越多研究者希望通过大规模预训练,让模型从海量脑电数据中学习通用表征,并像GPT之于语言、CLIP之于视觉一样,成为脑信息解码领域的基础设施。
然而,一个长期存在的问题始终没有得到解决:这些模型究竟谁更强?强在哪里?又是否真正具备跨任务、跨数据集、跨被试的泛化能力?
与自然语言处理领域拥有GLUE、SuperGLUE,计算机视觉领域拥有ImageNet、COCO等标准化评测体系不同,脑电领域长期处于“各测各的”状态。不同团队使用不同的数据集、不同的数据划分策略和评价指标,即便两个模型都声称取得了“最优结果”,往往也难以进行直接比较。缺乏统一标准,使得EEG基础模型的发展始终缺少一个公认的坐标系。
![]()
近日,南方科技大学刘泉影教授团队发布的OmniEEG-Bench,正试图解决这一问题。作为目前覆盖范围较广的EEG基础模型评测体系之一,该工作构建了一个包含54个数据集、58个下游任务的标准化Benchmark,并在统一协议下系统评测了10个主流开源脑电基础模型。相比简单地发布一个排行榜,其更重要的意义在于首次尝试回答一个更基础的问题:当前EEG基础模型距离真正意义上的“通用脑电表征”还有多远。
![]()
用于 EEG 基础模型线性探针泛化能力的预训练数据多样性规模律(a)与模型规模律(b)
从六大任务族出发,构建脑电解码的能力地图
与传统脑电Benchmark通常聚焦于单一任务不同,OmniEEG-Bench最大的特点之一,是试图用统一框架覆盖脑电研究中的主要应用场景。
研究团队认为,脑电解码任务并不是彼此孤立的,而是可以沿着多个维度组织成一个连续的能力空间。例如,从反映长期稳定个体特征的疾病诊断,到刻画瞬时脑状态变化的睡眠监测;从低层次的信号质量评估,到高层次的自然语义解码;从被动监测到主动脑机交互,不同任务实际上对应着不同层级的脑信息处理能力。
基于这一思路,OmniEEG-Bench将58个下游任务划分为六大任务族。
首先是信号可靠性(Signal Reliability)。这一类任务并不直接关注认知或行为本身,而是聚焦脑电信号质量,包括伪迹识别、信号质量检测以及跨时段稳定性评估等内容。虽然这类任务在学术关注度上不如疾病诊断或脑机接口,但它实际上决定了后续所有脑电分析工作的基础质量,因此也是脑电系统走向真实应用的重要环节。
第二类是生物特征与疾病(Biometrics & Disease)。这是目前临床脑电研究最成熟的方向之一,涵盖癫痫、阿尔茨海默病、帕金森病、抑郁症等疾病分类任务,同时也包括基于脑电的身份识别等生物特征分析任务。对于很多医疗AI企业而言,这类任务也是最接近商业化落地的场景。
第三类为意识与状态(Consciousness & State)。其关注对象是脑状态的持续变化,例如睡眠分期、意识水平评估以及麻醉深度监测等。这类任务通常具有较强的时间连续性,需要模型能够理解脑活动在较长时间尺度上的动态变化规律。
第四类是认知与情绪(Cognition & Emotion)。近年来随着神经营销、教育科技以及智能驾驶的发展,情绪识别、注意力监测和工作负荷评估等任务受到越来越多关注。这些任务往往涉及复杂的高阶脑功能活动,也被认为是未来人机交互的重要基础能力之一。
第五类是自然刺激解码(Natural Stimulus Decoding)。从整个Benchmark结果来看,这也是当前最具挑战性的任务族。其主要包括自然语音解码、阅读理解相关脑电分析以及视觉语义分类等任务。本质上,这要求模型建立脑活动与复杂外部世界之间的映射关系,不再只是识别“是否产生某种状态”,而是理解大脑究竟在处理什么信息。
最后是运动与交互(Motor & Interaction)任务,包括运动想象(MI)、稳态视觉诱发电位(SSVEP)、外骨骼控制以及其他脑机接口交互场景。这类任务直接面向脑机接口应用,也是目前产业化程度最高、市场关注度最高的脑电应用方向之一。
![]()
OmniEEG-Bench 将 58 个任务分为 6 大类别:信号可靠性、生物特征与疾病、意识与状态、认知与情绪、自然刺激解码、运动与交互。
从整体覆盖范围来看,OmniEEG-Bench几乎囊括了当前EEG研究和应用的主要场景,使得不同模型能够在同一套评价框架下接受系统检验。
四种评测协议:评估的不只是精度,而是真实世界的泛化能力
如果说六大任务族回答的是“测什么”,那么四种评测协议回答的则是“怎么测”。
过去很多脑电研究存在一个问题:模型在实验室数据上表现优异,但一旦面对真实用户或新的数据采集环境,性能往往出现明显下降。因此,研究团队并没有将评测重点放在单纯的准确率比较上,而是更加关注模型在真实场景中的迁移能力和鲁棒性。
其中第一种评测协议是多被试适应(Multi-subject Adaptation)。在这一设置中,多个被试的数据被混合在一起,再按照试次进行训练集、验证集和测试集划分。这种方式主要考察模型在多用户环境中适应新样本的能力,也是许多实际应用场景中最接近现实的设置。
第二种是被广泛认为最具挑战性的跨被试迁移(Cross-subject Transfer)。在这一协议下,训练集和测试集来自完全不同的被试,模型需要将从一组用户身上学到的规律迁移到从未见过的新用户身上。对于EEG基础模型而言,这实际上是在考察其是否真正学习到了与个体无关的通用脑表征,而不是仅仅记住了训练数据中的特定模式。
除此之外,OmniEEG-Bench还设计了零样本与少样本适应(Zero-shot/Few-shot Adaptation)评测。在很多真实场景中,获取高质量脑电标注数据往往成本极高,因此模型必须具备在极少标注甚至无标注条件下完成迁移的能力。这一协议主要评估模型的数据效率,也是未来脑电大模型能否广泛落地的重要指标。
最后,研究团队还引入了通道遮蔽鲁棒性(Channel Masking Robustness)评测。现实世界中的脑电采集并非理想环境,电极脱落、接触不良、设备老化等情况都会导致部分通道失效。通过随机遮蔽一定比例的脑电通道,研究人员可以评估模型在传感器退化情况下的稳定性,这也是传统Benchmark中较少涉及但实际应用价值很高的测试维度。
![]()
OmniEEG-Bench 评估流程配备了四种评估协议:跨被试迁移、多被试试次级适应、零样本/少样本适应,以及通道遮蔽鲁棒性评估
主评价体系:冻结表征下的跨被试泛化能力
在所有评测协议中,OmniEEG-Bench最终选择“跨被试迁移+线性探针(Linear Probe)”作为主榜评价体系。
这一设置其实相当严格。评测过程中,预训练模型的骨干网络参数完全冻结,仅训练一个轻量级线性分类头。同时,训练集、验证集和测试集中的被试完全不重叠。换句话说,模型无法依赖针对具体任务的微调能力,而只能依赖其预训练阶段学习到的表征本身。
这种设计的核心逻辑在于,如果一个模型真的学到了通用脑表征,那么即使不进行复杂微调,也应该能够较好地适应新的任务和新的被试。反之,如果模型必须经过大量任务特定训练才能发挥作用,那么其“基础模型”属性实际上仍然有限。
评测结果显示,BrainOmni、CBraMod和REVE构成了当前EEG基础模型的第一梯队。其中BrainOmni以3.47的平均排名位居第一,CBraMod和REVE分别以3.49和3.73紧随其后。
不过,更值得关注的并不是谁排第一,而是没有任何一个模型能够在所有任务族中同时领先。BIOT在疾病相关任务上表现突出,REVE更擅长意识与状态任务,CBraMod在认知与情绪方向具有优势,而BrainOmni则在运动交互和自然刺激解码任务中表现更强。这说明当前脑电基础模型尚未形成真正意义上的“通用智能”,而是呈现出明显的任务偏好和能力专长。
![]()
十个主流脑电基座模型在 OmniEEG-Bench 上的综合排序
EEG领域开始出现自己的Scaling Law
在大语言模型领域,“Scaling Law”已经成为推动行业发展的核心规律之一。那么,EEG基础模型是否也存在类似现象?
OmniEEG-Bench给出了一个初步答案。
研究团队系统分析了模型参数规模、训练数据时长、训练被试数量以及预训练数据集数量等多个因素与最终性能之间的关系。结果发现,与模型排名最相关的因素并非训练时间,而是预训练数据集的多样性以及模型参数规模。
换句话说,对于EEG基础模型而言,仅仅增加训练时长或者收集更多来自同一数据源的数据,并不能持续带来收益。真正有效的是扩大数据来源的丰富程度,让模型接触更多任务类型、更多实验范式以及更多人群的数据分布。
与此同时,模型参数规模与性能之间也表现出明显正相关关系。更大的模型通常能够获得更好的平均排名,这意味着EEG领域已经开始呈现类似于自然语言领域的规模效应。
但与LLM不同的是,脑电数据具有更强的异质性和更复杂的时空结构。因此,研究还发现向量量化分词、掩码重建预训练以及交叉空间建模等架构创新,同样会显著影响模型性能。这说明未来EEG基础模型的发展并不会简单复制语言模型的发展路径,而是需要结合脑信号自身特点探索新的架构设计。
少样本适应与通道缺失鲁棒性:真实应用中的两道门槛
如果说排行榜反映的是模型的理论能力,那么少样本学习和通道缺失鲁棒性则更接近实际部署场景。
在少样本评测中,研究团队发现随着标注数据比例增加,大部分模型性能均会有所提升,但不同任务之间的增长趋势存在明显差异。信号可靠性和意识状态任务通常能够持续获益,而认知情绪、生物特征疾病以及运动交互任务则更容易出现性能平台期。
其中,BrainOmni展现出了相对更好的少样本适应能力。这意味着其预训练表征在有限标注条件下更容易被下游分类器利用。然而从整体结果来看,当前EEG基础模型距离真正意义上的Few-shot Learning仍有较大差距,远未达到“大模型只需少量样本即可快速适应新任务”的理想状态。
与此同时,在通道遮蔽测试中,随着被遮蔽通道比例不断增加,大多数模型性能呈现持续下降趋势。当大量通道缺失时,不少模型甚至接近随机猜测水平。这意味着当前模型虽然具备一定迁移能力,但对完整传感器阵列仍存在较强依赖。
对于未来的脑机接口系统而言,这无疑是一个重要挑战。无论是消费级脑电设备还是长期植入式脑机接口,都不可避免会面临信号衰减、电极失效或通道缺失问题。如何让模型在信息不完整条件下仍能稳定工作,可能将成为下一代EEG基础模型的重要研究方向。
一个值得关注的结论:基础模型仍未达到“即插即用”
OmniEEG-Bench最后还比较了全量微调(Full Fine-tuning)与线性探针(Linear Probe)两种模式下的模型表现。
结果显示,经过全量微调后,大多数EEG基础模型都能够超越传统专用模型,例如EEGNet和EEGConformer。这说明预训练确实能够提供更好的初始化,并帮助模型获得更高的下游性能上限。
但另一方面,当骨干网络被冻结,仅训练线性分类头时,大多数基础模型仍难以稳定超越EEGConformer。这意味着当前EEG基础模型更多体现为一种“可微调能力”,而非真正意义上的“开箱即用能力”。
换句话说,今天的EEG Foundation Model更像是一个优秀的预训练起点,而不是像GPT那样能够直接迁移到大量新任务的通用基础模型。
从这个角度看,OmniEEG-Bench或许揭示了当前脑电大模型发展的真实阶段:行业已经迈出了从“小模型时代”走向“基础模型时代”的关键一步,但距离建立真正通用、可迁移、可部署的脑电智能系统,仍有相当长的一段路要走。而跨被试泛化、自然刺激解码、少样本学习以及通道缺失鲁棒性,或许正是决定下一代EEG基础模型竞争格局的关键战场。
论文链接:https://doi.org/10.48550/arXiv.2606.00815
代码链接:https://github.com/ncclab-sustech/omni-eegbench.git
![]()
脑机接口社区是国内首家脑机接口(BCI)产业服务平台、国内脑机接口新媒体开创者与引领者。主要为企业、科研团队、投资机构和从业者提供以下服务:
宣传报道:图文、短视频、直播形式报道企业动态、技术解读、产品介绍等内容,提升曝光和行业影响力。
资源对接:根据需求匹配资本、供应链、临床机构、渠道方等资源,完成真实对接,促进合作。
成果转化:协助技术团队寻找产业方、投资人及落地场景,推动技术到产品的转化。
活动策划执行:承接线上线下路演、沙龙、论坛等活动的策划与执行。
其他定制需求:包括报告定制、市场调研、人才招聘支持等个性化服务。
合作洽谈,请联系微信:ZuoLeiLeiya
(备注:姓名-单位-合作)
投稿丨成为创作者,请联系微信:RoseBCI
不错过每一条脑机前沿进展
一键三连「分享」、「点赞」和「在看」
欢迎在评论区聊聊
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.