

该论文发表于Journal of Neuroscience Methods,题目为《EEG-AI: An agentic system for AI-assisted semi-automated EEG preprocessing and artifact removal》。
第一作者为来自加拿大多伦多圣迈克尔医院的Abdelrahman Abdou,通讯作者为任职于多伦多大学及圣迈克尔医院的Venkat Bhat。
论文链接:https://doi.org/10.1016/j.jneumeth.2026.110759

针对脑电图(EEG)预处理依赖人工检查、独立成分分析(ICA)伪迹判读耗时且主观性较强的问题,Abdou 等提出 EEG-AI:一种由人工参与的半自动预处理与伪迹去除框架。系统结合常规信号处理、ICA 和两个协作代理:分类代理整合 ICLabel、ALICE与自定义功率谱密度(PSD)分类器,对独立成分进行集成判别;重运行代理依据分类置信度及残余伪迹指标,决定是否重建信号并迭代处理。处理结果和判定记录供 EEG 专家复核、修正或否决,研究使用合成 EEG 及公开的静息态和视觉注意任务数据,对伪迹分类、信号重建和处理效率进行评估。结果显示,该系统在合成数据上取得约 67 dB 的信噪比;在视觉注意数据上,与专家标注基准比较的相关系数为 0.666 ± 0.188,重建误差平均约为百万分之五,单名受试者的处理通常需 15–30 分钟,相较人工流程可将耗时至少减半。
该框架展示了 LLM 代理辅助 EEG 清理并保留专家把关的可行性,但目前仍属概念验证,数据集规模和类型有限,且真实 EEG缺少绝对清洁基准;其临床及移动场景中的泛化能力仍需在更多样本和环境中验证。
研究背景
脑电图(EEG)广泛用于神经科学研究和临床评估,但其信噪比较低,眼动、肌电、心电及环境噪声等伪迹又常与神经活动混杂,可能影响后续分析。传统预处理通常依赖专家目视检查、数据片段筛选和独立成分分析(ICA)后的人工判读,耗时且难以标准化,即使采用自动分类工具,ICA 成分中神经信号与伪迹相混、分类结果存在不确定性,也使人工复核仍是瓶颈。随着大语言模型调用分析工具、处理多步任务的能力发展,研究者开始探索由 AI 协调预处理流程、综合多个分类器结果并迭代评估清理效果,同时保留专家审核与干预的方案,以提升 EEG 预处理的效率、一致性和可复现性。
本文针对 EEG 信号信噪比较低、传统预处理依赖人工检查且耗时的问题,提出了一种人机协同的 AI 辅助预处理框架。该框架由大语言模型驱动的决策 Agent 调用 EEG 分析工具,结合多个独立成分分类器的结果,迭代判断哪些成分应保留或去除,以及是否需要重新运行处理流程,并由专家进行审核。研究使用合成 EEG 和专家标注的真实 EEG 数据评估系统,结果显示其伪迹清理表现与现有方法相当或更好,此框架有望提高 EEG 预处理效率,同时保留专家监督。

图1 EEG-AI闭环预处理框架:分类、重建、重运行与人工审核相互衔接
系统首先按通道名称匹配MNE-Python标准电极模板;无法精确匹配时默认采用BioSemi-64模板。它使用局部离群因子(LOF)、相关性、偏差和RANSAC等方法识别坏导联,并检测峰值、平线和肌电污染时间段。随后采用1 Hz高通滤波去除慢漂移、60 Hz陷波抑制工频干扰、100 Hz低通滤波削弱高频噪声。这些操作主要由MNE和PyPREP中的现有函数实现。
ICA把多通道混合EEG拆成多个相对独立的来源。系统用三种互补方法识别每个来源:ICLabel依据头皮地形图、功率谱密度(PSD)和自相关等信息输出脑、肌肉、眼、心脏、线噪声、通道噪声及其他七类概率;ALICE综合空间、频谱与时间特征;作者自建的PSD模型使用39个频域和统计特征。三个模型通过多数投票给出最终类别,置信度取支持该类别模型的平均后验概率。

图2 独立成分分类示例:头皮地形图、功率谱、时间段热图及平均诱发响应共同辅助判断
首次处理后必定重运行一次。此后,若被判为伪迹的成分平均分类置信度低于0.8,系统会从保留成分重建EEG,再用相同滤波参数、秩和坏导联策略重复分析;总迭代次数最多为4次,防止无限循环。论文第2.4.1节另规定,重建时保留置信度至少为0.8的“脑”或“其他”成分。完成自动重建后,专家查看清理后的波形、置信度、头皮图和PSD等结果,可以批准输出,也可以否决并要求调整后重运行。
在合成数据上,EEG Agent 的SNR、RMSE与ALICE几乎相同;其相关系数为0.133±0.0502,并不是所有指标都优于单模型。在真实数据集ds006563上,EEG Agent 的CC高于ICLabel和ALICE,但低于PSD模型,SNR也低于ICLabel和PSD模型。因此,结果更准确的表述是:该系统总体达到与现有方法相当的清理水平,并在部分指标上表现较好,而非在全部指标上全面领先。
表1 不同方法在真实数据集 ds006563 上的主要结果(均值±标准差)

效率方面,系统每名受试者约需15—30分钟,即可生成独立成分标签、清理后EEG、头皮图、PSD、时间段热图和诱发响应;论文称传统人工密集流程每名受试者可能需要1小时以上,因此该方法有望将处理时间至少缩短一半。不过,处理时间会受数据规模、硬件、API延迟和重运行次数影响,尚不能直接推广到所有实验室。

图3 ICA清理前后各脑电频段的功率谱比较

图4 FC1频道在ICA数据清理前后脑电信号比较
本研究最有价值的地方不只是增加了一个分类器,而是把一次性分类改造成“分类—重建—复核—重运行”的闭环。多模型投票可降低单一模型偏差,固定参数重运行和运行台账有助于复现,人工最终审核则为模糊成分和异常样本提供安全边界。专家的角色由逐个检查独立成分,转变为检查摘要、置信度和审计记录,这更适合大规模数据处理。
但从方法描述看,系统的关键重运行条件主要是预设规则,LLM实际增加的决策价值与普通规则引擎相比尚未被单独消融验证。此外,论文将不同分类器的置信度直接平均,默认这些概率可以相互比较,但各模型可能存在不同程度的概率失准。表格数据也显示优势随指标而变化,因此“始终优于传统流程”的概括需要谨慎。
第一,真实验证数据规模较小:ds006563只有12名健康成人,且来自受控实验环境,不能代表临床、移动EEG或不同年龄患者。第二,ds002778没有清洁真值;即使SNR、RMSE等统计指标改善,也不等同于神经生理信息一定被完整保留。第三,系统依赖ICA分解质量和电极模板,输入质量差时错误会传递到分类和重建。第四,固定0.8阈值和最多4次循环可能对某些高质量数据处理过度,也可能对低信噪比数据停止过早。第五,LLM还受提示词、模型版本、成本、隐私和不确定性校准影响。
未来应在更多疾病、设备、电极布局和真实临床环境中进行外部验证,并开展消融实验,分别比较“规则系统”“单模型”“多模型集成”和“LLM智能体”的独立贡献。作者还提出引入动态因果模型(DCM),用脑网络动力学是否合理来补充表面信号指标;同时可通过模型压缩、工具缓存和异步批处理降低延迟与费用。
EEG-AI展示了一种面向专家的半自动EEG预处理原型:它把标准滤波、ICA、三个分类器、闭环重运行、完整日志和人工审核组合在一起。现有实验说明该系统可在保持专家监督的前提下减少重复工作,并获得与常用方法相当、部分指标更优的清理结果,但其数据规模、真实真值、跨场景泛化及LLM独立贡献仍需进一步验证。因此,本研究更适合被理解为具有可行性的决策支持概念验证,而不是已经能够脱离专家、直接用于临床的全自动系统。
——END——
撰稿人:彭灿
审核人:李景聪

脑机接口与混合智能研究团队
