arXiv | NeuroWeaver:让自主智能体“编织”轻量级EEG分析流水线

图片

该论文为arXiv预印本,题目为《NeuroWeaver: An Autonomous Evolutionary Agent for Exploring the Programmatic Space of EEG Analysis Pipelines》。

美国史蒂文斯理工学院王国安(Guoan Wang)为本文第一作者,Feng Liu 博士,美国史蒂文斯理工学院系统工程系助理教授,为本文通讯作者。论文当前版本为arXiv:2602.13473v2,更新于2026年5月21日。

论文链接:https://doi.org/10.48550/arXiv.2602.13473

图片

论文概要

从原始脑电信号到最终预测结果,研究人员通常需要针对不同数据集分别完成数据读取、信号预处理、模型设计、训练调参和结果评价。每当采样率、导联配置、文件格式或研究任务发生变化,原有分析程序往往需要重新修改,整个过程高度依赖具有脑电知识和编程经验的研究人员。

近年来,EEG基础模型通过大规模预训练获得较为通用的脑电表征,但通常具有较大的参数规模和计算开销;通用机器学习智能体虽然能够自动生成代码,却可能忽略采样率、导联数量、频谱结构和伪迹类型等EEG领域约束,生成无法运行或缺乏神经生理合理性的程序。

为此,作者提出NeuroWeaver,一种面向EEG分析流水线设计的自主进化智能体。该系统并不是让大语言模型直接读取EEG并进行分类,而是利用大语言模型自动生成、执行、调试和优化完整的本地EEG分析程序

NeuroWeaver首先根据数据特征和EEG领域知识缩小程序搜索范围,再通过多目标进化优化,在任务性能、相对改进、方案新颖性、运行效率和错误修复能力之间寻找较优方案。实验覆盖事件识别、情绪分类、睡眠分期、认知负荷和脑电减慢事件分类识别五类任务,最终生成模型的参数量仅为0.011M—1.20M。

研究背景

传统EEG分析通常采用人工设计的频域、时域或连接性特征,再结合支持向量机、随机森林等分类器完成预测。深度学习能够直接从信号中学习特征,但模型通常针对单一数据集和任务进行设计,面对新的导联配置、采样设备或受试人群时,仍需要重新调整数据处理和模型结构。

BIOT、LaBraM和NeuroLM等EEG基础模型试图通过大规模预训练学习通用表征,减少重复建模工作。然而,这类模型通常需要较多预训练数据,并伴随较高的微调和推理成本,在计算资源受限的实验室、临床或边缘设备上部署仍存在困难。

另一方面,AIDE和ML-Master等机器学习智能体能够在程序空间中搜索代码方案,但它们主要面向通用机器学习任务,缺少EEG特有的物理和神经生理约束,容易出现导联数不匹配、滤波设置不合理或程序无法端到端运行等问题。

作者由此提出一个核心问题:能否构建一个统一的自主智能体,根据不同EEG数据和任务,自动生成、验证、调试并优化轻量级、可执行的分析流水线?

研究方法

NeuroWeaver主要由程序空间建模、领域信息子空间初始化(DISI)和多目标进化优化(MOEO)三个部分组成,总体框架如图1所示。

IMG_256

图1 NeuroWeaver 总体框架:a展示NeuroWeaver通过统一智能体为不同EEG任务生成专用轻量级流水线;b展示完整流程,包括数据约束提取、领域知识检索、代码生成、环境验证、任务执行、自反思、自动调试和多目标进化优化。

在图1b所示的完整流程中,通过读取文件基本信息与检查数据质量,获取数据物理约束,为通用大模型生成EEG代码提供基础信息;之后结合当前任务,在Braindecode中获取成熟EEG模型知识并形成架构先验。由LLM根据前面获取的数据约束和领域知识生成完整流水线,生成后先通过Environment Validation检查运行环境和依赖,再由Task Execution真正执行并得到实验反馈,送入MOEO。MOEO根据性能、提升、新颖性、效率和修复情况五方面进行综合打分,并结合方案搜索树和UCT选择下一步需要扩展的节点。代码运行失败时进入Automated Debugging,根据报错和原始代码推断根因并生成修正版;运行成功则进入Self-Reflective Refinement,根据父节点结构和定量结果提出针对性修改。整个过程利用真实实验结果反过来指导下一轮代码生成,形成闭环自主进化,直到满足收敛条件后停止迭代并输出最优流水线。

(一)完整流水线生成模块

与仅搜索网络结构的传统方法不同,NeuroWeaver将一条完整、可执行的EEG分析程序作为候选方案。每条流水线需要依次完成数据加载、信号预处理、模型训练和结果评价:

(1)

其中,f_load、f_pre、f_model和f_eval分别表示数据加载、信号预处理、模型训练和结果评价模块。

因此,系统搜索的不是一个孤立的神经网络,而是一份能够从原始数据开始,完整输出预测结果和评价指标的可执行脚本。只要其中某个模块不兼容,该候选方案就无法完成端到端运行。

(二)领域信息子空间初始化模块

通用大语言模型可能生成不符合EEG数据特点的代码。为缩小搜索范围,DISI首先分析本地数据,并构建数据约束描述符:

(2)

其中,i_EEG表示采样率、导联和文件格式等采集信息,qartifact表示工频、眼电、肌电和异常导联等伪迹信息。

系统还会从Braindecode中检索卷积网络、循环网络、Transformer和基础模型等EEG架构知识,并将其总结为领域先验。初始候选流水线的生成过程如下:

(3)

其中,T_goal、φ_data和T_prior分别表示任务目标、数据约束和检索得到的EEG架构先验。

DISI并不直接确定最终模型,而是提前排除明显不合理的程序,使后续搜索集中在更符合EEG特点、也更容易正常运行的候选区域。

(三)多目标进化优化模块

MOEO将候选流水线组织为搜索树,并采用UCT策略平衡探索与利用:一方面继续优化当前表现较好的分支,另一方面尝试尚未充分搜索的新方案。

候选程序运行成功后,系统根据模型结构和定量评价结果进行自反思,并生成针对性的改进方案;如果程序执行失败,则根据错误信息进入自动调试分支。

每条候选流水线通过多目标奖励函数进行评价:

(4)

其中,M、Δ、Ω、Γ和Φ分别表示任务性能、相对改进、新颖性、运行效率和错误修复奖励;无法执行的候选程序获得固定惩罚−1。

通过“代码生成—环境验证—训练评价—自反思或调试—奖励回传”的闭环,NeuroWeaver不断优化候选程序,最终生成适合当前EEG数据和任务的轻量级分析流水线。

实验结果

论文在TUEV、SEED、HMC、Workload和TUSL五个公开数据集上进行了验证,分别对应EEG事件六分类、情绪三分类、睡眠阶段五分类、认知负荷二分类和脑电减慢事件三分类三分类任务。

实验主要采用Balanced Accuracy、Cohen κ、Weighted F1、AUROC和AUPRC等指标。每次搜索包含200次进化迭代,并行度设置为3。论文报告在其实验配置下,每次搜索的API成本约为20美元,该成本会随模型价格、搜索预算和系统配置发生变化。

表中的最终性能为最优流水线在三个不同随机种子下运行的均值和标准差。

(一)针对不同任务生成不同流水线

NeuroWeaver并不是使用同一个分类器处理所有数据,而是通过同一个智能体为不同任务生成不同的专用流水线。

在SEED情绪识别任务中,系统生成了由Temporal 1D CNN、挤压激励模块和注意力池化组成的模型,参数量为0.37M;在HMC睡眠分期任务中,采用CNN、两层BiGRU和时间注意力结构,参数量为0.18M。

对于TUEV事件识别任务,系统生成四阶段ResNet-1D,参数量为1.20M;对于TUSL脑电减慢事件分类任务,生成带空间丢弃的2D CNN,参数量为0.46M;在Workload认知负荷任务中,则生成由EEGNet和挤压激励模块组成的轻量级模型,参数量仅为0.011M。

不同模型还配套了导联丢弃、Mixup、标签平滑、时间抖动、高斯噪声和不同学习率调度策略。这说明NeuroWeaver自动调整的不只是网络主干,还包括与数据特征相匹配的训练和增强方法。

表1 五个EEG任务的生成流水线。

(二)性能与效率比较

与论文选取的任务专用方法相比,NeuroWeaver在五项任务共15个主要指标中有13项超过相应的最佳基线。未超过的两项均出现在TUSL数据集,分别为Cohen κ和Weighted F1,但其Balanced Accuracy仍高于相应任务专用基线。

在HMC数据集上,参数量为0.18M的流水线取得0.7862的Balanced Accuracy、0.7160的Cohen κ和0.7794的Weighted F1。

在Workload数据集上,参数量仅为0.011M的流水线取得0.7391的Balanced Accuracy、0.8436的AUC-PR和0.8403的AUROC。在这两个数据集上,NeuroWeaver超过了论文中参与比较的预训练基础模型。

在SEED、TUEV和TUSL上,LaBraM等基础模型仍在部分或主要指标上表现更好。因此,NeuroWeaver的优势并不是在所有任务上全面超过大型基础模型,而是以更小的参数规模获得具有竞争力的预测性能。

表2 NeuroWeaver在SEED情绪识别和HMC睡眠分期任务上的性能比较。

表3 NeuroWeaver在Workload认知负荷分类任务上的性能比较。

在计算效率方面,与各数据集表现最好的任务专用基线相比,生成流水线的参数量减少约1.3—219倍;在SEED、HMC、TUEV和Workload任务中,生成流水线达到训练平台期所需时间约为相应基线的1/3.3—1/5.1,单样本推理延迟最低约为基线的1/33。

TUSL是一个例外。其生成的2D CNN虽然参数量更少、单样本推理更快,但单步训练时间和峰值显存高于ContraWR。这表明NeuroWeaver搜索的是性能与效率之间的折中方案,而不是保证每一项资源指标都达到最优。

(三)消融实验与智能体比较

消融实验表明,移除DISI后,系统生成错误程序的数量增加,模型性能也出现下降;移除MOEO后,系统会失去树搜索、多分支探索、多目标奖励和错误修复机制,各项任务的结果均受到影响。

在TUSL的50次搜索迭代中,完整系统产生1个错误候选;移除DISI后增加至4个;进一步移除自反思和自动调试后,错误候选增加至9个。

这一结果表明,数据约束和领域知识有助于提高初始代码的合理性,自反思和自动调试则能够减少搜索预算浪费在无法执行的程序上。

图2 TUSL搜索树消融结果

在相同大语言模型配置和200次代码生成迭代预算下,NeuroWeaver还与AIDE和ML-Master进行了比较。在HMC、TUEV和TUSL三项任务中,NeuroWeaver的全部报告指标均高于两个对照智能体;AIDE在TUSL上未能生成完成端到端运行的脚本。

该结果表明,在通用机器学习智能体中加入EEG领域约束和多样化搜索机制,有助于提高生成程序的可执行性和任务适配能力。

局限与展望

为与现有方法进行公平比较,论文在基准实验中固定采用0.1—75Hz带通滤波、50/60Hz陷波、重采样至200Hz和10⁻²全局幅值缩放作为统一初始预处理。NeuroWeaver仍可在此基础上引入后续处理,但当前实验尚未完全放开从原始信号清洗、伪迹去除到模型设计的全流程联合搜索。

NeuroWeaver还依赖底层大语言模型的代码生成能力。不同模型版本、随机解码方式、搜索预算和API价格均可能影响最终方案的质量、稳定性和运行成本。

在数据隐私方面,原始EEG、预处理产生的受试者级数据以及模型训练和评价过程均在本地运行。外部大语言模型只接收任务描述、评价标准、采样率、导联信息、记录时长、文件格式和性能指标等有限信息。

不过,这种本地执行设计并不等同于已经获得医疗监管或临床应用认证。目前的实验主要验证了程序空间搜索方法的可行性,系统在真实临床环境中的稳定性、可复现性和安全性仍需进一步研究。

结论

本文提出了用于自动设计EEG分析流水线的自主进化智能体NeuroWeaver。该系统将EEG模型开发从“由专家手工设计一个网络”,转变为“智能体在领域约束下搜索一套完整可执行程序”。其中,DISI根据数据属性和EEG知识缩小搜索空间,MOEO则通过代码执行、结果评价、自反思和自动调试不断改进候选方案。

实验表明,NeuroWeaver能够针对五类不同EEG任务生成参数量为0.011M—1.20M的轻量级流水线,并在多数任务专用基线比较中取得更好的结果。该研究的主要价值不仅在于某个数据集上的性能提升,更在于展示了一种新的EEG分析范式:统一的不是最终分类模型,而是能够根据数据和任务自动生成专用分析程序的智能体。

——END——

撰稿人:程远

审核人:李景聪

图片

脑机接口与混合智能研究团队


登录用户可以查看和发表评论, 请前往  登录 或  注册
SCHOLAT.com 学者网
免责声明 | 关于我们 | 用户反馈
联系我们: