Science Advances|基于脑机接口实现全频谱汉语实时解码

图片

该论文发表于Science Advances(中科院1区top,IF:13.9),题目为《Real‑time decoding of full‑spectrum Chinese using brain‑computer interface》。

上海复旦大学上海医科学院华山医院神经外科钱友坤,刘长江研究员为此文的第一作者。上海复旦大学上海医科学院华山医院神经外科吴劲松研究员、中国科学院研究生院周志涛研究员为共同通讯作者。

论文链接:https://www.science.org/doi/10.1126/sciadv.adz9968

图片

论文概要

言语脑机接口(BCI)可为肌萎缩侧索硬化(ALS)、脑干卒中导致的失语患者重建沟通能力。目前言语解码研究大多面向英语等非声调语言,针对汉语这类声调单音节语言开展实时解码一直是领域重大难题。汉语具备声调载义、单音节构词、同音字数量庞大的语言特征,极小的解码误差就会输出完全不同的汉字,传统以音素为核心的解码框架很难适配汉语。

本研究将汉语音节(同时包含声母韵母与声调信息)作为核心解码单元,采用256通道高密度柔性皮层脑电(ECoG)脑机接口系统,直接从大脑神经信号中解码394个常用汉语音节。离线单字阅读任务中音节解码中位准确率达到71.2%;结合分层字符‑句子解码策略与3‑gram语言模型,实现了句子的实时解码,系统最高通信速率可达49.7字/分钟。该工作证实面向声调语言的音节一体化解码方案具备可行性,为未来面向汉语的临床言语神经假体系统打下坚实基础。

研究背景

大脑高级神经认知功能支撑人类语言表达,卒中、脑肿瘤、神经退行性疾病等疾病会严重损伤言语功能,造成患者丧失语言表达能力,严重降低患者及家属生活质量。脑机接口通过直接读取大脑神经信号解析言语意图,是帮助失语患者重获交流能力极具前景的技术路径。

现有脑机言语解码工作大多围绕英语开展,依靠腹侧感觉运动皮层(vSMC)神经信号,将神经活动转换为语言单元,已经可以实现瘫痪患者的实时言语转文字、语音输出。但汉语属于典型声调语言,声调直接决定词义;同时汉字以单音节语素为主,同音字密度极高。英语可以依靠大量音素冗余通过语言模型纠错补偿,而汉语一旦解码出现微小偏差,就会输出另一个合法但语义完全不符的音节,对解码精度提出极高要求,也限制了现有西方语言解码方案直接迁移到汉语。因此亟需开发适配汉语语言特征的全新解码框架。

研究方法

本研究招募一名接受癫痫术前脑电监测的43岁女性受试者,植入256通道高密度柔性ECoG电极阵列,电极覆盖颞中回、颞上回、腹侧感觉运动皮层以及部分额下回岛盖部,采集颅内皮层神经信号开展实验。受试者完成两类实验任务:①单字阅读任务,屏幕依次展示汉字,受试者大声朗读汉字,用于训练全频谱神经解码器;②句子阅读任务,受试者完整朗读屏幕给出的句子,用于评估实时句子解码性能。

整个实时解码流水线分为多步:①对原始皮层脑电信号做预处理,提取70‑170Hz高γ频段神经活动,采用50ms滑动窗口、10ms步长持续处理信号;②言语起始点检测,定位说话起始时刻,截取起始点前后−300~+700ms共1000ms神经片段送入解码器;③双流LSTM解码器并行输出音节、声调的概率分布;④结合音节‑声调映射得到候选汉字,beam搜索算法融合神经解码概率与汉语3‑gram语言模型,输出最终预测文本。

研究对比CNN‑LSTM、ViT、四层堆叠LSTM多种网络架构,最终选择性能最优的四层堆叠LSTM作为核心解码模型。采集覆盖394个汉语音节的大规模神经数据集,探究训练样本重复次数、音节数量对解码精度的影响;同时结合术前fMRI脑成像,分析言语运动脑区与解码高贡献电极之间的空间对应关系。

在实时系统验证阶段,解码器在单字任务数据集完成基础训练,再使用句子数据微调模型,开展实时句子解码测试。同时搭建完整脑机接口应用系统,将解码输出对接机械臂、数字人虚拟形象、大语言模型,完成多场景概念验证。

图1 用于解码汉语句子的实时脑机接口框架

图2 汉语的语言特点以及区分汉语音节与声调的皮层电极

实验结果

离线音节与声调解码性能四层堆叠LSTM模型对394个汉语音节离线解码中位准确率达到71.2%,显著优于CNN‑LSTM、ViT模型;声调解码中位准确率可达69.1%,远高于25%随机水平。随着每个音节训练重复样本增加,解码准确率持续上升;即便解码集合音节数量从50增加至350,整体精度仅小幅下降,证明该解码框架具备良好可扩展性。混淆矩阵结果显示模型容易区分仅元音不同的音节,仅在发音高度相似音节出现少量混淆。fMRI语言运动激活脑区和高贡献解码电极空间高度重合,证实腹侧感觉运动皮层是汉语音节、声调编码的核心脑区。

实时句子解码与系统应用纯神经解码条件下实时句子字符准确率61.5%;引入3‑gram语言模型后字符准确率提升至73.1%,系统通信速率为49.7字符每分钟。在概念验证演示中,该脑机接口系统可以实现多种外设控制:机械臂控制字符准确率78.3%,指令匹配准确率54.0%;驱动数字虚拟人输出语音字符准确率76.9%;对接大语言模型交互字符准确率65.4%,证明解码输出可以直接驱动外部软硬件设备。

研究局限性分析本研究实时阶段的言语起始检测采用音频信号,后续开发了纯神经信号的言语起始检测模块,可支持无声内隐言语;本实验仅1名受试者,后续需要多受试者验证算法泛化能力。未来可以结合多模态信号、无线植入电极、扩展高级语言脑区信号采集,进一步提升系统临床实用性。

图3 音节与声调解码的离线性能

结论

该研究利用高密度柔性皮层脑电阵列,搭建面向汉语的双流音节‑声调解码框架,实现394个汉语音节高精度离线解码,并且完成实时句子解码,能够直接驱动机械臂、数字人、大模型等外部设备。该工作证明以完整声调音节作为解码单元,是解决声调语言脑机解码的有效路径,为未来面向汉语失语人群开发临床可用言语神经假体系统提供完整技术方案,也为全球其他声调语言脑机接口研究提供可借鉴范式。

——END——

撰稿人:李源

审核人:潘家辉教授

图片

脑机接口与混合智能研究团队


登录用户可以查看和发表评论, 请前往  登录 或  注册。
SCHOLAT.com 学者网
免责声明 | 关于我们 | 用户反馈
联系我们: