智讯智库

植入式脑机接口首次实现“边说边比划”:一个脑植入物同时解码语言与手势

原创医疗健康
来源李伯睿
2026年09月15日11:18
分享
收藏
字体大小

9月14日,《Nature Neuroscience(自然·神经科学)》发表了一项来自UCSF(加州大学旧金山分校)团队的新研究。

研究人员利用一个植入大脑表面的高密度ECoG(electrocorticography,皮层脑电图)电极阵列,同时读取与说话、面部和上肢动作有关的脑信号,并尝试把这些信号实时转换成文字和手势,让瘫痪参与者控制一个个性化的全身虚拟化身。

在此之前,过去的脑机接口已经能把“想说的话”变成文字、声音甚至虚拟面部表情,但大多数研究一次只解码一种行为。而现实中的交流往往不是这样——我们说话时会点头、摆手、比划,甚至一个简单的手势就能加强语气。这次研究想解决的问题就是:脑机接口能不能像真实交流一样,同时读懂“想说什么”和“想做什么动作”?

一个植入物,同时读取语言和动作

此次研究共有3名重度瘫痪参与者。他们的大脑运动相关区域都植入了高密度ECoG电极阵列——ECoG可以理解成把一张布满微小电极的“感应网”放在大脑表面,用来记录大量神经细胞活动产生的电信号。

研究人员首先测试这一个电极阵列能不能同时捕捉多种身体动作的信号。

结果显示,3名参与者在尝试进行不同的上肢动作、口面部动作以及说话时,大脑都会产生可以区分的活动模式。这意味着,同一个脑植入物并不一定只能负责“说话”或者“动手”,它能够同时覆盖多个与交流有关的运动区域。

随后,研究团队进一步让两套解码器并行工作:一套负责判断参与者想说什么,另一套负责识别他们想做什么手势。解码出的语言会以文字显示在屏幕上,手势则直接驱动个性化的全身虚拟化身做出相应动作。

“说话”和“做手势”,第一次可以一起输出

研究中有两名参与者进入了实时闭环演示。其中一名参与者Bravo-6接受了较完整的实时同步测试:系统需要同时从10种手势和10句固定短语中判断他的意图。

在“同时尝试说话和做手势”的任务中,手势实时解码准确率达到66%,语言解码准确率达到70%;随机猜测的准确率只有约9.1%。

研究人员还设计了更接近日常交流的对话任务:参与者听到问题后,可以选择只“说话”、只做手势,或者同时使用两种方式回答。

在这一有限规模的对话实验中,Bravo-6的手势平均识别准确率达到85%,语言达到75%。另一名参与者Bravo-1r也参与了实时对话演示,在3个测试区块中的语言和手势解码中都取得了较高表现。由于测试次数和词汇量都很少,这些数字更适合作为概念验证,而不能代表系统已经达到日常交流水平。

更直观地说,过去很多脑机接口更像一个“脑控打字机”。而这项研究开始尝试让它变成:既能把脑中的语言翻译出来,也能让虚拟身体同步“做动作”。

为什么“同时解码”比想象中更难?

研究过程中还发现了一个问题:如果AI模型只学习“单独说话”或者“单独做手势”的脑信号,它在面对两件事同时发生时,表现会明显变差。

原因之一在于,大脑中负责说话、面部运动和手臂动作的区域并不是完全彼此分开的,部分神经活动会重叠。就像一个人边说话边挥手时,大脑中的信号会同时混在一起,模型很难直接照搬单任务时学到的规律。

研究人员因此加入了专门的“同步训练数据”,让模型既看过单独说话、单独做动作,也看过两者同时发生的情况。

结果显示,加入这些同步行为数据后,模型在不同场景之间的适应能力明显改善,误触发也减少了。

这个结果对未来脑机接口很重要:如果设备最终要走出实验室,就不能要求使用者每次只能干一件事。真实交流里,人会一边说话,一边改变表情和身体动作,脑机接口也需要适应这种复杂场景。

为什么要做“全身虚拟化身”?

在过去,大家最容易想到让脑机接口恢复的交流方式是打字,但人类交流的信息远不止文字——比如同一句“没关系”,配合点头、摇头或者不同手势,表达出的意思可能完全不同。

UCSF团队此前已经展示过通过脑信号控制虚拟人物面部表情和语音。此次研究进一步扩展到上半身乃至全身化身的动作表达

因此,这项研究更大的方向是:让失去语言和身体运动能力的人,重新拥有更加完整的“数字身体”。

未来如果技术继续成熟,用户可能不仅能够通过脑信号输出一句话,还能同时让自己的数字化身点头、摆手或者做出强调动作。这种交流会比单纯在屏幕上打出一行文字,更接近人与人真正面对面交流的方式。

但距离日常使用,还有很长距离

这项研究目前仍然是一个规模很小的概念验证。

首先,参与者只有3人。虽然3人的脑信号都用于验证多种身体运动能否被解码,但实时虚拟化身实验只涉及其中2人,更完整的同步语言与手势实时任务主要集中在单名参与者身上。

其次,目前的词汇和动作非常有限。例如Bravo-6的实时同步实验主要使用10句短语和10种手势,与现实中几乎无限的语言和身体动作相比,还有很大差距。

第三,设备仍然是有线植入式系统。研究中的高密度ECoG阵列通过穿过皮肤的接口连接到外部设备,并不是可以日常佩戴的无线产品。

此外,每个人的大脑信号都存在差异,目前的模型需要针对个人进行大量训练。论文也明确指出,未来还需要扩大参与者数量、增加语言和手势种类、降低系统延迟,并验证不同瘫痪原因和不同程度患者是否都能获得类似效果。

脑机接口正在从“输出信息”走向“恢复交流”

过去几年,植入式脑机接口在交流领域已经连续迈过几个台阶:2021年,UCSF团队展示了把瘫痪患者尝试说话时的脑信号直接转换成文字;2023年进一步实现更高速的文字、语音和虚拟面部表情输出。

这一次,新的突破点落到了“并行”。同一套脑植入物开始同时处理语言和身体动作,让不同表达方式能够一起出现。

目前更准确的结论是:这项研究证明了一个高密度ECoG植入物可以同时读取语言和身体手势相关脑信号,并把它们并行转换成虚拟化身的交流输出。

它距离真正自然、自由的日常对话还有很远,但脑机接口的目标正在变得更加清晰:未来需要恢复的,不只是“把一句话打出来”的能力,而是人与人交流时原本就包含的语言、动作和表达方式。

参考资料

[1] BROSLER S C, LIU J R, SILVA A B, et al. Simultaneous speech and gesture decoding for multimodal communication in paralysis[J/OL]. Nature Neuroscience, 2026-09-14[2026-09-15].

[2] UCSF CHANG LAB. Speech Neuroprosthesis: BRAVO Clinical Trial[EB/OL]. [2026-09-15].

[3] UC SAN FRANCISCO. How Artificial Intelligence Gave a Paralyzed Woman Her Voice Back[EB/OL]. (2023-08-23)[2026-09-15].

[4] UC SAN FRANCISCO. “Neuroprosthesis” Restores Words to Man with Paralysis[EB/OL]. (2021-07-14)[2026-09-15].

最新发布

植入式脑机接口首次实现“边说边比划”:一个脑植入物同时解码语言与手势新闻