比GPU快478倍!全球首款忆阻器神经动力学芯片实现实时计算突破

当传统芯片架构在神经动力学模拟中遭遇“实时计算”的物理天花板时,一种全新的计算范式正在打开突破口。北京大学集成电路学院与中科院上海微系统所联合团队,在科学杂志发表成果,发布了全球首款基于可控存内计算的忆阻器神经动力学芯片。该芯片首次将单步运算时延压缩至2.12毫秒,在脑皮层重建等典型任务中,性能较当前主流GPU提升50至478倍,真正实现了神经动力学的实时闭环计算。

这是存内计算路线从“概念验证”走向“系统落地”的关键一步。传统冯·诺依曼架构下,处理单元与存储单元之间的数据搬运构成了能耗与延迟的主要瓶颈。而忆阻器存内计算将计算和存储融合在同一个物理器件中,天然适合神经形态计算中大规模并行、低功耗、高密度的需求。然而,此前业界面临的棘手问题是:忆阻器阵列中的非理想效应(如器件变异性、阻值漂移)导致计算精度不稳定,难以胜任对时序精度要求极高的神经动力学积分运算。

此次发布的芯片采用40纳米工艺,存内计算阵列与外围电路总面积仅为0.28平方毫米,运行频率50 MHz,单步积分仅需9级流水。值得注意的是,团队提出的“可控存内计算”方案,在硬件层面引入了主动补偿机制,有效抑制了器件非理想效应,使得每一步积分结果可被精确控制。这一机制正是将忆阻器从实验室玩具变为实用化芯片的核心密码。

性能数据需要放到具体场景中理解。神经动力学模拟的核心单元是微分方程的数值积分,每次积分需要完成数千次乘加运算。在GPU上,由于数据需要在显存与计算核心之间反复搬运,单步时延通常在毫秒到百毫秒级别。而该芯片利用忆阻器的本征物理特性,在一个存储阵列中同时完成所有乘加操作,单步时延压缩至2.12毫秒——这恰好跨过了“实时”门槛:在脑皮层网络模拟中,生物神经元的动作电位发放时间尺度在1-10毫秒;芯片能够以与生物体相当或更快的速度完成网络状态更新,使得实时闭环控制成为可能。

从更广的视角看,这项成果标志着神经形态计算开始进入“性能竞赛”阶段。过去几年,类脑芯片领域主要围绕脉冲神经网络(SNN)在视觉、听觉等模式识别任务中的能效优势展开,而在神经动力学这一更“硬核”的连续时间模拟领域,鲜有突破。该芯片证明,存内计算架构不仅能做分类推理,还能胜任高精度、高时序耦合的动态系统仿真。这为脑机接口、神经假体、自主机器人实时运动规划等应用打开了通路。

对于边缘AI和嵌入式系统开发者而言,这或许是一份“硬件路线图”的重要提示。当前边缘AI芯片多采用数字加速器(如NPU),能效虽优于CPU,但面对神经动力学这类需要连续积分更新的任务时,仍有力不从心。随着可控存内计算技术的成熟,未来可能涌现出专用的神经动力学加速单元,与现有AI处理器形成异构计算架构。芯片的40nm工艺和极小面积(0.28mm²)表明,该技术具备良好的可扩展性与很低成本的潜力。

当然,从实验室原型到商业化产品仍需跨越几道坎:更大规模阵列的良率控制、与标准封装工艺的兼容性、编程工具的易用性等。但不可否认的是,当单步时延被压至2毫秒级,一个全新的“实时神经拟态计算”时代已经拉开序幕。对于从事实时仿真、边缘智能、神经科学交叉研究的机构和企业,此刻正是评估和切入这项技术的最佳窗口期。