北大联合中科院发布忆阻器神经动力学芯片,实时计算较GPU提速478倍

神经拟态计算正在从理论概念走向工程落地。北京大学集成电路学院联合中科院上海微系统所的一项最新成果,为这一进程注入了关键动力:全球首款基于可控存内计算的忆阻器神经动力学芯片正式问世,其单步运算时延被压缩至2.12毫秒,首次实现了神经动力学模型的实时推理。相关论文于7月3日发表于《科学》期刊。

传统神经动力学计算——如Hodgkin-Huxley模型或Izhikevich神经元模型——在通用GPU上执行时面临严重的“模拟-数字”鸿沟。每个时间步的计算涉及数十个微分方程的数值求解,导致时延显著超过生物神经元的毫秒级响应。据研究团队披露,当前主流NVIDIA GPU在处理复杂脑皮层网络重建任务时,单步计算耗时可达数十至数百毫秒,完全无法匹配生物系统的时间尺度。

该芯片采用40纳米CMOS工艺,将存内计算阵列与外围控制电路集成在0.28平方毫米的极小面积上。核心电路运行在50MHz频率下,通过9级流水线架构实现单步积分操作。更关键的是,团队成功实现了“可控存内计算”:利用忆阻器的模拟状态直接执行神经元状态更新,避免了传统架构中频繁的模数转换和显存访问。这种设计使得芯片能以极低的功耗(微瓦级)完成实时神经动态仿真,而GPU在同等任务下功耗通常在数十瓦量级。

在性能实测中,该芯片在执行脑皮层柱状结构重建任务时,相较于NVIDIA V100 GPU加速比达到50倍;对于全脑规模网络仿真,加速比最高可达478倍。这标志着神经动力学实时计算瓶颈首次被物理硬件突破,而非依靠算法近似或模型简化。

从行业视角看,这一成果的重大意义不仅在于数字指标,更在于其“即时可用”的工程潜力。当前边缘AI场景对低延迟、低功耗的实时传感-计算融合需求迫切,而神经动力学芯片天然适配事件驱动传感(如神经形态传感器)的异步流处理。例如在自动驾驶的即时路径规划、工业机器人的触觉反馈、脑机接口的实时解码等任务中,传统的冯·诺依曼架构因数据搬运延迟而力不从心,而忆阻器存内计算方案可提供纳秒级响应与亚毫瓦级功耗的平衡。

不过仍需清醒认识:该芯片尚处于原型验证阶段,面向大规模复杂网络的扩展性、忆阻器器件的一致性以及量产工艺的良率控制,仍是后续工程化的核心挑战。研究者已明确将“可控存内计算”定义为下一代神经拟态硬件的关键设计范式,而非简单的替代方案。

对AI硬件从业者而言,这一进展释放出明确信号:实时神经动力学计算已不再是理论愿景,而是具备工程可行性的技术路径。对于低频、低功耗、低延迟的嵌入式智能应用,现阶段即可考虑与相关课题组合作开展定制化算法移植;而对于云端训练场景,传统GPU仍将主导,但神经拟态芯片作为推理加速器的补充角色值得提前布局。