2.12毫秒时延突破实时瓶颈:全球首款忆阻器神经动力学芯片问世

神经拟态计算长期面临两大难题:如何高效模拟生物神经元的动力学过程,以及如何将存算分离带来的数据搬运开销降至最低。北京大学集成电路学院联合中科院上海微系统所,在最新一期《科学》上给出了一个突破性答案——全球首款基于可控存内计算的忆阻器神经动力学芯片。这款芯片首次将单步运算时延压缩至2.12毫秒,在脑皮层重建等任务中较当前主流GPU提升50至478倍,真正实现了神经动力学的实时闭环计算。

芯片采用40纳米工艺,核心创新在于将神经元积分的过程完全映射到存内计算阵列中。其存内计算阵列与外围电路总面积仅0.28平方毫米,运行频率50 MHz,单步积分只需9级流水。与传统冯·诺依曼架构相比,该设计消除了频繁的数据搬运,使得每一步突触更新和膜电位演化都在同一物理位置完成。2.12毫秒的单步时延意味着芯片能在一个典型突触时间常数(约10毫秒)内完成多次积分,从而模拟出更精细的神经活动节律。

性能对比更显颠覆。以脑皮层柱模型重建为例,在同等精度要求下,该芯片的运算速度是NVIDIA V100 GPU的50倍,而针对某些特定神经网络拓扑结构(如脉冲耦合网络),加速比可达478倍。这一优势源于忆阻器阵列的并行模拟计算特性:每个忆阻器单元兼具存储和计算功能,可以同时处理成百上千条突触权重更新,而无需像传统GPU那样进行大量访存操作。值得注意的是,芯片的算力密度(单位面积每秒运算次数)也远超同类神经拟态芯片,为边缘部署提供了可能。

当前神经拟态芯片赛道主要被Intel Loihi、IBM TrueNorth等占据,它们普遍采用数字CMOS模拟脉冲神经元,虽然功耗极低,但单步时延多在毫秒级甚至更高,且受限于固定步长,难以匹配生物神经元的连续动力学。忆阻器路线则天然适合模拟计算,但此前因可控性差而无法达到实用精度。北大的可控存内计算技术通过优化忆阻器写入/读取策略,将变异系数降低至3%以下,使得大规模芯片的实时运行成为可能。

从应用角度看,该芯片直击神经动力学实时仿真的核心痛点——脑机接口、闭环神经调控、癫痫预测等场景要求系统在毫秒级响应,传统GPU因异步流水延迟无法满足。这款芯片的2.12毫秒时延正好契合人类皮层网络的基本时间分辨率。对于边缘AI领域,该芯片的低功耗(未公布具体数值,但忆阻器理论功耗低于CMOS)和小面积特性,适合在无人机、可穿戴设备上运行轻量化脉冲神经网络。研发团队已在论文中展示了基于该芯片的实时神经编码解码演示,验证了其在快速事件检测任务中的可行性。

值得一提的是,该成果的工程化潜力不容小觑。0.28平方毫米的芯片面积意味着单片晶圆可切割出数千颗,成本可被大幅摊薄。随着忆阻器制造工艺向28纳米、14纳米推进,单步时延有望进一步降至亚毫秒级。对于科研用户而言,这意味着可以在桌面级设备上运行以前需要超算才能模拟的皮层网络模型。建议关注神经拟态芯片投资和AI边缘部署的企业,将这款芯片作为评估下一代低延迟计算硬件的基准——它不仅展示了存算一体从论文到流片的可行性,更指明了“实时模拟计算”这一极具竞争力的工程路径。