神经拟态计算被称为后摩尔时代的核心路线之一,但长期以来,如何让忆阻器(memristor)在实际系统中实现可控、精准的存内计算,同时满足毫秒级神经动力学的实时性要求,始终是学界与产业界的共同难题。7月3日,北京大学集成电路学院联合中科院上海微系统所的研究团队在《科学》(Science)上给出了一个关键答案:全球首款基于可控存内计算的忆阻器神经动力学芯片正式亮相。
核心参数方面,该芯片采用40纳米CMOS工艺,存内计算阵列与外围电路总面积仅为0.28平方毫米,运行频率50 MHz。最值得关注的突破在于,它首次将单步运算的时延压缩至2.12毫秒,并通过9级流水线完成单步积分操作。这意味着,此前只能靠离线仿真或代价高昂的GPU集群才能跑通的神经动力学模型(如脑皮层重建、大规模脉冲神经网络),现在可以在一个指甲盖大小的芯片上实现实时运行。
对比基准测试数据更能凸显其价值:在脑皮层重建等典型任务中,该芯片的能效与速度比当前主流GPU快50至478倍。这种量级的差异并非线性优化,而是架构层级的革新——存内计算将数据搬运开销降至最低,而忆阻器的可控性确保了计算结果的重复性与精度。传统GPU在模拟神经动力学时,需要反复从DRAM搬运权重矩阵,而本芯片将权重直接存储在忆阻器阵列中,运算时延几乎只见于模拟域积分过程。
从技术背景看,“可控存内计算”是这次研究的点睛之笔。忆阻器阵列天然具备存算一体特性,但此前器件的电阻漂移、非线性和写噪声导致计算结果不可控,无法用于高保真度的神经动力学实时仿真。北大团队通过器件-电路-算法协同设计,在40nm工艺下实现了对忆阻器状态的精确编程与读取,使2.12毫秒单步时延成为可能。这为神经网络动力学实时闭环控制(例如脑机接口、自主机器人运动规划)铺平了道路。
以边缘AI和实时仿真场景为例,过去受限于功耗和延迟,神经动力学模型难以嵌入到无人机、可穿戴设备等资源受限终端。而本芯片50 MHz的运行频率和0.28平方毫米面积,直接证明了“可以做到且够用”。预计未来两到三年内,此类忆阻器神经形态芯片有望率先在神经科学实验仪器、智能假肢的实时反馈控制、以及低功耗边缘推理设备中找到落地机会。
当然,从实验室原型到量产商用,还需要解决忆阻器材料的均一性、老化特性以及封装测试成本等问题。但无论如何,这款芯片已经证明了“实时神经动力学计算”并非遥不可及,而是可以在40nm成熟工艺上实现。对于关注神经拟态计算、存内计算和边缘AI的从业者,这是一个明确的信号:系统级芯片路线的拐点,可能已经到来。