【意法半导体精选文章】边缘AI未来十年决胜于内存
本文与 ST专家Giuseppe Desoli 探讨了以内存为中心的芯片设计、存内计算,以及在人工智能真正融入微控制器、传感器或机器人灵巧手之前,芯片硬件层面需要做出哪些方面的改变。

“七十年来,我们的计算机设计始终是把数据搬运到计算单元。唯有扭转这一模式,在内存内部执行运算,将智能嵌入到传感器内,边缘人工智能才能实现规模化。这个变革就是我们的技术路线图。
Giuseppe Desoli博士
意法半导体公司院士、首席创新官,系统研究与应用事业部总经理兼部门副总裁
AI曾经是运行在云端的。为什么它必须走向边缘端?
Giuseppe Desoli博士:因为产业经济逻辑已经发生改变。多年来,AI 最大的难点在于模型训练。虽然训练成本高昂,但是模型训练仅需要在数据中心训练一次,训练好后的模型是可以多次反复使用的。
当下的形势已然不同。我们正看到系统需要连续推理并且需要持续感知并反应的物理实体系统。在这两类场景下,主要的消耗不再是模型训练,而是推理决策,即 AI 实际做出决策的时刻,推理运算发生在数据被创建的时候。
在看到这一点后,边缘 AI 的现实价值就不言而喻。那些需要毫秒级响应的设备根本无法等到数据往返于云端和本地。家庭内部设备也不应该需要把视频数据向外传输到云端。并且,如果传感器数量达到成百上亿个,并让每个传感器都依赖远程计算,那么推理成本将高得令人难以承受。
因此,延时、隐私和成本三大因素全都指向同一个方向:人工智能必须发生在数据产生时,靠近执行器,并贴近现实世界环境。
您将这一重要趋势概括为“从存储向计算转移”。落实到工程实践层面,这该如何理解?
Giuseppe Desoli博士:在神经网络当中,数据搬运所消耗的能耗,往往远高于运算本身。因此,真正的设计考量,不只是计算单元的算力有多强,而是数据需要移动多远的距离。
我们可以将这一转变概括为四个阶段。首先是经典的冯·诺依曼架构,处理器与存储器分开独立存在,数据在两者之间来回传输。第二阶段是近存储计算:将内存与处理单元集成到同一颗芯片上。该方案能够减少数据搬运,同时提升带宽。第三阶段是基于 SRAM 的存内计算。在该架构下,核心数学运算直接在存储阵列内部完成。第四阶段是非易失性存内计算。在此架构内,同一个高密度存储器阵列既用于存储模型参数,又用于执行计算,无需移动模型中的权重数据。
这才是真正的变革。内存不仅是存放数据的容器,本身也是计算单元的一部分。该理念正是我们架构选型的核心。存内计算的测试芯片至关重要,仅靠仿真模拟是远远不够的。一套架构只有真正直面硅片现实层面的各类问题,才算真正落地;这些现实问题包括器件工艺偏差、特性漂移、制造良率,以及编译器配套支持。
意法半导体如今在存内计算研究项目的进展如何?
Giuseppe Desoli博士:我们已经完成存内计算的流片验证,并且开展相关工作已经很多年。在ISSCC 2023(第70届IEEE国际固态电路会议) 上我们展示了一种基于18nm FD SOI的全数据存内计算加速器方案。在 4 比特精度下,该样片的能达到40‑310 TOPS/W的计算效率。最重要的并不是这个性能数字,而是隐藏在数字背后的工程能力。
首先,该设计采用多瓦片架构,这意味着其高能效并不局限于单个实验室模块,而是扩展到尺寸更大的、更具备实用价值的加速器。其次,这是数字架构。它可以输出准确、可复现的运算结果,并且能够走标准化芯片设计、测试以及产品开发流程,这一点也使该样片适合实际芯片制造。
这一成果并非一蹴而就,是多年技术积累的结果。最早可以追溯到2017年流片验证的早期硅样片,之后完成平台与软件工具链开发,让架构具备可编程的能力。这条技术路线最终催生了 Neural‑ART 系列 NPU 加速器,其中第一代就搭载在意法半导体首款内置硬件 AI 加速器的 STM32微控制器STM32N6 上。
在ST,存内计算的前沿研究与产品规划并非相互脱节,而是持续近十年的长期研发项目。
物理 AI,嵌入式AI,机器人产业,面临不同的问题还是同一问题?
Giuseppe Desoli博士:它们彼此高度相关,但是因为时机至关重要,挑战变得更难。物理 AI 系统必须实时持续感知,理解、决策、行动。要想在一个瞬息万变、不可预测的环境内正常完成这个闭环,必须依靠高速本地推理,不能过度依赖数据发到云端,然后等待云端应答。
这个改变也是边缘计算可以做到的。这类系统需要在设备端感知场景,融合不同传感器的数据,保护数据隐私,并且必要时,支持类似生物反射一般的瞬时响应。
这也是机器人技术正在发生变革的原因之一。早期机器人系统往往依靠精心编写的规则执行特定的任务,基于规则的解决方案在可控环境中效果良好,但在情况瞬息万变的现实世界中,表现就会大打折扣并且差强人意。
因此,可以取而代之的是一种集成度更高的一体化方法,用一个模型将感知、推理和控制三个环节更直接地连接起来,使机器能够更轻松地处理新对象和不熟悉的任务。
同时,模型本身也在持续演进,正朝着产生平顺性和连续性更好的运动轨迹的方向发展。这对于实体设备而言是利好,因为电机与执行机构需要平滑、高频更新的控制信号才能良好工作。
加上人工智能模型的需求与边缘设备的能力之间的差距正在不断缩小,这意味着边缘AI已经貌似一个现实可行的设计目标,而不再是遥不可及的构想。
这正是以内存为核心的架构设计发挥关键作用之处。这类系统必须持续感知不断变化的外部环境,同时实时决策。因此,场景感知能力是不能后期打补丁,而是从设计之初就走好存算协同之路。
探索性前沿架构如何转化为客户可采购的量产产品?
Giuseppe Desoli博士:主要是通过工具完成产品转化。新硬件如果不能被开发者实际使用,则算不上产品。因此,每一代加速器也都有配套的适配通用开发流程的编译器和量化工具。
其中就包括ST Edge AI边缘 AI 工具和STM32 AI 生态。开发者从标准学习框架导出训练好的神经网络模型,再将其导入ST Edge AI边缘 AI工具内,转换为可在目标设备运行的代码。
我们大量对外发表的研究成果,恰恰集中在这一关注度低却不可或缺的层面:将神经网络映射到硬件模块,并探索模型层与层之间的编译优化。
部分研发工作是采取产学研开放式协作模式。我们与多所高校、苏黎世 IBM 研究院保持长期合作关系,最近我们还与新加坡国立大学建立了一个企业联合实验室。
以内存为中心的计算技术覆盖面广泛,意义重大,仅一家企单独行动是无法搞定的。对于决定今后十年发展方向的课题,目前在各类学术会议上仍存争议,尚无定论。





