Analog AI Is Back, But Can It Survive Its Own Noise?
TL;DR · AI 摘要
Analog AI Is Back, But Can It Survive Its Own Noise? Towards Data Science Artificial Intelligence Analog AI Is Back, But...
核心要点
- 主题聚焦:Analog AI Is Back, But Can It Survive Its Own No
- 来源:Towards Data Science,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
模拟AI强势回归,但能抵御自身噪声吗? | Towards Data Science
人工智能
模拟AI强势回归,但能抵御自身噪声吗?
为什么芯片制造商选择依靠物理规律来解决AI的能耗问题,以及当你真正模拟这种噪声时会发生什么
Ferran Alia
2026年7月17日
11分钟阅读
分享
Gemini生成的图片
此刻某个数据中心内,GPU正在将大部分能量消耗在数学运算之外的数字传输上。从内存中获取权重,将其传输到计算单元,执行乘法运算,再将结果传回。在数月的训练过程中,每秒进行数十亿次这样的操作,你就能理解为什么AI的电费账单已经从工程附录变成了董事会关注的问题。
数据支持这一观点。Gartner预计,全球数据中心电力需求将从2025年的104吉瓦增长至2026年的132吉瓦,并在2030年达到约290吉瓦,生成式AI工作负载被列为这一增长的主要驱动力。仅AI优化服务器就预计占今年数据中心电力消耗的近三分之一。
2025-2030年全球数据中心电力需求。来源:Gartner,2026年6月
这为一个古老理念的悄然复兴提供了背景:模拟计算。通过实际的模拟电路,使用连续电压和电流而非0和1来执行主导神经网络推理的矩阵乘法。这种方案极具吸引力:既然可以借助物理规律直接进行计算,为什么还要通过数字方式模拟物理规律呢?
当然,这并非新概念,模拟计算机早于数字计算机出现。几十年前它被放弃是有充分理由的。本文将探讨这个故事的两个方面:为什么这个方案确实令人着迷,以及为什么首次导致模拟计算消亡的因素实际上从未消失。我将解析其工作原理,然后通过一些小型诚实的模拟演示其失效点,并说明研究人员正在如何逐步修复这些问题。
模拟存内计算的实际工作原理
在传统芯片中,内存和计算是分离的。每次将权重与输入相乘时,该权重必须从内存阵列经由总线传输到计算单元,结果又必须返回。研究人员估计,这种传输消耗的能量可能是算术运算本身的3到10,000倍,这就是所谓的冯·诺依曼瓶颈。
模拟存内计算(AIMC)消除了这种传输过程。权重以物理导电值的形式存储在由相变存储器或电阻式RAM构建的记忆单元网格中。将输入作为电压施加到该网格上,两个物理定律会自动完成剩余工作:欧姆定律(电流=电压×导电性)执行每个乘法运算,基尔霍夫电流定律(电流在导线交汇处相加)执行累加运算。神经网络大部分时间都在执行的矩阵-向量乘法操作,可以在单个物理步骤中完成,无需任何总线。
不过,这句话中隐藏着一个陷阱:乘法本身几乎是免费的,但输入和输出仍然需要跨越模拟世界和数字世界的边界:电压输入,电流输出,都需要进行转换。实际上,执行这种转换的ADC和DAC往往才是真正的能耗和面积预算消耗者,而不是交叉条阵列本身。这在该领域核心处形成了一种讽刺:物理层面可以免费完成数学运算,但芯片上相当大的一部分资源却要用于与它通信。
在数字芯片中,每个乘加运算都意味着权重需要通过总线传输。而在模拟交叉条阵列中,乘加运算正是权重已经存在的地方。图片由作者提供。
这并非假设。IBM Research的HERMES项目芯片就是一个实际案例,这是一款基于相变存储器的模拟存内计算芯片,已用于在真实工作负载上展示接近软件精度的表现。2023年报道的早期IBM基于PCM的原型芯片,集成了3500万个相变存储器单元,能够在芯片上直接存储多达1700万个参数,其能耗仅为数字加速器的几分之一。EnCharge AI(从普林斯顿大学分拆出来,与台积电合作制造)和Mythic等初创公司已获得真实资金,押注相同的物理原理可以用于边缘推理的产品化。
自己进行模拟
你不需要特殊的硬件就能观察到这一机制的运作。这里有一个最小化模拟:一个“完美”的数字矩阵乘法,与叠加了现实模拟缺陷的操作进行对比,包括设备间编程噪声(权重无法精确写入你要求的导电性)、读取噪声(每次使用阵列时都会出现热噪声/散粒噪声)以及有限ADC精度(模拟结果最终仍需转换回数字)。
import numpy as np
rng = np.random.default_rng(42)
n_in, n_out = 64, 32
W = rng.uniform(-1, 1, size=(n_in, n_out)) # "理想"权重
x = rng.uniform(-1, 1, size=n_in) # 输入激活值
digital_result = x @ W # 真实值
def analog_matmul(x, W, programming_noise_std=0.0, read_noise_std=0.0, adc_bits=None):
# 权重物理上以导电性形式存储 -> 噪声已内置
# 直到单元被重新编程
G = W + rng.normal(0, programming_noise_std, size=W.shape)
# 欧姆定律 + 基尔霍夫电流定律,一步完成
out = x @ G
# 测量时添加热噪声/读取噪声
out = out + rng.normal(0, read_noise_std, size=out.shape)
# 模拟结果仍需数字化
if adc_bits is not None:
lo, hi = out.min(), out.max()
step = (hi - lo) / (2 ** adc_bits)
out = np.round((out - lo) / step) * step + lo
return out随着现实程度的增加运行此模拟,会产生清晰的误差曲线:
叠加现实模拟缺陷时,相对误差与完美数字矩阵乘法的对比。由作者提供。
从完美乘法到包含两个噪声源和廉价4位ADC的乘法,单层运算就引入了超过8%的相对误差,且尚未有机会在深度网络中累积。这引发了一个真正的问题:这对训练模型的准确性究竟有多大的影响?
模拟计算一直存在噪声问题
这正是模拟计算最初输给数字计算的原因,早在人工智能重新赋予其重要性之前数十年,模拟计算就已经败北了。连续的物理信号本质上比二进制状态更难以精确控制。数字电路只需区分0和1;而模拟电路必须在热噪声、器件差异和随时间漂移的影响下保持精确的幅度。这是一个工程上极其困难的问题,而且当应用场景从求解微分方程转变为运行神经网络时,这个问题并不会消失。近期对这些效应的系统研究列举出编程噪声、读取噪声、时间导电性漂移、有限的比特精度和模拟到数字转换损失,这些是该领域尚未解决的开放性问题。漂移问题尤其令人难以接受:与数字比特不同,模拟权重是一种物理材料属性,这种材料会随着时间松弛,因此“相同”的权重在写入一周后可能悄悄地读出不同数值,这就是为什么模拟芯片通常需要定期重新校准或重新编程以保持准确性,而数字内存则无需承担这种开销。
为了验证这是否真的会产生影响,我以常规方式训练了一个小型神经网络,使用完整的数字精度,没有任何噪声,完成经典的手写数字分类任务,然后通过模拟的模拟层在不断增加的噪声水平下运行推理。
def forward(params, X, layer2_noise_std=0.0):
h = np.maximum(0, X @ params["W1"] + params["b1"]) # 数字隐藏层
W2 = params["W2"]
if layer2_noise_std > 0:
# 这一行是模拟交叉条:权重受到器件噪声的破坏
W2 = W2 + rng.normal(0, layer2_noise_std, size=W2.shape)
logits = h @ W2 + params["b2"]
return softmax(logits), h该网络在训练时完全不知道它会遇到噪声。当通过逐步增加噪声的模拟硬件进行评估时,发生了以下情况:
通过模拟的模拟层在不断增加的噪声水平下评估常规训练网络的测试准确率。作者提供。
网络对小量噪声表现出惊人的容忍度,准确率在噪声标准差≈0.1以下几乎没有任何下降。但一旦超过这个临界点,它并不会优雅地退化,而是急剧下降:在0.2时为83%,在0.4时为64%,到0.8时已接近随机猜测。这就是“模拟AI存在噪声问题”的真实面貌,不是温和的准确率税,而是一个网络从未准备跨越的阈值。
为网络将要运行的硬件进行训练
当前研究对此的回应(不仅仅是)构建更安静的硬件,而是从根本上不训练网络去期待干净的信号。这项技术根据发表者不同有多种名称,IBM称其为硬件感知训练,而近期关于所谓“模拟基础模型”的研究则称之为噪声注入训练,但核心思想是一致的:在训练期间模拟目标硬件的噪声,而不仅仅是在部署时,这样梯度下降被迫寻找对噪声具有鲁棒性的权重。
我重新运行了相同的实验,但这次在训练过程中向网络的每次前向传播中注入噪声,训练了网络的第二个副本:
def train(params, X, Y, epochs=300, lr=0.1, train_noise_std=0.0):
for epoch in range(epochs):
# train_noise_std > 0 表示网络从一开始就必须学习能够容忍噪声的权重
# 它永远看不到干净的信号
probs, h = forward(params, X, layer2_noise_std=train_noise_std)
# 从这里开始正常进行梯度下降这是本文中最有趣的图表:
相同架构、相同数据——一个正常训练,一个注入噪声训练。在相同噪声水平下评估。作者提供。
在零噪声情况下,两个模型统计上完全一致:当硬件恰好干净时,噪声感知训练几乎不产生额外成本。但随着噪声增加,性能差距迅速扩大:在std=0.6时,正常训练模型准确率已降至39%,而噪声感知模型仍保持61%。正如往常一样,没有模型能完全免疫噪声,也没有免费的午餐,准确率仍会下降,但其中一个模型的性能衰减就像系统被专门设计来应对这种情况,而另一个模型的衰减则像系统从未被告知它将运行的环境。
这只是个玩具示例,一个用于8×8数字图像的两层网络,并非真实生产模型。但研究人员现在正在将这种机制应用于大型语言模型(LLMs),只不过大语言模型有更多层需要噪声累积,对上述准确率断崖式下降的容忍度也更低。
现实进展现状
作为总结,有必要客观看待该领域现状。一些事实已基本明确:
推理层面已实现,训练层面尚未突破。几乎所有权威资料都得出相同结论:模拟硬件适合运行已训练好的模型,尤其是在边缘设备上,但反向传播的精度要求使在模拟硬件上训练仍是尚未解决的难题。
商业进展参差不齐。最早一批模拟AI芯片初创公司Mythic在数字低功耗芯片持续进步的市场中挣扎多年,即便在2025年底完成了1.25亿美元融资。2022年成立的EnCharge AI在制造合作方面进展更快,已与台积电合作,并声称其芯片能耗仅为同类数字芯片的约1/20(尽管该声明尚未经过商业验证)。IBM仍主要停留在研究阶段,最近发表了将专家混合型LLM层映射到3D模拟内存架构的论文。
这只是众多技术路线中的一种,而非全部故事。光子计算(使用光而非电压,由Lightmatter和Celestial AI等公司推进)是相关但截然不同的技术路线,目前主要针对芯片间互连瓶颈而非直接替代计算单元本身。英特尔Loihi系列等神经形态芯片则采用另一种方法,借鉴大脑的事件驱动、脉冲信号机制,而非密集的模拟矩阵数学。这三类技术在媒体报道中都被归为“类脑计算”,但它们解决的是问题的不同部分。
这些技术本身无法单独解决AI的能耗危机,也不应被宣传为万能方案。但这是在数字效率提升陷入瓶颈的重要时刻,真正重新思考架构的尝试——与大多数硬件路线图不同,你只需在笔记本上用约30行numpy代码就能验证核心主张和核心问题。
参考资料与延伸阅读
- Gartner:2026年数据中心用电量将增长26%
- IBM Research:模拟内存计算或将成为未来AI模型的驱动力
- IBM Research:AIU芯片系列
- IBM Research:NorthPole——基于12nm芯片(数字芯片,非模拟芯片——用于消除歧义)的神经网络推理架构
- Büchel等人:基于模拟内存计算的核近似——HERMES项目芯片,IBM基于相变存储器(PCM)的模拟芯片
- IEEE Spectrum:模拟AI的飞焦级能效承诺
- IEEE Spectrum:EnCharge的模拟AI芯片承诺低功耗与高精度
- TechCrunch:EnCharge融资超1亿美元加速模拟芯片驱动的AI发展
- “模拟基础模型应对AI硬件噪声挑战” —— neurotechnus.com
撰写者
查看Ferran Alia的所有文章
,
编辑推荐
能耗
硬件
物理
分享本文
- 在Facebook上分享
- 在LinkedIn上分享
- 在X上分享
Towards Data Science是社区出版物。提交您的见解以触达全球受众,并通过TDS作者支付计划获得收益。
更新为您的实际投稿链接
为TDS撰写文章
✦ 结束CTA ✦