文献解读 | 全模拟光电融合芯片 ACCEL:光子算得快、电子算得准(Nature 2023)

论文简介

《All-analog photoelectronic chip for high-speed vision tasks》(用于高速视觉任务的全模拟光电芯片)发表于 Nature 2023,作者为陈一彤(Yitong Chen)、麦麦提·那扎买提(Maimaiti Nazhamaiti)、许晗(Han Xu)等(清华大学自动化系、电子工程系、北京信息科学与技术国家研究中心、深圳国际研究生院、精密仪器系与脑与认知科学研究院联合团队),通讯作者为吴嘉敏、乔飞、方璐与戴琼海。论文链接(DOI: 10.1038/s41586-023-06558-8)。

一句话贡献:把衍射光学计算(OAC)与电子模拟计算(EAC)融合进同一颗全模拟芯片 ACCEL(all-analog chip combining electronic and light computing),让光以光速完成特征提取、让模拟电路直接完成分类,全程不需要模数转换器(ADC),实测系统能效 74.8 POPS/W、计算速度 4.6 POPS(超过 99% 由光学实现)、单帧延迟仅 72 ns,同时保持接近数字神经网络的分类精度。

这篇论文值得一读,因为它正面回答了两个长期困扰光计算的问题:光学非线性”难做”、ADC 数字化”费电”。ACCEL 的策略是承认光的擅长与不擅长——光适合做大规模线性矩阵运算,电子电路擅长非线性与灵活的重构,那就各司其职,中间用光电效应自然衔接,而不是强行追求”全光”。

为什么需要”全模拟”:ADC 瓶颈与光计算的三大难题

先看传统视觉任务是怎么跑的。一幅高分辨率图像先被传感器采集,然后由大规模 ADC 阵列数字化,再交给数字处理单元上的神经网络分类。问题出在 ADC 上:高吞吐、高精度的 ADC 一方面占用数据带宽、限制成像帧率,另一方面功耗可观。超低延迟的视觉任务往往要求极短曝光,这又反过来要求极高的计算能力与噪声鲁棒性。换句话说,“先把光变成数字,再用数字算”这条路线,在速度和功耗上天然有天花板

光计算一直被寄予厚望:信息直接编码在光场里,用传播和干涉完成运算,不需要逐拍搬数据。此前有光学神经网络(ONN)报告能效约 1.58 TOPS/W,明显高于先进 GPU 的约 0.52 TOPS/W。但论文指出,既有光计算系统在走向实用时卡在三个地方:

第一,光学非线性难实现。神经网络需要非线性激活,而光与线性介质相互作用通常是线性的;马赫-曾德尔干涉仪(MZI)方案受集成规模限制,衍射深度神经网络(D2NN)节点很多却难以引入高效的光学非线性。

第二,ADC 依然绕不开。很多”光学计算”方案只做了前几层,最后仍要把光信号数字化再做后续处理,ADC 的功耗把光计算省下的能量又吃了回去。

第三,对噪声敏感。低信噪比(如超短曝光)下,散粒噪声会显著恶化光网络的输出。

ACCEL 的答案是”全模拟”:光做完线性运算后,不让光信号变数字,而是让光电流直接参与模拟电子运算。非线性由光电二极管阵列的光电响应自然提供,权重由 SRAM 存储、模拟开关切换,比较器直接比较电压脉冲大小出结果——整条链路没有任何 ADC。

ACCEL 架构:让光做特征提取、让电做分类(图 1)

ACCEL 由两大部分组成,像一条流水线一样前后衔接:

第一级是光学模拟计算 OAC,本质是一个多层的衍射光学计算模块。输入图像被编码进光场,经过训练好的相位掩模衍射传播,完成点积与光衍射操作——这等价于对复光场做线性矩阵乘法,也就是”在光速下做特征提取”。关键效果是降维:高分辨率图像的冗余信息在光域被压缩成小规模特征,后续光电转换的采样负担大幅下降。

第二级是电子模拟计算 EAC:一块 32×32 的光电二极管阵列(1024 个像素电路)直接放在 OAC 输出面。每个像素电路包含一个光电二极管、三个开关和一个 SRAM 宏单元。SRAM 里存的是二值权重(+1 或 −1),推理时按权重把光电二极管的阴极切换到正计算线 V+ 或负计算线 V−。所有光电流按基尔霍夫定律在两条线上求和,一个模拟减法器输出两线电压差作为输出节点;每次脉冲由 SRAM 刷新权重,切换连接方式,于是 EAC 等效于一个 1024×N 输出的二值权重全连接网络(成品芯片最大 N=16)。最后,比较器选出电压最大的那个脉冲,直接作为 ACCEL 的预测类别。

图 1:(a) 传统光电计算流程,包括大规模光电二极管与 ADC 阵列;(b) ACCEL 的流程:衍射光学计算模块在光域对输入图像进行特征提取,其输出光场由光电二极管阵列直接产生光电流用于模拟电子计算,EAC 输出对应等效网络多个输出节点的时序脉冲,二值权重由 SRAM 每次脉冲重新配置,比较器输出电压最大的脉冲作为预测结果;(c) ACCEL 示意图:OAC 直接集成在 EAC 电路前方。MZI,马赫-曾德尔干涉仪;D2NN,衍射深度神经网络。

整个 ACCEL 的计算可以写成一条简洁的公式:

$$
V_o = b \cdot f(w \cdot x)
$$

其中 x 是原始输入,w 是 OAC 的等效乘矩阵(线性光运算),f 是光电二极管产生的非线性激活函数,b 是 EAC 的二值权重矩阵,V_o 是输出的模拟脉冲电压。注意这里没有 ADC——光电流直接进入模拟电路,这也是”全模拟”三个字的含义。

那么权重从哪来?论文的做法是端到端融合训练:把 OAC 的衍射传播(基于瑞利-索末菲衍射理论的光束传播仿真)和 EAC 的物理过程放在同一个模型里联合训练。更关键的是自适应训练:芯片加工完成后,制造缺陷和对准误差是不可避免的,论文直接用芯片实测的 OAC 输出微调 EAC 权重(反向传播),把系统误差”就地校正”掉。这一点在后面低光实验里反复体现。

光域先行降维:OAC 为什么能省掉约 98% 的 ADC(图 2)

全模拟的意义不只是省掉”几个”ADC,而是把 ADC 的规模直接砍掉一个量级。论文先用仿真证明 OAC 的压缩能力:OAC 把 MNIST 的 28×28 原始输入编码成 4×4 特征,一个简单的三层全连接数字网络只需约 2% 的采样就能把图像重建回来;直接用 OAC 输出做分类,相同精度下需要的采样数大幅下降。据此论文给出一个很有冲击力的结论:ADC 数量可以减少约 98% 而不损失精度

理解这一点需要抓住”压缩比”的定义:OAC 输出维度与原始图像维度之比。OAC 的相位掩模本质上是一个可训练的光学编码器,它把对分类有用的信息保留在少量特征里、把冗余去掉。当然压缩率不是越高越好——任务越复杂,需要的特征空间维度越高,压缩率要相应放宽。

图 2:(a) OAC 对大尺寸图像进行特征提取的原理;(b) OAC 处理仿真示例:OAC 将 28×28 原始输入编码为 4×4 特征,三层全连接数字网络用 OAC 输出特征重建图像;(c) 不同压缩比下 OAC 输出重建结果的 SSIM(结构相似性指数),右上角为不同压缩比的示例重建图;(d) 不同压缩比下 OAC 输出接三层全连接数字网络的分类准确率(红色虚线为直接用原始图像输入数字网络的准确率);(e) EAC 芯片照片,包含 32×32 光电二极管阵列、电容补偿模块 P-CCM/N-CCM、电压输出模块与外围 SRAM I/O 和控制器;(f) 电容补偿模块结构;(g) EAC 阵列结构;(h) 单个像素的放大电路结构。a.u.,任意单位;PD,光电二极管。

图 2 还展示了 EAC 芯片的实物:32×32 像素电路加上两个电容补偿模块(P-CCM、N-CCM)。补偿模块的作用是把 V+ 与 V− 两条计算线的负载电容配平——正负权重数量不对称会导致两条线放电速度不同,补偿后差分输出才与权重和光强的乘积成正比。单个像素的等效运算关系为:

$$
\Delta V_j = \frac{t_a}{C_L} \sum_i w_{ij} I_{ph,i} \propto \sum_i w_{ij} x_i
$$

其中 t_a 是累积时间、C_L 是计算线负载电容、I_ph,i 是第 i 个光电二极管的光电流(正比于光强 x_i)。这就是”光的强度加权求和”被电路直接算出来的物理过程。

全模拟推理到底准不准:仿真与实验(图 3、图 4)

省电省时间的前提是”能算对”。论文先用数值仿真摸底,再用流片后的真实芯片验证。

仿真结果:全模拟并不输给数字网络

在 MNIST 手写数字 10 分类仿真中,只用 OAC 或只用 EAC 的准确率分别只有 66% 和 89%,而 ACCEL 全模拟模式达到 98%,与非线性三层全连接数字网络相当——这说明”光提取特征 + 电分类”的组合确实产生了 1+1>2 的效果。在 Fashion-MNIST 上,ACCEL 全模拟模式与数字网络表现相当;3 类 ImageNet(256×256 高分辨率)仿真中,单层 OAC 的全模拟 ACCEL 达到 80.7%,高于三层非线性全连接数字网络的 75.3%,六层 OAC 进一步提升到 84.0%,接近 LeNet-5 的 85.3%。

图 3:(a) ACCEL 图像分类工作流程,可选的小规模数字网络可低成本接入;(b–d) MNIST、Fashion-MNIST 与 3 类 ImageNet 上不同方法的分类准确率(数值仿真);(e) MNIST 上 ACCEL、仅 EAC、仅 OAC 在不同入射光功率下训练与测试的准确率映射图;(f) 自适应训练示意图:用 OAC 输出微调 EAC 权重校正系统误差;(g) 自适应训练抵御制造误差与对准误差的测试准确率。

仿真的另一个重点是噪声鲁棒性。论文把散粒噪声、读出噪声和热噪声纳入训练建模,发现 ACCEL 有两个天然优势:OAC 把光在局部区域汇聚,等于先建立了一个”潜在特征空间”,信噪比更高;ADC 数量减少意味着读出噪声来源更少。图 3f、g 则展示了自适应训练的价值:当 OAC 相位掩模被加入标准差 0.26π 的高斯扰动(模拟制造误差)、EAC 输入被水平偏移一列或旋转 5°(模拟对准误差)时,经过自适应训练后的精度下降被明显抑制。

实验结果:真芯片的表现

论文用 180 nm CMOS 工艺流片了 EAC 芯片,OAC 采用套刻光刻刻蚀的八级 SiO₂ 相位掩模(也可以用相位调制 SLM 实现,二者输出相近)。全模拟模式经自适应训练后,MNIST、Fashion-MNIST 与 KMNIST 的实验准确率分别为 90.9%、80.9% 与 67.6%,与仿真接近;接入一个 16×10 的小规模数字网络后提升到 97.1%、85.5% 与 74.6%,且不牺牲系统速度与能耗。3 类 ImageNet 全模拟实验更亮眼:单层 OAC 达到 80.7%,两层 OAC 达到 82.0%,超过三层非线性全连接数字网络的 75.3%,逼近 LeNet-5 的 85.3%——这是在完全不接数字网络的情况下实现的。

图 4:(a) 测试 ACCEL 的实验装置;(b) 刻蚀八级 SiO₂ 相位掩模(作为 OAC)的照片;(c) 固定 SiO₂ 掩模与相位调制 SLM 生成的实验 OAC 输出图像;(d) 有/无自适应训练时 ACCEL 在 MNIST、Fashion-MNIST 与 KMNIST 上的实验与仿真准确率对比;(e) ACCEL 接入 16×10 数字网络后的混淆矩阵;(f) 3 类 ImageNet 分类中单层/两层 OAC 的 ACCEL 与全连接、卷积(LeNet-5)数字网络对比;(g,h) Fashion-MNIST 分类的实验 OAC 权重与 EAC 权重;(i,j) 高光(5 fJ μm⁻²/帧)与低光(0.14 fJ μm⁻²/帧)下的实验示例结果;(k) 不同低光条件下 ACCEL、仅 OAC、仅 EAC 的实验分类准确率。

把仿真与实验的关键精度汇总成一张表,方便对照:

表 1:ACCEL 与仅光学、仅电子及数字网络在各项任务上的准确率对比。

数据集/任务 仅 OAC 仅 EAC ACCEL 全模拟 数字网络参考
MNIST 10 类(仿真) 66% 89% 98% 三层全连接数字网络相当
MNIST 10 类(实验,自适应训练后) 90.9%(接 16×10 数字层后 97.1%)
Fashion-MNIST 10 类(实验) 80.9%(接 16×10 数字层后 85.5%)
3 类 ImageNet(实验,两层 OAC) 82.0% 全连接 75.3%;LeNet-5 85.3%
交通视频 5 类(实验,每帧 5 fJ μm⁻²) 81.0% 90.8% 92.6% 三层数字网络相当

低光条件是 ACCEL 最出彩的地方。论文把光强降到每帧 0.14 fJ μm⁻²(比常规测试低 35 倍以上),此时没有 OAC 的图像检测已严重失真,数字网络同样困难;而 OAC 把光子汇聚到局部区域、保留特征,ACCEL 在 MNIST、Fashion-MNIST 与 KMNIST 上的精度都显著优于仅光学或仅电子网络(最高提升约 29.4%)。换句话说,OAC 不只是省 ADC,它本身就是一个抗噪的前端

还有一点值得注意:EAC 的可重构性。论文发现,固定同一块 OAC、只重构 EAC 的权重,在不同任务上的精度与”OAC+EAC 完全重构”相当;用三个数据集联合训练一块 OAC,再按任务分别重构 EAC,泛化甚至更好。这为”一光多电”的低成本部署提供了可能。

时序任务:低光下的视频判断(图 5)

静态图像之外,论文还演示了时序任务——车辆运动方向判断,这是自动驾驶的典型场景。他们自制了一个交通数据集:15 辆不同的车,每段视频三帧 224×224,按运动方向分成上、下、右、左、轴向五类。在每帧 5.0 fJ μm⁻² 的正常光强下,ACCEL 接一个单层数字网络的判断准确率为 92.6%,比仅 EAC 高 1.8%、比仅 OAC 高 11.6%。

图 5:(a) 车辆向五个不同方向运动的交通数据集示意图,含一个低光噪声示例;(b) 每帧 5 fJ μm⁻² 下 ACCEL、仅 EAC、仅 OAC 各自接单层数字网络的实验准确率;(c) 不同入射光功率下的实验分类准确率;(d) 低光(每帧 0.08 fJ μm⁻²)下三者经 1 位比较器转换后的实验混淆矩阵。

低光下的对比更说明问题:光强降到每帧 0.08 fJ μm⁻² 时,仅 EAC 与仅 OAC 的精度严重退化,ACCEL 却保持高精度,甚至优于三层数字网络。这里还有一个工程细节:模拟输出转数字只用了 1 位比较器(而不是高精度 ADC),因为视频判断只需要比较输出脉冲的大小,不需要精确数值——这让时序任务的额外能耗和延迟几乎可以忽略。

速度与能效:72 ns/帧和 74.8 POPS/W 是怎么来的(图 6)

速度与能效是这篇论文最核心的卖点,也是”全模拟”价值的直接体现。单帧处理时间由三部分构成:复位时间 t_r(把计算线预充到统一电压、清掉上一脉冲的残余)、响应时间 t_p(光信号从 OAC 传播到 EAC 并产生电压响应)、累积时间 t_a(输出信号累积到足以区分)。SRAM 权重更新的延迟被”藏”在复位时间内,不额外占用处理时间。

实验测得复位时间上限约 12.5 ns、响应时间 7.8 ns、累积时间 9.2 ns(入射光 80 μW 时)。系统时钟 500 MHz(单周期 2 ns);在每帧 0.14 fJ μm⁻² 的低光下,每个脉冲分配 12 个时钟周期(24 ns),3 类分类需要 3 个脉冲,所以单帧完整处理时间约 72 ns

图 6:(a) 单帧完整处理时间内 ACCEL 电压输出(紫)、SRAM(橙)与控制信号(绿)的时序示意;(b) 实测平均复位时间约 12.5 ns;(c) 入射光 80 μW 时实测平均响应时间 7.8 ns、累积时间 9.2 ns;(d,e) 3 类 ImageNet 分类准确率随系统计算延迟与单帧能耗的实测曲线,对比 ACCEL 与 NVIDIA A100 上的数字网络。

能耗怎么算?用于 3 类 ImageNet 分类的 ACCEL 由两层 400×400 SiO₂ OAC 和一层 1024×3 EAC 组成,每帧最少运算数 3.28×10⁸,实测系统级计算速度约 4.55×10³ TOPS(4.55 POPS);单帧平均系统能耗 4.4 nJ(激光、SRAM、控制单元与 EAC 计算合计),于是系统能效为 7.48×10⁴ TOPS/W,即 74.8 POPS/W。论文摘要把口径写成:能效 74.8 POPS/W、速度 4.6 POPS(超 99% 由光学实现),分别比最先进计算处理器高三个数量级和一个数量级。

更直观的对比来自与 NVIDIA A100 的端到端实测:在相同测试精度下,ACCEL 单帧延迟 72 ns、能耗 4.38 nJ,而 A100 约为 0.26 ms、18.5 mJ——延迟低约 3600 倍、能耗低约 420 万倍。为了避免”运算数口径不一致”的争议,论文还提出一个”LeNet 等效运算数”指标:把 ACCEL 达到 82.0% 精度对应的等效运算数折算成 LeNet 的运算量(2.17×10⁷),得到 LeNet 等效速度 301.39 TOPS、等效能效 4.95×10³ TOPS/W,仍然大幅高于先进数字与光子器件。

表 2:ACCEL 与 NVIDIA A100 在 3 类 ImageNet 同精度下的端到端对比。

指标 ACCEL NVIDIA A100 比值(A100/ACCEL)
单帧延迟 72 ns 约 0.26 ms 约 3600 倍
单帧能耗 4.38 nJ 18.5 mJ 约 420 万倍
系统能效 74.8 POPS/W
系统计算速度 4.55 POPS

需要说明的是,这些数字都是”系统级”实测(含激光、SRAM 与控制单元的功耗),不是芯片核心的孤立指标,也不是任何测试集上的峰值——论文对每一帧完整处理时间和能耗都做了端到端测量,这也是它比单纯器件级演示更接近工程现实的原因。

意义与展望

ACCEL 的意义在于它示范了一条”不纠结全光”的务实路线:光学擅长大规模线性运算与光速传播,电子擅长非线性、存储与灵活重构,二者用光电二极管这个天然的”光→电流”接口衔接,整条链路保持模拟、不设 ADC,从而同时拿到光的速度和电的灵活性。它没有去解决”光非线性”这个老大难,而是绕开它——把非线性放在光电响应里。

论文给出的下一步方向同样清晰:加更多 OAC 层、把 EAC 改成并行输出、提高 SRAM 位数以支持更多分类类别;用更先进的 CMOS 工艺进一步降低控制单元功耗;多个 ACCEL 级联实现更大规模网络(EAC 的可重构性与自适应训练正好可以抑制级联误差累积)。还有一个很实际的点:制造成本。EAC 用的是标准 180 nm CMOS、OAC 用的是低成本 SiO₂ 刻蚀面板,都不依赖最先进制程——论文称这是相对于 GPU、TPU 的成本优势。

最让人印象深刻的演示可能是非相干光实验:用手机闪光灯照明一个移动的车辆图案,ACCEL 直接处理这种部分相干光场,100 个测试样本达到 85% 的准确率。这意味着它不需要昂贵的相干光源和专门照明系统,为可穿戴设备、机器人、自动驾驶、工业检测与医疗诊断等真实场景留出了想象空间。

当然,从样片到大规模可编程的智能计算芯片仍有距离:当前演示集中在中小规模分类与视频判断任务,全模拟模式在三个手写/时尚数据集上要接一个小规模数字网络才能达到 97%/85% 量级的精度,可扩展性还需要工程化验证。但作为”光电融合、全模拟计算”的代表性工作,它用实测数据证明了光计算可以在真实任务上同时赢速度、赢能耗、不输精度——这正是这篇文章最大的价值。

参考资料

  1. All-analog photoelectronic chip for high-speed vision tasks(Nature 2023,开放获取 CC BY 4.0)(DOI: 10.1038/s41586-023-06558-8)
  2. 我国科学家研制出首个全模拟光电智能计算芯片(清华大学新闻)
  3. Computer vision accelerated using photons and electrons(Nature Research Briefing)

文献解读 | 全模拟光电融合芯片 ACCEL:光子算得快、电子算得准(Nature 2023)
https://time-frame.cloud/2026/08/21/2026-08-21-accel-analog-photonic-chip/
作者
Time Frame
发布于
2026年8月21日
许可协议