文献解读 | 单目超表面 4D 相机:一片平面镜片如何在一次曝光里同时给出深度与偏振(Nature Communications 2023)
论文简介
这篇论文解读的是 Zicheng Shen、Feng Zhao、Chunqi Jin、Shuai Wang、Liangcai Cao 与 Yuanmu Yang 等人 2023 年 2 月发表于 Nature Communications 的工作:Monocular metasurface camera for passive single-shot 4D imaging(DOI: 10.1038/s41467-023-36812-6,开放获取,CC BY 4.0;期刊原文页;PMC 全文)。论文完成于清华大学精密仪器系、精密测量技术与仪器国家重点实验室。
一句话贡献:论文用一片直径 2 mm、厚约 600 nm 的单层硅超表面,把普通相机只能拍到的二维强度扩展成“4D”——在一次环境光曝光中,同时给出全清晰的 2D 强度、场景深度与线性偏振信息,且整机只有一节 3.1 × 3.6 × 13.5 cm³ 的原型。
为什么“深度 + 偏振”难装进一台普通相机
先看问题本身。相机传感器本质上只记录光强,普通照片是场景的二维投影。要给画面补上“深度”这一维,工程上最常用的三条路都不轻松:结构光(structured light)与飞行时间(time-of-flight, ToF)需要主动激光照明;双目/多目相机体积大,深度精度和量程还受基线长度约束。要补上“偏振”这一维,常见方案是振幅分光或焦平面分光,或者靠多次曝光做时分复用;偏振相机常因此牺牲分辨率、帧率或系统复杂度。想在一次拍摄里同时拿到二维强度、深度和偏振,传统光学的代价是体积、重量和功耗一起涨。
把成像写成一个模型会更清楚。设场景里每个物点在深度 z、偏振态 p 下的二维亮度分布为 $f_{z,p}(x,y)$,相机记录的是:
$$g(x’,y’)=\iint f_{z,p,\ldots}(x,y)\mathrm{PSF}_{z,p,\ldots}(x’-x,y’-y)\mathrm{d}x\mathrm{d}y+\eta$$
其中 PSF(point spread function,点扩散函数)是系统对一个点光源的冲激响应,$\eta$ 是噪声。这个式子说明:如果系统在深度 z 或偏振 p 改变时输出几乎不变,信息就无法从单张图中解出来;深度和偏振能不能被“看见”,取决于 PSF 对这两个维度有多敏感——敏感程度由 Fisher 信息(Fisher information)量化。论文的思路因此很直接:把 PSF 本身做成一个随深度、偏振强变化的编码器,再用一片超表面在同一块感光芯片上同时产生两路这样的编码。
思路:让“焦斑”随深度旋转,而不是随深度模糊
普通透镜的 PSF 对深度也有响应——物点离焦时焦斑变模糊,这就是“离焦测距”(depth from defocus)的原理。但它的致命伤在于 PSF 沿深度方向变化太“自相似”:不同深度的模糊斑长相接近,估计精度很低,而且通常要物理移动镜头或多次曝光才能解出深度。
更聪明的做法是让 PSF 的形状随深度显著旋转。此前被广泛研究的双螺旋 PSF(double-helix PSF)让两个焦斑绕中心互相旋转,旋转角随轴向深度单调变化,深度估计精度比普通透镜高得多。但它有两个结构性问题:其一,双螺旋 PSF 具有 C2 对称性,旋转量程被限制在 180° 以内,限制了可测深度范围;其二,两个焦斑在像面上叠加成“孪生像”,要恢复高保真全清晰图像还得额外加一路参考成像通道(再加光阑或做时分复用),系统复杂度立刻上去了。
论文的单螺旋 PSF(single-helix PSF)把这两个问题一起解决:焦斑形态随深度转满完整的 360°,量程翻倍;更重要的是,超表面把 x 偏振与 y 偏振的两套共轭单螺旋 PSF 在像面上横向分开,形成两幅互不叠加的正交线偏振孪生像。深度编码在孪生像对平移矢量的局部朝向上,偏振编码在左右两幅像的强度比里,解码只需分割 + 模板匹配这类直白算法,不再需要参考像。

图 1:用单目超表面相机进行单次 4D 成像的框架。(a) 目标场景由具有不同偏振态与深度的物体组成;(b) 场景光被分束并聚焦到感光芯片上,形成两幅正交线偏振图像,红色与蓝色分别对应 x 偏振与 y 偏振光;(c) 感光芯片记录的原始编码图像对,深度信息编码在平移矢量的局部朝向上(绿色箭头),黑色轮廓为物体的几何像位置;(d) 从原始图像对解码得到的 4D 图像,包括全清晰 2D 光强($I_x$ 与 $I_y$)、偏振对比度($I_x/I_y$)与深度($z_{obj}$)。
图 1 把整个框架浓缩成四步:场景(a)里物体在不同深度、反射不同偏振;超表面把光按偏振分成两路(b),两路像在传感器上横向错开;错开的量是逐物体局部变化的,其方向携带深度(c);最后用分割与模板匹配把全清晰强度、偏振和深度一起解出来(d)。这里的关键是“编码在几何关系里”而不是“编码在模糊程度里”——所以解码对光强波动不敏感,这也是后面室内外实验误差能压到百分之一量级的原因。
表 1:几种深度/偏振成像路线的对比(内容依据论文引言整理,出处见文末参考资料)
| 方案 | 主动照明 | 单目单次 | 深度编码机制 | 主要代价 |
|---|---|---|---|---|
| 结构光 / 飞行时间 | 需要 | 不一定 | 投影图案 / 光飞行时间 | 需要激光与扫描或调制 |
| 双目 / 多目相机 | 不需要 | 否 | 视差(依赖基线) | 体积大,量程受基线限制 |
| 离焦测距 | 不需要 | 否 | 模糊程度随深度变化 | PSF 自相似,精度低,常需多次曝光 |
| 双螺旋 PSF | 不需要 | 是,但需参考像 | 双焦斑旋转角(≤180°) | 孪生像叠加,需额外参考通道 |
| 本文单目超表面相机 | 不需要 | 是 | 单螺旋焦斑旋转 360° + 偏振分束 | 原型工作谱带与视场较窄 |
设计:让 x 偏振和 y 偏振看到两套不同的“螺旋镜头”
单螺旋 PSF 听起来玄,实现它的相位分布却有一个清晰的递推结构:把超表面入瞳分成一圈圈菲涅耳环带,每圈携带逐渐增大的拓扑荷(topological charge,相位绕一圈 2π 的倍数)。论文给的设计相位是:
$$\psi_r(u,\varphi_u)=\left{l\varphi_u\ \middle|\ \left(\frac{l-1}{L}\right)^{\varepsilon}\le u\le \left(\frac{l}{L}\right)^{\varepsilon},\ l=1,\ldots,L\right}$$
其中 $u$ 是归一化径向坐标,$\varphi_u$ 是入瞳面方位角,$L$ 与 $\varepsilon$ 是可调参数。比起双螺旋 PSF 常用的 Gauss–Laguerre 模式叠加,这种菲涅耳环带法能在更宽的轴向深度范围内保持 PSF 形状近似不变,只让方向旋转。初值有了之后,论文再用迭代傅里叶变换算法反复优化,把能量集中到旋转焦斑的主瓣上——这一步把主瓣峰值强度提高了 36%。
但只有“会转的焦斑”还不够,还要把深度和偏振分开编码。超表面的第二个任务是偏振分束:对 x 偏振与 y 偏振分别附加一个反向倾斜的离轴聚焦相位
$$\psi_{xf}(x,y)=-\frac{2\pi}{\lambda}\left[\sqrt{x^{2}+y^{2}+f^{2}+2xf\sin\theta}-f\right],\qquad \psi_{yf}(x,y)=-\frac{2\pi}{\lambda}\left[\sqrt{x^{2}+y^{2}+f^{2}-2xf\sin\theta}-f\right]$$
其中工作波长 $\lambda=800$ nm、焦距 $f=20$ mm、离轴角 $\theta=8°$。效果相当于同一片镜片里藏着两枚“向相反方向各歪一点点的螺旋透镜”,x 偏振与 y 偏振各走一路,两套共轭单螺旋 PSF 在传感器上形成横向错开、互不重叠的像对。

图 2:超表面的设计与表征。(a) 优化后的相位分布,分别为 x 偏振与 y 偏振入射光产生一对解耦的共轭单螺旋 PSF;(b) 超表面将正交偏振光分束、聚焦到感光芯片横向错开位置的示意图,θ=8° 为偏振分束离轴角;(c) 单元结构为蓝宝石衬底上的矩形截面硅纳米柱,高 H=600 nm、周期 U=350 nm,宽度 W 与长度 L 在 100–250 nm 间变化;(d)–(f) 制备样品的照片 (d)、光学显微图 (e) 与扫描电子显微镜图 (f)(照片中其他超透镜用于不同实验);(g) 点光源轴向深度 z_obj 变化时,单螺旋 PSF 对旋转角 φ 的计算(绿线)与测量(绿星号)结果,插图为由共轭像对平移关系提取 φ 的方法;(h) x 偏振与 y 偏振入射光在不同 z_obj 下的单螺旋 PSF 计算与实测序列,像对关于几何像点(黑色十字线交点)共轭,箭头指向从几何像点到 PSF 极大值的矢量。
器件层怎么把两个正交偏振的相位同时写进一片镜片?图 2c 给出了答案:单元是蓝宝石衬底上矩形截面的硅纳米柱,高 600 nm、周期 350 nm,宽度与长度在 100–250 nm 之间变化,相邻柱最小间距大于 100 nm 以抑制近场耦合。矩形截面让纳米柱沿两个主轴分别响应 x 与 y 偏振光,可以独立地把两个偏振的相位都调满 $2\pi$,透射率接近 1。整个超表面用 CMOS 兼容工艺在商业产线代工(电子束光刻加干法刻蚀),口径 2 mm。
图 2d–f 是样品的实物、光学显微与扫描电镜照片。更关键的是图 2g、h 的功能表征:把点光源沿轴向移动,测得的旋转角 $\varphi$ 与轴向深度 $z_{obj}$ 的关系和设计曲线吻合,x/y 偏振的实测 PSF 序列也与计算一致。论文还报告了器件的两个硬指标:偏振消光比 35.6,两种线偏振入射的衍射效率分别为 44.54% 与 43.93%(衍射效率定义为聚焦光功率与入射光功率之比)。这组表征说明“相位设计 → 纳米柱单元 → 实测 PSF”整条链路是自洽的:单螺旋 PSF 真的随深度转起来了,而且转得快慢——即深度灵敏度——由设计决定。
实验一:室内静态场景,深度误差 0.37%
论文把 2 mm 口径的超表面与一片有效面积 12.8 × 12.8 mm² 的 CMOS 感光芯片组装成相机原型,机身前加中心波长 800 nm、带宽 10 nm 的带通滤光片和限制视场的光阑,整机 3.1 × 3.6 × 13.5 cm³。第一个实验场景摆了三块不同材料、处于不同轴向深度的样品:纸、铁和陶瓷,用一台发出部分偏振近红外光的 LED 照明。

图 3:室内静态场景成像。(a) 超表面相机实物照片;(b) 目标场景照片——纸、铁、陶瓷三块不同材料位于不同轴向深度;(c) 相机记录的原始编码图像对;(d) 解码后的全清晰偏振图像对 $I_x$ 与 $I_y$;(e) 场景偏振对比度 $I_x/I_y$,可清晰区分金属与非金属材料;(f) 计算深度与真值的对比(本场景及补充材料中的另一场景);(g) 重建深度图,归一化平均绝对误差($\Delta z_{obj}/z_{obj}$)仅 0.37%。
从原始图像对(图 3c)可以看出,两幅孪生像左右错开、互不重叠,这正是“免参考像”设计的直接证据。解码分两步:先对两幅像做图像分割,找到同一物体的两个像斑;再计算像对之间的平移矢量——矢量方向给出物体深度,两幅像的强度比 $I_x/I_y$ 给出该物点反射光的偏振态。图 3d 的重建结果显示纸和陶瓷在 $I_x$、$I_y$ 两路里强度接近,铁块的左右亮度明显不同;换算成对比度图(图 3e),金属与非金属被干净地分成两类——这与金属表面镜面反射保持偏振、粗糙/漫反射表面使偏振退化的经验规律一致。
深度方面,图 3g 的重建深度图与真值对比,归一化平均绝对误差(NMAE,绝对误差均值除以真值)只有 0.37%;论文在 25–34 cm 深度范围、物体更多的替代场景里也验证了误差低于 1%。重建本身不贵:每帧最多 500 × 1000 像素的 4D 图,在配备 i7-10875H CPU 与 16 GB 内存的普通笔记本上耗时不到 0.4 秒,不需要专用 GPU。
实验二:室外阳光下,追着一辆 10 cm/s 的小车测距
室内安静可控,室外才见真章。论文把相机搬到阳光下,对准一条玩具车跑道:车 1 静止,车 2 以约 10 cm/s 的非匀速速度朝相机开来,总位移约 25 cm。相机只靠太阳光照明,连续拍视频,逐帧重建深度。

图 4:室外动态场景成像。(a)、(b) 阳光下动态成像实验的场景示意图 (a) 与实拍照片 (b);车 2 以约 10 cm/s 的非匀速朝相机移动,车 1 保持静止;(c) 视频选定帧解码后的全清晰偏振图像对 $I_x$ 与 $I_y$;(d) 视频选定帧重建的深度图。
图 4d 的深度图序列里,静止的车 1 深度基本不变,移动的车 2 在一帧帧靠近——深度误差 NMAE 分别为静止车 0.78%、移动车 1.26%。室外误差略高于室内,论文给出的解释是室外深度范围更大,且存在信噪比与运动模糊之间的权衡:积分时间加长能提高信噪比,但运动物体会糊。单次曝光同时拿到强度与深度,意味着动态场景不需要多帧合成,这正是单目被动方案对自动驾驶、机器人这类场景的吸引力所在。
意义与展望
这项工作的意义在于把“超表面能精确塑形矢量光场”的能力直接兑现成一个完整相机:一片亚波长厚度的平面器件,同时承担偏振分束、螺旋相位编码和聚焦成像,让一台没有激光器、没有机械部件、没有参考像通道的单目相机在环境光下一次曝光拿到四维信息。相对依赖训练数据的黑盒重建,论文的编码-解码全程物理可解释,这使它更容易预测误差、迁移到新场景。
从原理验证走向实际应用,还有几个待推进的方向,论文自己划得很清楚。其一,原型的工作谱带(800 ± 10 nm)和视场仍窄,论文提出用多层超表面、多级衍射元件或改进光阑来扩大离轴角与视场,并利用色散设计让 PSF 同时依赖波长,进而实现多光谱乃至高光谱成像。其二,偏振目前只演示了 x/y 两个线性通道,论文提出用多路复用单元把三对正交偏振态分到传感器不同区域,扩展成全 Stokes 偏振成像。其三,原型深度测量针对分割后的、深度近似均匀的物体,面向复杂场景的逐像素重建可以引入压缩感知或深度学习等更强的算法,同时保持物理编码的可解释优势。关于量程,论文基于“旋转速度与口径平方成正比”的关系做了外推估计:若把口径放大到 5 cm,有望在约 200 m 距离上仍保持平均深度误差低于 1%——这仍是仿真外推而非实测,但给出了把深度感知从小场景推向远距离的清晰路径。这些方向一旦收敛,超表面相机就可能成为机器视觉、增强现实、自动驾驶与生物医学成像中通用的小型化镜头方案。
参考资料
- Shen Z, Zhao F, Jin C, Wang S, Cao L, Yang Y. Monocular metasurface camera for passive single-shot 4D imaging. Nature Communications 14, 1035 (2023). DOI: 10.1038/s41467-023-36812-6;期刊原文页;PMC 全文(开放获取,CC BY 4.0)。
- 论文图 1–4 高清原图:Nature Communications 官方图片源(CC BY 4.0),见 期刊文章配图 与 PMC 全文配图。