K2E-B-G5-12 · Paper Note

LiDAR-NeRF

Created 2024-03-31Updated 2026-06-11slam / papers / g-geometry-rendering / g5-nerf-slam

  • Description:LiDAR-NeRF 论文笔记 — 新视角 LiDAR 点云合成,range image 表示 + 可微渲染联合建模深度/强度/ray-drop,提出 NeRF-MVL 基准
  • My Notion Note ID:K2E-B-G5-12
  • Created:2024-03-31
  • Updated:2026-06-11
  • License转载欢迎:转载请注明作者 Yu Zhang 并附原文出处(yuzhang.io

Table of Contents


1. Summary

Title: LiDAR-NeRF: Novel LiDAR View Synthesis via Neural Radiance Fields Authors: T. Tang, L. Gao, G. Wang, Y. Lao, P. Chen, H. Zhao, D. Hao, X. Liang, M. Salzmann, K. Yu Paper: arXiv:2304.10406 (ACM MM 2024) Github: tangtaogo/lidar-nerf

LiDAR-NeRF新视角 LiDAR 点云合成:给定多视角 LiDAR 观测,生成任意新视角下的点云(距离 + 强度 + ray-drop)。与 RGB NeRF 本质不同:LiDAR 是稀疏 3D 测量 + 传感器属性,LiDAR-NeRF 把点云投影成 range image 后套 NeRF 体渲染框架,同时建模几何 (距离) + 强度 + ray-drop 三路输出。针对低纹理区域(地面、长墙)提出结构正则防止过平滑。

同时提出 NeRF-MVL 基准(76k+ 帧、9 类物体、多 LiDAR 绕物方形轨迹)。NeRF-MVL 物体级 F-score 98.50%(PCGen 90.40%);KITTI-360 场景级 Chamfer 0.081(PCGen 0.187)。

LiDAR-NeRF 流程:LiDAR 点云 → Range Image → iNGP 体渲染 → 合成新视角点云

2. Key Contributions

  • 首个可微 LiDAR 视图合成框架:统一体渲染距离 / 强度 / ray-drop,无需显式建网格
  • Range image 表示:把 3D 点云投影为 H×WH\times W 伪图,按行/列对应激光束,套用 NeRF 渲染流程
  • 结构正则:在低纹理区(地面/长墙)用梯度掩码约束局部几何连续性,防过平滑
  • NeRF-MVL 基准:76k+ 帧,9 类物体,多 LiDAR 配置,专为 LiDAR 新视角合成设计
  • 基于 Instant-NGP(iNGP,多分辨率哈希编码实时 NeRF,笔记)实现,单 RTX 3090 运行,训练 30k 步

3. Method

3.1 Range Image 表示

3D 点 (x,y,z)(x,y,z) 距离 d=x2+y2+z2d=\sqrt{x^2+y^2+z^2},投影为 range image 像素坐标:

h=(1arcsin(z/d)+fdownfv)×H,w=12(1arctan(y,x)π)×Wh = \Bigl(1 - \frac{\arcsin(z/d) + |f_{down}|}{f_v}\Bigr)\times H, \quad w = \frac{1}{2}\Bigl(1 - \frac{\arctan(y,x)}{\pi}\Bigr)\times W

fvf_v 为垂直 FOV,fdownf_{down} 为下视角,H×WH\times W 为 range image 分辨率,arctan(y,x)\arctan(y,x) 为水平方向角。

转成图像域后每像素对应一条激光束(射线),直接套用 NeRF 体渲染框架,按射线积分距离/强度/ray-drop。

3.2 可微 LiDAR 渲染

隐式场对位置 x\mathbf{x} + 方向 θ\boldsymbol{\theta} 输出三个量:

(σ,i,p)=f(x,θ)(\sigma, i, p) = f(\mathbf{x}, \boldsymbol{\theta})

σ\sigma 为密度(几何),ii 为强度(材质反射),ppray-drop 概率(激光束未能返回)。

体渲染权重 wj=Tj(1eσjδj)w_j = T_j(1-e^{-\sigma_j\delta_j})Tj=exp(k<jσkδk)T_j = \exp(-\sum_{k<j}\sigma_k\delta_k),三路积分:

D^(r)=jwjtj,I^(r)=jwjij,P^(r)=jwjpj\hat{D}(\mathbf{r}) = \sum_j w_j t_j, \quad \hat{I}(\mathbf{r}) = \sum_j w_j i_j, \quad \hat{P}(\mathbf{r}) = \sum_j w_j p_j

D^\hat{D} / I^\hat{I} / P^\hat{P} 分别为渲染距离、强度、ray-drop 期望值。

采样:768 粗 + 64 精细采样点每射线;优化器 Adam (lr=1e-2),训练 30k 步,RTX 3090。

3.3 结构正则与损失函数

标准 NeRF 对低纹理区(平地、长墙)忽略局部结构,导致地面过平滑。提出结构正则:仅在梯度掩码 (GM) 标记的低纹理区施加梯度一致约束:

Lreg=GM^(R)GM(R)1\mathcal{L}_{reg} = \|\hat{GM}(R) - GM(R)\|_1

GM(R)GM(R) 为真值 range image 的梯度掩码,GM^(R)\hat{GM}(R) 为渲染结果的梯度掩码。

总损失(4 项)

Ltotal=Ldist+λ1Lint+λ2Lraydrop+λ3Lreg\mathcal{L}_{total} = \mathcal{L}_{dist} + \lambda_1\mathcal{L}_{int} + \lambda_2\mathcal{L}_{raydrop} + \lambda_3\mathcal{L}_{reg}
  • Ldist=1RrRD^(r)D(r)\mathcal{L}_{dist} = \frac{1}{|\mathcal{R}|}\sum_{r\in\mathcal{R}}|\hat{D}(r) - D^*(r)|:距离 L1 损失;D^(r)\hat{D}(r) 为渲染期望终止距离,D(r)D^*(r) 为 LiDAR 实测 range(λ=1\lambda=1
  • Lint=1RrR(I^(r)I(r))2\mathcal{L}_{int} = \frac{1}{|\mathcal{R}|}\sum_{r\in\mathcal{R}}(\hat{I}(r) - I^*(r))^2:强度 L2 损失;I^(r)\hat{I}(r) 为渲染反射强度,I(r)I^*(r) 为真值强度(λ1=1\lambda_1=1
  • Lraydrop=1RrR(P^(r)P(r))2\mathcal{L}_{raydrop} = \frac{1}{|\mathcal{R}|}\sum_{r\in\mathcal{R}}(\hat{P}(r) - P^*(r))^2:ray-drop 概率 L2 损失;P^(r)\hat{P}(r) 为渲染 drop 概率,P(r){0,1}P^*(r)\in\{0,1\} 为真值标签(光线是否被遮挡/缺失,λ2=1\lambda_2=1
  • Lreg\mathcal{L}_{reg}:结构正则,λ3=100\lambda_3=100(权重远大于其他项,强调低纹理区几何约束)
  • R\mathcal{R}:射线批次(range image 中的采样光线集合)

4. Experiments & Results

数据集

数据集 类型 评估
KITTI-360 真实自驾场景级 LiDAR Chamfer, F-score, RMSE
NeRF-MVL (本文提出) 76k+ 帧,9 类物体绕物方形轨迹 Chamfer, F-score, RMSE

KITTI-360 场景级结果

Method Chamfer ↓ F-score ↑ RMSE (m) ↓
LiDARsim 0.951 66.89% 5.745
PCGen 0.187 87.16% 4.328
LiDAR-NeRF (Instant-NGP+reg) 0.081 92.49% 3.615

NeRF-MVL 物体级结果

Method Chamfer ↓ F-score ↑ RMSE (m) ↓
PCGen 0.078 90.40%
LiDAR-NeRF 0.005 98.50% 1.305

物体级大幅领先:Chamfer 0.005 vs PCGen 0.078(15.6×),F-score 98.50% vs 90.40%。

LiDAR-NeRF 在 NeRF-MVL 数据集上合成新视角 LiDAR 点云的质量对比

5. Ablation & Discussion

  • 结构正则:去掉后地面区域明显过平滑,Chamfer 上升;λ3=100\lambda_3=100 远大于其他权重(λ1,2=1\lambda_{1,2}=1),强调低纹理区几何约束
  • Ray-drop 建模:不建模 ray-drop 的版本产生大量虚假表面点(λ2=1\lambda_2=1 的 L2 监督足以约束)
  • Instant-NGP 后端:相比原版 NeRF 快约 100×,使单 GPU 30k 步训练可行

NeRF-MVL 基准的意义:现有 LiDAR 仿真评估缺乏标准,NeRF-MVL 提供多物体类别、多 LiDAR 配置的系统性评估框架。

6. Strengths / Limitations / Future Work

Strengths

  • 首个统一距离/强度/ray-drop 的可微 LiDAR 合成框架
  • NeRF-MVL 基准为 LiDAR 视图合成提供标准评测
  • KITTI-360 Chamfer 比 PCGen 低 2.3×

Limitations

  • 每场景独立训练(无泛化能力,同原版 NeRF)
  • 仅静态场景;动态目标(行人、车辆)未处理
  • 不是 SLAM 系统(无跟踪/建图流程,仅合成)

Future Work (论文)

  • 动态场景扩展
  • 联合 LiDAR-相机渲染

References