UNDERWATER 3D GAUSSIAN SPLATTING

水下 3DGS 建图系统
Time-to-Map

在保证地图质量的前提下,最小化「水下视频 → 可用 3DGS 地图」的时间—— 免离线 COLMAP,浑水边采集边建图,免 GT 米制尺度。 把双输出模型(DIRECT:D 深度 + J 去浊)用到初始化、米制、压缩三个关键位置。 数字为 2026-09 冻结口径(官方 u8-PSNR,独占 GPU 计时),coral 浑水(170 帧)与 AQUALOC 港湾(441 帧)双场景验证。

698 sT@0.15 达标墙钟
(170 帧,含推理与评测)
0.038 → 0.243 → 0.337优化预算旋钮的锐度响应
(离线上限 0.426 的 79%)
−20% · +15%高斯压缩 / 渲染 FPS
(D-conf 导引,同卡实测 208→240)
−65.5%免 GT 米制化 ATE
(AQUALOC 1.676→0.578 m)
2 场景coral 浑水 + AQUALOC 港湾
响应形态一致
全序列飞越 · 1017 帧(定稿配方模型沿完整采集轨迹渲染)· 点击暂停/播放

全序列飞越:定稿配方(光度一致全帧位姿 + 双输出联合 init)训练的模型, 沿完整采集轨迹逐帧渲染——1017 帧无跳步,从入水到收尾一遍看完。 在线管线与离线配方的完整质量账见 在线 vs 离线账本。

而这是"采集即建"的诚实产出——在线增量地图本体:T@0.15 = 698 s 达标的那张地图 (retention 0.243 / 26.16 dB),沿其增量训练轨迹渲染(关键帧间插值视角)。 与上方离线配方的画质差距 = 结构性锐度税 ~0.06 的直观形态;地图本身在采集进行到 11.6 分钟时就已经是这一状态。
01

研究目标

把"建图多快算快"变成一个可优化的指标。

水下视频不依赖离线 COLMAP,能否在可接受时间内建成质量达标的 3DGS 地图?瓶颈到底在哪?

把它定义成可优化的指标 Time-to-Map:T_map@Q = 在质量门控 (PSNR_u8 ≥ 24 且 锐度保持 retention ≥ 0.15)下,从水下视频到可用地图的最短时间。 锐度 retention = 渲染图与真值图的 Laplacian 方差中位比(衡量高频几何细节存留)。

02

系统:双输出模型用在哪里

整条管线不需要离线 COLMAP:初始化、尺度、压缩调度全部由双输出模型的深度分支承担。

水下视频帧 t ─→ DIRECT 推理 ─┬─ D_t ×s_f 逐帧米制定标 ─→ 反投影点 ─→ 追加进持久高斯地图 └─ J_t(去浊外观,可选 init) 每 chunk(10 帧) 光度增量训练(官方 densify/prune 调度) ─→ 质量门控评测(PSNR + retention) ─→ 持续精化
D · 深度几何初始化桥

逐帧深度按米制系数反投影成点云,直接追加进持久高斯地图——免 COLMAP 的浑水初始化, 这是整条在线管线能跑起来的前提。

D · 深度米制源(GT-free 定标)

全局单参数定标 s_d = median(z/z_direct)(33 万深度观测,全程无真值参与), 把任意尺度的轨迹一步拉回米制——离线 SfM 给不了的东西。

D · 深度表示压缩调度器

深度的多视角一致性 = 逐高斯置信度,用它门控 densify: −20% 高斯 / +15% 渲染 FPS,质量持平(详见压缩一节)。

J · 去浊外观初始化 / 紧凑化

去浊图像作外观 init:同 PSNR 下高斯更少(低预算档 −37%)。 实测 J 做几何监督无效——J 的价值在外观与紧凑性,不在几何。

03

调参经验:在线水下 3DGS 的杠杆排序

把有限算力花在哪?按实测杠杆从大到小——这也是本项目的核心 know-how。

①
优化预算是一阶杠杆,其他都是二阶

同样的输入,只动训练预算:6.8k → 20.4k → 40.8k iters,锐度 retention 0.038 → 0.243 → 0.337(同 init 离线训练上限 0.426)。深度模型精度、深度时序一致性、 写入策略、预算怎么分配——都不是杠杆。预算就是"质量-时间"旋钮,可随时停。

②
预算要花在早期:锐度是长出来的,不是补回来的

锐度在早期全视野 densify 生长中形成。对已收敛模型重开 densify 窗: +1.3dB PSNR 却换 −0.10 锐度;延迟开始 densify、重排训练窗、按置信度正/反向门控—— 全都不动锐度。在线系统的预算应该花在早期生长,事后精修是亏本买卖。

③
位姿要"光度一致",而不只是轨迹准

决定渲染是高质量还是概览级的,是位姿的局部逐对光度一致性(重投影 0.2px vs 16px 的差别); 轨迹的米制/形状精度是另一回事,两者独立。米制轨迹喂 3DGS 照样糊,光度一致位姿才出细节:

位姿光度一致性决定渲染质量
同一序列、同一训练器:上 = 常规 SLAM 位姿(概览级,细节丢失); 下 = 光度一致位姿 + 双输出联合 init(高质量)。位姿一致性是水下 3DGS 画质的第一张入场券。
④
init 组成:稀疏脚手架 ∪ 深度反投影

纯深度反投影 init 缺光度脚手架;稀疏点 ∪ DIRECT 反投影的联合 init 在光度一致位姿下恢复离线锐度的 92%。J 外观 init 额外省高斯(预算越紧收益越大: 6.8k 档 −37%,20.4k 档 −12%——预算充分后 densify 会回填外观优势)。

⑤
渲染 FPS 跟"可见高斯"走,不跟总高斯走

总高斯 −20% 只带来可见高斯 −14%、FPS +15%;而 batch 地图总高斯更多、 可见高斯少 32%,FPS 反而 +21%。增量建图的壳层冗余是"看得见的负担"—— 想提速,压的是视野内可见数量。

⑥
早停看 retention,别只看 loss / PSNR

光度 loss 与 PSNR 很早就平台化,锐度 retention 却还在长——按 loss 平台自适应早停 会停在 retention 0.045(vs 同预算可达 0.243)。质量门控必须是渲染口径(PSNR + Laplacian 比)。

RECOMMENDED RECIPE · 推荐配方

D 逐帧米制反投影 init + 稀疏 ∪ DIRECT 联合 init + J 外观 init + conf≥p50 门控 densify + 全局 s_d 定标米制化 —— 即压缩阶梯的 L2 推荐档:高斯 −20.4% / FPS +15.3% / VRAM −7.5%,质量持平。

04

主结果 ①:Time-to-Map 与预算旋钮

coral 浑水关键帧序列,170 帧,独占 GPU 计时。

配置训练 iters锐度 retentionPSNR_u8墙钟(独占)
最小预算6.8k0.03826.03370 s
在线推荐档 ← T@0.15 = 698 s20.4k0.243 ±0.00626.16~890 s
高预算档40.8k0.33725.261530 s
同 init 离线 batch(上限参照)30k0.42626.461186 s
换用在线位姿 @20.4k20.4k0.104 / 0.09223.0 / 22.6~855 s
按 loss 平台早停8.4k 即停0.04526.03442 s

预算 = 质量-时间旋钮:在 0.038–0.337 之间随取随停;"换在线位姿"行说明位姿等级在低预算下无关紧要、预算解锁后才成为天花板。早停行是教训 ⑥ 的实测。

最小预算渲染最小预算 6.8k
ret 0.038 · 26.03 dB · 370 s
在线推荐档渲染在线推荐档 20.4k
ret 0.243 · 26.16 dB · ~890 s
高预算档渲染高预算档 40.8k
ret 0.337 · 25.26 dB · 1530 s
batch 上限渲染batch 上限 30k
ret 0.426 · 26.46 dB · 1186 s
真值GT 真值参照
预算阶梯 · 同一 held-out 视图(canonical 渲染):预算从 6.8k 提到 40.8k, 细节密度单调上升,batch 上限仍最高——"预算即画质旋钮"的直接可视化。
1.2k iters 渲染ck01 · 1.2k iters · t ≈ 53 s
4.8k iters 渲染ck04 · 4.8k iters · t ≈ 214 s
8.4k iters 渲染ck07 · 8.4k iters · t ≈ 376 s
15.6k iters 渲染ck13 · 15.6k iters · t ≈ 698 s
20.4k iters 渲染ck17 · 20.4k iters · t ≈ 891 s
真值GT 真值参照
增量建图演化 · 同一 held-out 视图(canonical A3,代表性检查点): 采集开始 1 分钟只有朦胧结构,随 chunk 推进细节逐步长出,15 分钟收尾——"采集即建、边走边长"的直观形态。
AQUALOC 6k 渲染6k iters · ~4 min
ret 0.141
AQUALOC 18k 渲染18k iters · ~9 min
ret 0.220
AQUALOC 30k 上限渲染30k 上限 · ~16 min
ret 0.337
AQUALOC 真值GT 真值参照
跨场景复现(AQUALOC,441 帧):预算-响应形态与 coral 一致: ret 0.141→0.220→0.337,PSNR_u8 19.0→34.5,T@0.15 = 354 s——结论不依赖单一场景。
05

主结果 ②:免 GT 米制化(AQUALOC)

离线 COLMAP 只给任意尺度的轨迹;一个参数把轨迹拉回米制,全程无真值参与。

离线 COLMAP 只给任意尺度的轨迹(SE3-ATE 1.676 m,尺度差 43%)。用 DIRECT 深度做全局单参数定标 s_d = median(z/z_direct)(33 万深度观测,全程无真值参与), 一步把轨迹拉回米制:

SE3-ATE:1.676 m → 0.578 m(−65.5%)  · sim3_scale 0.57 → 0.95 ≈ 1(与压力计独立米制源交叉验证)

SE3 ≈ Sim3(0.578 ≈ 0.568)意味着米制版免费达到了免尺度版的形状质量—— 机制是 1 参数定标即达标(联合 BA 在定标初值上零移动)。 边界:505/1529 帧注册覆盖、离线、单序列。

AQUALOC 轨迹顶视图:raw vs 米制
轨迹顶视图(SE3 对齐、不拟合尺度):黑 = 压力计米制 GT,红 = COLMAP 原始(尺度漂移), 绿 = DIRECT 全局定标后——绿线贴住黑线。
逐帧 ATE 误差曲线
逐帧对齐误差(n=505 注册帧):红 = raw(尾部漂到 3.4 m),绿 = 米制(全程 <1.2 m)。
06

主结果 ③:D 置信度导引的表示压缩

深度的多视角一致性 = 逐高斯置信度;它不提画质,但同质量把地图做小做快。

把 DIRECT 深度的多视角一致性变成逐高斯置信度(conf),门控 densify—— "把有限计算导向几何上可信的区域"。固定 20.4k 预算对照:

配置 @20.4kretentionPSNR_u8高斯数墙钟
增量基准(官方窗)0.24326.161.50M~890 s
batch 等预算参照0.30226.531.55M864 s
增量,全窗 densify0.23126.311.29M901 s
conf≥p50 门控(本项目)0.22126.41 1.06M(−29%)878 s
反向门控(对照)0.22226.261.22M877 s

判读:conf 门控不提升画质——正反门控同结果(conf 与锐度正交); 它的价值在压缩轴:−29% 高斯换 +0.25dB PSNR,直接兑现为渲染加速与表示体积。

各配置终态渲染对比
终态渲染对比:GT 参照 / 最小预算 / 在线推荐档 / conf 门控(同预算更紧凑)/ 高预算 / batch 上限。

工程压缩阶梯(全部实测渲染基准)

配置 @20.4kretentionPSNR_u8高斯数可见高斯渲染 FPSVRAM
L0 基线0.23226.061.512M486k2083219MB
L1 + J 外观 init0.23125.931.336M438k2263088MB
L2 + conf 门控 p50(推荐)0.23626.09 1.204M(−20%)415k240(+15%)2979MB
L3 + p75(过度压缩)0.21325.971.158M399k2472937MB
batch 上限参照0.42626.461.552M329k2543157MB

渲染基准协议:同 GPU / 同 25 test 视图 / 同渲染器,warmup 10 轮计 50 轮; 可见高斯 = radii>0 均值。J-init 的压缩收益随预算提高而收缩(6.8k 档 −37% → 20.4k 档 −12%), 与 conf 门控叠加后总压缩 −20%;p75 过度(retention −0.019)。

一句话机理:在线增量的锐度天花板比 batch 低 ~0.06(结构性锐度税), 且事后不可恢复——重开 densify、延迟生长、重新分配预算、conf 门控都不动锐度。 设计在线 3DGS 系统时,把预算花在早期生长,把压缩交给置信度门控。
07

在线 vs 离线:Time-to-Map 的账

不是刷离线质量榜——在线系统赢在时间轴、米制、鲁棒与可控性。

维度在线增量(本项目)离线参照
首个达标地图 T@0.15698 s(采集即建,边走边出图) 须全量数据到齐:COLMAP 数小时 + 训练 ~20 min
PSNR_u826.16(推荐档)/ 26.41(conf 门控) 26.46(batch 上限)/ ≈26.8(经典 COLMAP 管线)
锐度 retention0.243(推荐档)/ 0.337(高预算档) 0.426(batch)——诚实差距,机理见第五节
地图大小 / 渲染速度1.20M 高斯,240 FPS(L2,−20%/+15% 实测)1.50M,210 FPS(同口径)
米制(GT-free)✅ ATE 0.578 m(−65.5%) ❌ COLMAP 无绝对尺度(SE3-ATE 1.676 m)
浑水鲁棒性✅ 免 SfM(初始化来自深度反投影) SfM 易碎:该序列 1529 帧仅 505 帧注册为单组件
预算可调阶梯即旋钮(0.038→0.337,随时停)固定 30k 全量

优势一句话:不是渲染质量超过离线——PSNR 打平(99%),锐度有结构性差距; 赢在时间轴(采集即建 vs 到齐再建)、米制(离线 COLMAP 给不了)、浑水鲁棒 (免 SfM)、预算可控、地图更紧凑。

公开数据集 SeaThruNeRF 上的配方对比
配方泛化:同一套联合 init 配方搬到公开清水数据集 SeaThruNeRF, 五档对比中 PSNR/SSIM/LPIPS 三指标均最优(22.36/0.865/0.199);四场景宏平均 25.81(纯稀疏 init 25.32 / 高级编码基线 26.35 / SeaSplat 26.56)。
08

结论与边界

三条可复述的结论,和一条不越界的措辞。

① 在线增量 3DGS 的质量一阶杠杆是优化预算;位姿等级是预算解锁后的第二瓶颈。 ② 双输出模型的正确用法 = 几何初始化桥 + 表示压缩调度器 + 米制源(外加 J 的外观紧凑化), 而非画质提升。③ 增量 → batch 存在 ~0.06 的结构性锐度税,事后不可恢复—— 这是在线 3DGS 系统设计的方向性约束。

正式措辞(引用请逐字):
在 DIRECT D-init + 在线位姿 + 增量 3DGS 条件下,系统地测得优化预算是早期地图质量的一阶因素; 位姿质量在预算提升后成为进一步限制因素;若干直觉上的 depth/fusion/densification 调整未显示同量级收益。(不声称"解决了水下 3DGS 核心难点"。)

诚实条目:主结论在 coral(170 帧,单场景);AQUALOC 复现预算-响应趋势 (441 帧)。在线建图为 near-online(170 帧约 15 分钟),非 real-time。 置信度门控与全窗的差异属边缘量级。更早口径的数字已退役,本页不引用。

◈

结果数据原件(data/)

头条数字的机器可读原始 JSON,未手抄、未改写。

文件内容
canonical_analysis.jsonTime-to-Map 各档位:retention / PSNR / 质量门达线时刻 / 独占墙钟(698 s、预算阶梯、上限 0.426 均出于此)
retention.json调度与压缩各配置的逐检查点曲线(retention / PSNR / 高斯数 / 墙钟)
bench.json渲染基准三件套:FPS / 可见高斯 / peak VRAM(六模型同卡实测)
ate_e18b_metric_ba.jsonAQUALOC 米制化:SE3/Sim3 ATE、sim3_scale(原始值 0.5775 m)