最小预算 6.8kret 0.038 · 26.03 dB · 370 s
在保证地图质量的前提下,最小化「水下视频 → 可用 3DGS 地图」的时间—— 免离线 COLMAP,浑水边采集边建图,免 GT 米制尺度。 把双输出模型(DIRECT:D 深度 + J 去浊)用到初始化、米制、压缩三个关键位置。 数字为 2026-09 冻结口径(官方 u8-PSNR,独占 GPU 计时),coral 浑水(170 帧)与 AQUALOC 港湾(441 帧)双场景验证。
全序列飞越:定稿配方(光度一致全帧位姿 + 双输出联合 init)训练的模型, 沿完整采集轨迹逐帧渲染——1017 帧无跳步,从入水到收尾一遍看完。 在线管线与离线配方的完整质量账见 在线 vs 离线账本。
把"建图多快算快"变成一个可优化的指标。
水下视频不依赖离线 COLMAP,能否在可接受时间内建成质量达标的 3DGS 地图?瓶颈到底在哪?
把它定义成可优化的指标 Time-to-Map:T_map@Q = 在质量门控 (PSNR_u8 ≥ 24 且 锐度保持 retention ≥ 0.15)下,从水下视频到可用地图的最短时间。 锐度 retention = 渲染图与真值图的 Laplacian 方差中位比(衡量高频几何细节存留)。
整条管线不需要离线 COLMAP:初始化、尺度、压缩调度全部由双输出模型的深度分支承担。
逐帧深度按米制系数反投影成点云,直接追加进持久高斯地图——免 COLMAP 的浑水初始化, 这是整条在线管线能跑起来的前提。
全局单参数定标 s_d = median(z/z_direct)(33 万深度观测,全程无真值参与), 把任意尺度的轨迹一步拉回米制——离线 SfM 给不了的东西。
深度的多视角一致性 = 逐高斯置信度,用它门控 densify: −20% 高斯 / +15% 渲染 FPS,质量持平(详见压缩一节)。
去浊图像作外观 init:同 PSNR 下高斯更少(低预算档 −37%)。 实测 J 做几何监督无效——J 的价值在外观与紧凑性,不在几何。
把有限算力花在哪?按实测杠杆从大到小——这也是本项目的核心 know-how。
同样的输入,只动训练预算:6.8k → 20.4k → 40.8k iters,锐度 retention 0.038 → 0.243 → 0.337(同 init 离线训练上限 0.426)。深度模型精度、深度时序一致性、 写入策略、预算怎么分配——都不是杠杆。预算就是"质量-时间"旋钮,可随时停。
锐度在早期全视野 densify 生长中形成。对已收敛模型重开 densify 窗: +1.3dB PSNR 却换 −0.10 锐度;延迟开始 densify、重排训练窗、按置信度正/反向门控—— 全都不动锐度。在线系统的预算应该花在早期生长,事后精修是亏本买卖。
决定渲染是高质量还是概览级的,是位姿的局部逐对光度一致性(重投影 0.2px vs 16px 的差别); 轨迹的米制/形状精度是另一回事,两者独立。米制轨迹喂 3DGS 照样糊,光度一致位姿才出细节:
纯深度反投影 init 缺光度脚手架;稀疏点 ∪ DIRECT 反投影的联合 init 在光度一致位姿下恢复离线锐度的 92%。J 外观 init 额外省高斯(预算越紧收益越大: 6.8k 档 −37%,20.4k 档 −12%——预算充分后 densify 会回填外观优势)。
总高斯 −20% 只带来可见高斯 −14%、FPS +15%;而 batch 地图总高斯更多、 可见高斯少 32%,FPS 反而 +21%。增量建图的壳层冗余是"看得见的负担"—— 想提速,压的是视野内可见数量。
光度 loss 与 PSNR 很早就平台化,锐度 retention 却还在长——按 loss 平台自适应早停 会停在 retention 0.045(vs 同预算可达 0.243)。质量门控必须是渲染口径(PSNR + Laplacian 比)。
D 逐帧米制反投影 init + 稀疏 ∪ DIRECT 联合 init + J 外观 init + conf≥p50 门控 densify + 全局 s_d 定标米制化 —— 即压缩阶梯的 L2 推荐档:高斯 −20.4% / FPS +15.3% / VRAM −7.5%,质量持平。
coral 浑水关键帧序列,170 帧,独占 GPU 计时。
| 配置 | 训练 iters | 锐度 retention | PSNR_u8 | 墙钟(独占) |
|---|---|---|---|---|
| 最小预算 | 6.8k | 0.038 | 26.03 | 370 s |
| 在线推荐档 ← T@0.15 = 698 s | 20.4k | 0.243 ±0.006 | 26.16 | ~890 s |
| 高预算档 | 40.8k | 0.337 | 25.26 | 1530 s |
| 同 init 离线 batch(上限参照) | 30k | 0.426 | 26.46 | 1186 s |
| 换用在线位姿 @20.4k | 20.4k | 0.104 / 0.092 | 23.0 / 22.6 | ~855 s |
| 按 loss 平台早停 | 8.4k 即停 | 0.045 | 26.03 | 442 s |
预算 = 质量-时间旋钮:在 0.038–0.337 之间随取随停;"换在线位姿"行说明位姿等级在低预算下无关紧要、预算解锁后才成为天花板。早停行是教训 ⑥ 的实测。
最小预算 6.8k
在线推荐档 20.4k
高预算档 40.8k
batch 上限 30k
GT 真值参照
ck01 · 1.2k iters · t ≈ 53 s
ck04 · 4.8k iters · t ≈ 214 s
ck07 · 8.4k iters · t ≈ 376 s
ck13 · 15.6k iters · t ≈ 698 s
ck17 · 20.4k iters · t ≈ 891 s
GT 真值参照
6k iters · ~4 min
18k iters · ~9 min
30k 上限 · ~16 min
GT 真值参照离线 COLMAP 只给任意尺度的轨迹;一个参数把轨迹拉回米制,全程无真值参与。
离线 COLMAP 只给任意尺度的轨迹(SE3-ATE 1.676 m,尺度差 43%)。用 DIRECT 深度做全局单参数定标 s_d = median(z/z_direct)(33 万深度观测,全程无真值参与), 一步把轨迹拉回米制:
SE3-ATE:1.676 m → 0.578 m(−65.5%) · sim3_scale 0.57 → 0.95 ≈ 1(与压力计独立米制源交叉验证)
SE3 ≈ Sim3(0.578 ≈ 0.568)意味着米制版免费达到了免尺度版的形状质量—— 机制是 1 参数定标即达标(联合 BA 在定标初值上零移动)。 边界:505/1529 帧注册覆盖、离线、单序列。
深度的多视角一致性 = 逐高斯置信度;它不提画质,但同质量把地图做小做快。
把 DIRECT 深度的多视角一致性变成逐高斯置信度(conf),门控 densify—— "把有限计算导向几何上可信的区域"。固定 20.4k 预算对照:
| 配置 @20.4k | retention | PSNR_u8 | 高斯数 | 墙钟 |
|---|---|---|---|---|
| 增量基准(官方窗) | 0.243 | 26.16 | 1.50M | ~890 s |
| batch 等预算参照 | 0.302 | 26.53 | 1.55M | 864 s |
| 增量,全窗 densify | 0.231 | 26.31 | 1.29M | 901 s |
| conf≥p50 门控(本项目) | 0.221 | 26.41 | 1.06M(−29%) | 878 s |
| 反向门控(对照) | 0.222 | 26.26 | 1.22M | 877 s |
判读:conf 门控不提升画质——正反门控同结果(conf 与锐度正交); 它的价值在压缩轴:−29% 高斯换 +0.25dB PSNR,直接兑现为渲染加速与表示体积。
| 配置 @20.4k | retention | PSNR_u8 | 高斯数 | 可见高斯 | 渲染 FPS | VRAM |
|---|---|---|---|---|---|---|
| L0 基线 | 0.232 | 26.06 | 1.512M | 486k | 208 | 3219MB |
| L1 + J 外观 init | 0.231 | 25.93 | 1.336M | 438k | 226 | 3088MB |
| L2 + conf 门控 p50(推荐) | 0.236 | 26.09 | 1.204M(−20%) | 415k | 240(+15%) | 2979MB |
| L3 + p75(过度压缩) | 0.213 | 25.97 | 1.158M | 399k | 247 | 2937MB |
| batch 上限参照 | 0.426 | 26.46 | 1.552M | 329k | 254 | 3157MB |
渲染基准协议:同 GPU / 同 25 test 视图 / 同渲染器,warmup 10 轮计 50 轮; 可见高斯 = radii>0 均值。J-init 的压缩收益随预算提高而收缩(6.8k 档 −37% → 20.4k 档 −12%), 与 conf 门控叠加后总压缩 −20%;p75 过度(retention −0.019)。
不是刷离线质量榜——在线系统赢在时间轴、米制、鲁棒与可控性。
| 维度 | 在线增量(本项目) | 离线参照 |
|---|---|---|
| 首个达标地图 T@0.15 | 698 s(采集即建,边走边出图) | 须全量数据到齐:COLMAP 数小时 + 训练 ~20 min |
| PSNR_u8 | 26.16(推荐档)/ 26.41(conf 门控) | 26.46(batch 上限)/ ≈26.8(经典 COLMAP 管线) |
| 锐度 retention | 0.243(推荐档)/ 0.337(高预算档) | 0.426(batch)——诚实差距,机理见第五节 |
| 地图大小 / 渲染速度 | 1.20M 高斯,240 FPS(L2,−20%/+15% 实测) | 1.50M,210 FPS(同口径) |
| 米制(GT-free) | ✅ ATE 0.578 m(−65.5%) | ❌ COLMAP 无绝对尺度(SE3-ATE 1.676 m) |
| 浑水鲁棒性 | ✅ 免 SfM(初始化来自深度反投影) | SfM 易碎:该序列 1529 帧仅 505 帧注册为单组件 |
| 预算可调 | 阶梯即旋钮(0.038→0.337,随时停) | 固定 30k 全量 |
优势一句话:不是渲染质量超过离线——PSNR 打平(99%),锐度有结构性差距; 赢在时间轴(采集即建 vs 到齐再建)、米制(离线 COLMAP 给不了)、浑水鲁棒 (免 SfM)、预算可控、地图更紧凑。
三条可复述的结论,和一条不越界的措辞。
① 在线增量 3DGS 的质量一阶杠杆是优化预算;位姿等级是预算解锁后的第二瓶颈。 ② 双输出模型的正确用法 = 几何初始化桥 + 表示压缩调度器 + 米制源(外加 J 的外观紧凑化), 而非画质提升。③ 增量 → batch 存在 ~0.06 的结构性锐度税,事后不可恢复—— 这是在线 3DGS 系统设计的方向性约束。
诚实条目:主结论在 coral(170 帧,单场景);AQUALOC 复现预算-响应趋势 (441 帧)。在线建图为 near-online(170 帧约 15 分钟),非 real-time。 置信度门控与全窗的差异属边缘量级。更早口径的数字已退役,本页不引用。
头条数字的机器可读原始 JSON,未手抄、未改写。
| 文件 | 内容 |
|---|---|
canonical_analysis.json | Time-to-Map 各档位:retention / PSNR / 质量门达线时刻 / 独占墙钟(698 s、预算阶梯、上限 0.426 均出于此) |
retention.json | 调度与压缩各配置的逐检查点曲线(retention / PSNR / 高斯数 / 墙钟) |
bench.json | 渲染基准三件套:FPS / 可见高斯 / peak VRAM(六模型同卡实测) |
ate_e18b_metric_ba.json | AQUALOC 米制化:SE3/Sim3 ATE、sim3_scale(原始值 0.5775 m) |