Appearance
基于Nerf架构的Argo三维重建
本文总结一个基于 Argo 与 BGC-Argo 浮标的全球海洋连续场重建项目。项目要解决的核心问题是:如何把时间、空间和深度上都不规则分布的剖面观测,转换为可以在任意经纬度、深度、季节和年份查询的温度、盐度与溶解氧场。
这项工作围绕三个问题逐步展开,网络结构只是其中一环:坐标应该怎样编码,才能同时表达季节循环、年际变化与垂向结构?测试集应该怎样划分,才能避免同一浮标轨迹泄漏?模型输出怎样加入海陆、海底与不确定性约束,才能真正形成可使用的 NetCDF 产品?
最终形成了两条相互衔接的技术路线:先用 1998—2025 年 Argo 观测重建全球温盐场,再将温盐均值和集成成员差异作为辅助信息,使用 2002—2025 年 BGC-Argo 数据重建溶解氧。
把离散剖面表示为连续函数
Argo 浮标沿漂流轨迹周期性下潜并返回温盐剖面。它提供了覆盖全球、持续多年的原位观测,但这些观测的空间和时间分布很不规则:浮标在空间上分布不均,不同年份密度不同,同一剖面的有效深度层也不完全一致。
传统做法通常先进行客观分析、克里金或气候态插值。本项目采用连续坐标神经场,把海洋变量直接表示为坐标的函数:
其中
温盐产品随后进入第二阶段:
其中
总体技术路线
整个项目可以概括为下面的数据流:
text
Argo 年度 NetCDF(1998—2025)
│
├─> 范围检查、剖面展开、浮标 ID 统一
├─> 按浮标与海区划分 train / validation / test
└─> 13 维周期坐标编码
│
├─> Fourier-feature MLP ─┐
└─> SIREN 对照实验 ─────┤
├─> 多随机种子集成
├─> GEBCO 海陆/海底掩膜
└─> 1°×1° 温盐 NetCDF 产品
│
BGC-Argo DOXY(2002—2025) ─> QC 与浮标隔离 ───────────────┤
├─> 坐标→DOXY
├─> T/S→DOXY
└─> T/S→AOU→DOXY工程上,数据读取、模型、掩膜、集成推理与 BGC 工具被拆分为独立模块;训练、统一测试、区域评估、水平切片和 NetCDF 导出则由命令行脚本完成。每个实验目录保存模型权重、归一化统计、数据划分、训练历史和评估结果,从而保证后续可以追溯同一个测试口径。
数据处理与无泄漏划分
Argo 温盐数据
温盐主线使用 1998—2025 年年度 NetCDF,共包含 2,734,713 条剖面和 18,079 台浮标。剖面被展开为逐深度样本,并过滤无效温度、盐度、坐标和深度。
数据泄漏是比网络结构更容易被忽略的问题。如果随机打散所有深度点,同一剖面甚至同一台浮标相邻日期的观测可能同时出现在训练集和测试集,最终指标会过于乐观。项目因此以完整浮标为最小单元进行划分,并在大西洋、太平洋、印度洋、南大洋和北部高纬五个区域内分层抽取测试浮标。
| 子集 | 样本点 | 浮标数 |
|---|---|---|
| 训练集 | 103,232,611 | 15,458 |
| 验证集 | 11,886,510 | 1,717 |
| 测试集 | 6,155,893 | 904 |
同一台浮标的全部剖面和深度层只会进入一个集合。目标变量的均值与标准差也只使用训练集计算,split.json 和 norm.json 会随模型一起保存。
BGC-Argo 溶解氧数据
溶解氧主线使用 2002—2025 年 BGC-Argo 年度文件。原始数据共有 11,942,428 个网格点,经过有限值和物理范围过滤后保留 10,792,785 个样本、1,997 台浮标,保留率约为 90.4%。
当前年度文件没有同时提供 adjusted 值与对应 QC 字段,这里采用范围过滤 QC,严格程度低于正式的 Argo adjusted-QC:
; ; ; 。
BGC 数据同样在 QC 后按浮标划分。最终测试集包含 482,306 个样本和 99 台完全未参与训练的浮标,避免模型通过浮标轨迹“见过”测试位置。
用坐标编码表达周期与尺度
直接把经度、日期和年份作为普通实数输入会产生几个问题:
项目将原始坐标转换为 13 维特征:
text
sin(lon), cos(lon), normalized_latitude, normalized_sqrt_depth,
sin(doy), cos(doy), normalized_year,
sin/cos(year/2), sin/cos(year/4), sin/cos(year/8)其中:
- 经度和年内日序使用正余弦编码,消除周期边界;
- 深度先开平方再归一化,提高 0—300 m 上层海洋的坐标分辨率;
- 线性年份项表达长期变化;
- 2、4、8 年谐波用于表示低频年际变化。
在此基础上,主模型使用随机 Fourier 特征:
再由多层感知机输出温度和盐度。不同坐标轴使用不同的频率尺度:空间频率相对较高,季节项居中,年际项较低。这比对全部轴使用同一频带更符合海洋场的变化尺度。
项目还实现了 SIREN 作为对照。SIREN 在隐层直接使用正弦激活,理论上适合连续隐式场,但对初始化、频率和学习率更敏感。在相同测试集和训练预算下,Fourier 模型收敛更稳、精度也更高。

上图展示了两种结构的验证误差。Fourier 模型在温度和盐度上都更快进入较低平台;弱稳定性惩罚则逐渐收敛到相近量级。这里的物理约束只用于抑制明显的静力不稳定:
它是一项弱正则,强度远低于完整的 TEOS-10 状态方程,不能替代正式的海洋物理诊断。
Fourier、SIREN 与多模型集成的温盐结果
在完全相同的 904 台 held-out 浮标、6,155,893 个测试点上,单模型结果如下:
| 模型 | 温度 RMSE | 盐度 RMSE | 定位 |
|---|---|---|---|
| Fourier | 0.983 °C | 0.160 PSU | 正式主模型 |
| SIREN | 1.053 °C | 0.188 PSU | 结构对照 |
SIREN 相对 Fourier 的温度和盐度 RMSE 分别高约 7.1% 和 17.2%。实验说明,在当前坐标编码、数据规模和训练预算下,加入分轴频率设计的 Fourier MLP 更适合这项全球温盐重建任务。

不同随机种子的 Fourier 模型在部分区域具有互补性。例如一个独立成员在热带与
对同一个坐标,产品同时计算成员均值和成员标准差:
成员均值用于减弱随机初始化误差,成员标准差用于标记模型分歧。不过它只反映初始化导致的差异,不包含观测误差、结构误差和分布外误差,不能直接解释为完整置信区间。
误差集中在哪里
分层结果显示,上层海洋明显比深层更难重建:Fourier 的温度 RMSE 从 0—100 m 的 1.147 °C 降至 700—1000 m 的 0.481 °C,盐度 RMSE 则从 0.205 PSU 降至 0.086 PSU。

这与真实海洋结构一致。上层受到海气通量、混合层变化、锋面和中尺度过程影响,时间与空间梯度更强;深层场更平滑,也更容易被连续网络表示。后续提升应重点关注上层、边缘海、复杂陆架和观测稀疏高纬区,这些区域比整体 RMSE 更能反映模型的实际短板。
从神经场到规则网格产品
从模型权重到海洋产品,推理阶段还需要回答两个物理边界问题:当前位置是不是陆地?请求深度是否已经超过当地海底?
项目使用两级掩膜:先通过海陆掩膜排除陆地,再读取 GEBCO 海底地形,排除海底以下网格。无效位置写为 NaN,并在产品中保存 valid_mask 与 seafloor_depth。
最终导出的 CF-1.8 风格 NetCDF 采用:
text
time × depth × latitude × longitude主要变量包括 temperature、salinity、temperature_std、salinity_std、valid_mask 和 seafloor_depth。当前 1998—2025 年、
溶解氧直接预测还是先预测 AOU
在温盐产品基础上,项目比较了三条 BGC 建模路线:
| 实验 | 输入 | 学习目标 | 含义 |
|---|---|---|---|
| coord_doxy | 13 维时空坐标 | DOXY | 纯坐标基线 |
| ts_doxy | 坐标 + T/S 均值与标准差 | DOXY | 直接预测溶解氧 |
| ts_aou | 坐标 + T/S 均值与标准差 | AOU | 由氧饱和度减去 AOU 还原 DOXY |
AOU 定义为:
氧饱和度通过 GSW/TEOS-10 路径计算。AOU 路线显式引入温盐对氧溶解度的控制,物理含义更清楚;直接 DOXY 路线则直接优化最终预测误差。三组实验使用同一数据划分、相同规模的 Fourier MLP、FP64 训练和统一的测试集。
低氧样本数量较少,却具有较高科学意义,因此训练使用分段加权 Huber 损失:DOXY 低于 60 μmol/kg 的权重为 3,60—120 μmol/kg 的权重为 2,其余样本权重为 1。这样既降低极端异常值对训练的冲击,也避免正常氧样本在数量上完全主导目标函数。
溶解氧结果与不确定性
最终测试集包含 482,306 个点、99 台未见浮标。总体结果为:
| 模型 | RMSE | MAE | Bias | R^2 |
|---|---|---|---|---|
| 坐标→DOXY | 22.879 | 13.269 | 2.467 | 0.9389 |
| T/S→DOXY | 19.507 | 11.839 | -0.150 | 0.9556 |
| T/S→AOU | 19.605 | 11.854 | -1.050 | 0.9551 |
单位均为 μmol/kg。加入温盐信息后,直接 DOXY 模型相对纯坐标基线的 RMSE 下降 3.372 μmol/kg,即 14.7%。按浮标聚类的 bootstrap 95% 置信区间为
直接 DOXY 与 AOU 路线的总体 RMSE 只相差 0.097 μmol/kg,95% 置信区间跨过 0,因此不能认为两者存在稳定的总体优劣。但 AOU 在部分低氧和深层区间更有优势:当观测 DOXY 小于 60 μmol/kg 时,三种模型 RMSE 分别为 29.714、21.644 和 20.052 μmol/kg。

上图展示 2020 年夏季 5 m、200 m 和 1000 m 的温度、盐度与溶解氧切片。温度随纬度和深度递减,盐度保留主要海盆结构;200 m 溶解氧能够呈现热带低氧区与高纬富氧水体的对比。灰色区域同时包含陆地与超过局地海底深度的位置。
项目还对温盐输入进行 16 次 Monte Carlo 采样,将集成均值与标准差传播到溶解氧模型。T/S→DOXY 的平均预测标准差为 1.254 μmol/kg,P95 为 4.693 μmol/kg,但名义 90% 区间的实际覆盖率只有 8.8%。这说明温盐成员差异只是总误差的一小部分;若需要可靠概率产品,还必须显式建模观测噪声、BGC 模型结构误差和分布外不确定性。
工程成果
经过这条技术路线,项目完成了以下可复用成果:
- 建立 1998—2025 年 Argo 温盐与 2002—2025 年 BGC-Argo 溶解氧的年度 NetCDF 数据管线;
- 实现 Fourier-feature MLP、SIREN、弱静力稳定性约束和浮标级区域分层划分;
- 完成五随机种子 Fourier 集成、成员分歧估计以及 GEBCO 海陆/海底掩膜;
- 导出约 7.9 GB 的 1998—2025 年全球
温盐集成产品; - 建立坐标→DOXY、T/S→DOXY 与 T/S→AOU 三模型统一评估流程;
- 通过 held-out float、分深度/纬度/海区评估和浮标聚类 bootstrap 验证模型增益;
- 将训练权重、数据划分、归一化、日志、评估指标和图件统一保存,形成可复现的实验目录。
局限与下一步
- 这一模型的定位是连续时空重建,求解海洋动力方程的预报系统属于另一类工具。训练期内的查询以插值为主,训练期外年份属于外推,可靠性会明显下降。
- 规则网格上的平滑结果只反映模型的输出形态,观测分辨率以下的真实中尺度结构仍需结合独立数据在观测稀疏区、陆架与边缘海进一步验证。
- 当前静力稳定性项只是经验代理,BGC 数据也只完成范围过滤 QC,后续需要接入更严格的
adjusted-QC、TEOS-10 诊断和观测误差模型。 - 集成标准差尚未经过概率校准,更完整的不确定性体系应同时考虑成员差异、局地观测密度、与最近观测的时空距离、数据源误差以及模型在分布外区域的行为。
从项目演进来看,模型、划分、物理边界和评估口径必须一起设计,这比选定某一种网络结构更重要。测试浮标真正隔离、掩膜和单位保持一致、基线与候选模型共享同一数据快照,是一个更低的 RMSE 具有明确含义的前提;把模型权重变成带坐标、掩膜和不确定性字段的标准产品,是神经场从实验走向可复用海洋数据工具的关键一步。