# 2026-08-27 大气科学 AI 研究日报

> 核验窗口：连续主窗口为 2026-08-26 13:06:02 至 2026-08-27 13:02:18（UTC+8）；24—48 小时缓冲窗口为 2026-08-25 13:06:02 至 2026-08-26 13:06:02（UTC+8）。以工作区 `tracked_items.md`、2026-08-26 大气科学 AI 日报和历史雷达日报去重。日期按一手来源的提交、正式上线或实质代码变更时间记录，不把索引抓取时间自动当成科学发布日期。

## 一、总体判断与信号地图

本期最重要的信号不是又出现了一个更高分的天气模型，而是两项相互呼应的可预报性诊断。Hassanzadeh 等发现，训练数据的时间和空间粗粒化会压低小尺度误差增长，使确定性 AI 天气模型在常见大尺度指标上更“准”，同时损害蝴蝶效应、反演不可逆性和概率真实性；Duc 与 Sawada 的受控孪生试验则表明，反向传播优化得到的月尺度技巧可以是真实的轨迹贴合，却不等于初始状态更接近真值，也不能据此延长大气本身的可预报极限。两者共同回答了“怎样保留可预报信息”的前半句：模型可以通过筛掉难预报尺度或沿模型流形寻找更易跟随的轨迹来延长评分技巧，但这并不自动增加真实状态信息。

精细结构恢复方面，本期出现三类互补证据：Prithvi WxC 条件扩散改善降水谱、分布和极端尾部，条件 WGAN 通过静态地形和频率分离改善加拿大风场降尺度，WaveOp-LiteFM 用 flow matching、傅里叶—局地—小波模块提升同刻 satellite-to-radar 重建。它们都说明高频结构需要显式建模，但只有前两者直接讨论预报/降尺度，WaveOp 是观测上游反演，不是未来雷达回波预测。概率表达方面，SCROLL 给出多任务异方差不确定性方法，`buitjes` 则把 20 成员集合的概率匹配均值、邻域降雨概率和观测覆盖掩膜落到产品层；前者仍是低维系统和单站 PM2.5 小样本，后者没有独立技能评估。

| 研究线 | 本期信号 | 判断 |
|---|---|---|
| `core-nowcasting` | WaveOp-LiteFM 做 FY-4B/SEVIR 的同刻 satellite-to-radar 生成反演；`buitjes` 改进集合表达 | 未发现新的、可完整核验的 0—3 h 雷达未来外推论文或独立技能结果；不能把同刻检索和产品聚合误报为临近预报 |
| `core-short-range` | CSTF 直接预测 0—6 h 区域 2 m 气温；加拿大条件 WGAN 完成 15 km→2.5 km 风场降尺度正式发表；重降水订正只有元数据 | CSTF 提供连续时效/分辨率查询思路，但测试是 ERA5→ERA5-Land、非业务 NWP；风场论文只用 +6—17 h 配对样本验证，尚未证明 48 h 之后的 10 d 延伸 |
| `core-s2s` | 优化初始条件的孪生试验解释了约一个月技巧；“Missing Butterfly”解释粗粒化为何能延长确定性技巧 | 形成高价值机制证据，但仍缺真实分析场、多模式共同样本、异常/概率技巧和 1—65 d 业务验证；不能把轨迹 shadowing 当作状态可预报性 |
| `core-air-quality` | SCROLL 在北京 PM2.5 24 h 单序列上做异方差多任务不确定性 | 没有新的直接全球/区域 AQ 预报、CAMS/MLWP 驱动或气象误差传播结果；SCROLL 仅作 `adjacent-method`，不升级为 AQ 核心技能 |

## 二、新增条目表

### 2.1 主窗口与连续增量

| 标题/对象 | 日期 | 研究主线 | 相关性分类 | 来源/平台 | 正式状态 | 链接 | 代码/数据状态 |
|---|---:|---|---|---|---|---|---|
| *Missing the Butterfly and Predicting the Past: Features or Bugs of Accurate AI Weather Models?* | 2026-08-26 22:14 +08 | AI 天气模型可预报性、误差增长和物理真实性 | adjacent-method | arXiv | arXiv `2608.25835v1`；预印本，暂无期刊信息；CC BY 4.0 | [论文](https://arxiv.org/abs/2608.25835v1) | ERA5、PlaSim、Pangu-Weather 等基础资源公开；本文训练模型和推理数据只承诺“发表后提供”，当前无冻结代码/权重包 |
| *Optimised initial conditions from machine-learning weather models: extended forecast skill is shadowing, not predictability* | 2026-08-27 03:52 +08（Crossref 创建） | 约一个月 AI 天气技巧与初始状态可预报性 | core-s2s | ESS Open Archive / Crossref | ESSOAr v1 预印本，DOI `10.22541/essoar.15007917/v1`；无正式期刊信息 | [DOI](https://doi.org/10.22541/essoar.15007917/v1) | 官方摘要可核验；全文端点在本次环境返回 403，未核实代码、权重、试验配置和许可，图件不镜像 |
| *Learning Continuous Regional Temperature Fields with Lead-Time and Resolution Queries* | 2026-08-26 22:04 +08 | 0—6 h 区域近地面气温预测 | core-short-range | arXiv | arXiv `2608.25823v1`；预印本，暂无期刊信息；arXiv 非独占分发许可 | [论文](https://arxiv.org/abs/2608.25823v1) | ERA5/ERA5-Land 可申请访问；未发现代码、权重、冻结日期清单或独立复现，图件不镜像 |
| *Precipitation Downscaling Using Foundation Model-Conditioned Diffusion* | 2026-08-26 22:30 +08 | 日降水生成式降尺度、谱与极端 | adjacent-method | arXiv | arXiv `2608.25858v1`；预印本，暂无期刊信息；CC BY 4.0 | [论文](https://arxiv.org/abs/2608.25858v1) | ERA5、ERA5-Land 和 Prithvi WxC 基础资源可用；本文代码、权重、训练配置和预测样本未公开 |
| *WaveOp-LiteFM: Lightweight Neural-Operator Flow Matching for Satellite-to-Radar Precipitation Retrieval* | 2026-08-26 22:01 +08 | satellite-to-radar 同刻反演 | adjacent-method | arXiv | arXiv `2608.25818v1`；预印本，暂无期刊信息；arXiv 非独占分发许可 | [论文](https://arxiv.org/abs/2608.25818v1) | SEVIR 可公开申请；东南中国配对数据、划分、代码和权重未发布，图件复用权不足 |
| *Forecasting Multiple Observables with SCROLL: Score-Trained Uncertainty for Stochastic Dynamics* | 2026-08-26 23:18 +08 | 多任务异方差概率预测 | adjacent-method | arXiv | arXiv `2608.25898v1`；预印本，暂无期刊信息；CC BY 4.0 | [论文](https://arxiv.org/abs/2608.25898v1) | 使用合成 SDE 与北京 PM2.5 序列；论文未给公共代码、冻结处理脚本或可复现实验包 |
| *Tropospheric temperature and humidity profile retrieval from Meteosat Flexible Combined Imager based on deep learning* | 2026-08-26 20:16 +08 | FCI 温湿廓线同刻反演 | infrastructure | arXiv | arXiv `2608.25700v1`；预印本，暂无期刊信息；CC BY-NC-ND 4.0 | [论文](https://arxiv.org/abs/2608.25700v1) | FCI、CERRA、ERA5 和 IGRA 来源公开；训练代码、权重和处理后配对集未发布，NC-ND 不镜像图件 |
| *Enhancing operational wind downscaling capabilities over Canada: Application of a Conditional Wasserstein GAN methodology* | 2026-08-26（正式上线） | 加拿大业务 NWP 风场降尺度 | adjacent-method | AMS / *Artificial Intelligence for the Earth Systems* | 正式期刊文章，DOI `10.1175/AIES-D-25-0022.1`；科学内容早期版本为 arXiv `2412.06958` | [DOI](https://doi.org/10.1175/AIES-D-25-0022.1) | 新模型基于公开 DoWnGAN 实现，但未发现新模型代码、权重、冻结 GDPS/HRDPS 配对清单或独立复现 |
| *“What is a realistic forecast?” Assessing data-driven weather forecasts, a journey from verification to falsification* | 2026-08-26（正式上线） | AI 天气验证、诊断与物理否证 | infrastructure | IOP / *Environmental Research Communications* | 正式期刊文章，DOI `10.1088/2515-7620/ae9f1f`；CC BY 4.0；早期版本为 arXiv `2602.00622` | [DOI](https://doi.org/10.1088/2515-7620/ae9f1f) | 概念/评估框架论文，无新数据集、模型或代码；正式状态为本期变化 |
| `MennoJ97/buitjes` 概率匹配均值与邻域概率 | 2026-08-27 02:12—02:15 +08 | KNMI 雷达—集合产品表达 | infrastructure | GitHub / KNMI | MIT 仓库实质更新；无论文、release 或独立技能评估 | [仓库](https://github.com/MennoJ97/buitjes) · [PMM 提交](https://github.com/MennoJ97/buitjes/commit/5712785f3b24) · [邻域概率提交](https://github.com/MennoJ97/buitjes/commit/503a42133c57) | 公开代码消费 KNMI 20 成员集合；新增概率匹配均值、10 km 默认邻域概率和雷达无覆盖掩膜，未给可靠度/CRPS/FSS 验证 |
| `Kea1b0Om/radar-nowcasting` 的 FlowCast 扩展 | 2026-08-26 13:30—13:44 +08 | flow matching 雷达临近预报代码基础 | infrastructure | GitHub | Apache-2.0 衍生仓库；单次大提交 `4250d37462b9`；无新论文、release 或独立结果 | [仓库](https://github.com/Kea1b0Om/radar-nowcasting) · [提交](https://github.com/Kea1b0Om/radar-nowcasting/commit/4250d37462b9) | 增加 STDiT 去噪器、分块自回归采样、UOT/分位加权目标、三套数据加载和评估工具；无权重、结果表或冻结环境 |
| *A transformer-based post-processing framework with a band-wise differentiable threat score loss for regional heavy-precipitation bias correction* | 2026-08-26（正式上线） | 区域强降水订正 | metadata-only | Springer / *Journal of Earth System Science* | 正式期刊文章元数据，DOI `10.1007/s12040-026-02919-9`；复用许可未核实 | [DOI](https://doi.org/10.1007/s12040-026-02919-9) | 官方页面在本次环境触发安全页，Crossref 无摘要；数据、时效、指标、代码、权重和图件许可均未核实 |

### 2.2 24—48 小时缓冲窗口

缓冲窗口没有恢复新的未跟踪高价值条目。arXiv 检出的 AICON `2608.24651v1` 和云掩膜超分辨率 `2608.24715v1` 已在 2026-08-26 日报和 `tracked_items.md` 中登记；本期不重复列入新增。没有用旧论文、普通目录刷新或机构泛新闻填补缓冲窗口。

## 三、四条核心研究线

### 3.1 `core-nowcasting`：直接未来外推空缺，上游反演和集合表达各有新增

**WaveOp-LiteFM 的任务边界。** Shi 等用条件 flow matching 学习同一时刻的卫星观测到雷达型降水场映射。东南中国试验以 FY-4B 6.9/10.7 μm 红外通道为条件，目标是 500×500 网格、0—70 dBZ 的反射率型场；SEVIR 试验使用 VIS、两路红外和闪电，目标是 128×128 的 VIL。模型在像素空间积分条件概率流，核心块把傅里叶全局分量、深度可分离局地卷积和 Haar 小波高频分量门控融合。它不接收历史雷达序列，也没有未来有效时刻，因此不是 0—3 h 雷达外推，更不是一般中长期 AI 天气模型。

**训练与作者结果。** 作者使用 AdamW、学习率 `2×10^-4`、20 步 Euler 采样和 200,000 个训练步，在相同 flow-matching 目标/采样器下与轻量 U-Net 比较。WaveOp-LiteFM 为 2.61 M 参数，对照为 5.54 M；作者报告东南中国 MAE 2.725、SSIM 0.578、35 dBZ CSI 0.146，对照分别为 3.010、0.555、0.094；SEVIR MAE 11.985、219 阈值 CSI 0.151，对照为 12.342 和 0.133。作者给出的 FLOPs 约低 6.7 倍。中国尺度的台风案例只是分块推理定性图，不能当作独立技能；论文未给随机种子离散度、置信区间、代码/权重或东南中国样本许可，跨方法表中的旧基线也没有全部共同复现。

**`buitjes` 的实质变化。** 前一日仓库已保留 KNMI 20 成员、5 min 步长、至 +6 h 的实况/外推/模式分段。本期代码把地图主场从逐像素中位数改为 probability-matched mean：先保留集合均值的空间排序，再用全体成员的强度分布回填，作者在单个 72 步周期上报告相对集合均值保留 100% 总水量、湿区 8.09%、峰值 35.0 mm h⁻¹，而中位数只保留 76.2% 水量。另新增 10 km 默认邻域内“任一格点降雨”的成员比例，区分“落在地址上”的概率与“附近有阵雨”的位移不确定性；雷达观测范围外和缺测洞不再编码为 0 mm h⁻¹。它是产品层的不确定性/缺测语义改进，仍需多事件、分时效的可靠度、CRPS、FSS 和阈值效用验证，不能把一次周期的水量统计当作业务技巧。

### 3.2 `core-short-range`：连续查询有价值，但“任意分辨率”和业务泛化尚未被证明

**CSTF 的科学任务。** Shi 等输入连续三个时刻的 9 个 ERA5 场：2 m 气温、2 m 露点、10 m 风、海平面气压、对流/大尺度降水、总云量和地表短波辐射，预测未来六个逐小时 ERA5-Land 2 m 气温场。研究域为中国东南部 100°—120°E、20°—40°N，基准网格为 128×128；样本来自 2024—2025 年，训练/验证/测试分别为 4,615/511/714 个序列。模型先编码时空状态，再由坐标解码器按经纬度、预报时效和目标分辨率查询；损失同时约束像素 MSE、空间梯度、时间差分和尺度一致性。

**结果与限制。** 训练 50 个 epoch、batch 8、AdamW、学习率 `10^-3`，作者固定随机种子 42 并按验证损失选模。ARROW 在 +1、+2 h 略优，CSTF 在 +3—+6 h 最优；六时效聚合 RMSE 1.123 °C、MAE 0.811 °C、偏差 0.273 °C、相关 0.993，对照 ARROW 为 1.203、0.838、0.389、0.992。论文展示 +0.5 h、+4.5 h 和不同分辨率结果，但这些没有对应参照真值，只能证明解码器能生成连续查询和保持内部一致性，不能证明非整时或超出参考网格的真实新增分辨率。测试还是再分析到再分析，不含业务起报延迟、NWP 模式误差、降水/强对流目标或跨年份极端，因此列 `core-short-range` 但证据等级低于业务 NWP 后处理。

**加拿大风场的正式状态变化。** Guevara 等把 ECCC 的 15 km GDPS 低分辨率预报降到 2.5 km HRDPS 网格，目标是 10 m 风分量。条件 WGAN-GP 使用 U-Net 生成器，除 7 个 GDPS 动态预测量外加入 HRDPS 高分辨率地形、陆海掩膜和粗糙度，并用频率分离让对抗项集中到高频残差。训练样本为 2022-07 至 2023-06 的 GDPS/HRDPS 同时效配对，7,150 个训练文件、1,178 个验证文件；独立测试为 2023 年 7/8 月和 2024 年 1/2 月，共 2,678 个文件。每个起报只取 +6—17 h，避开 spin-up 和更长时效分歧。

作者在全加拿大除北极群岛的 2540×1280 网格上随机裁 128×128 patch，训练 65,250 步。频率分离 5×5 滤波给出最低中位 RMSE，u/v 分量为 0.959/0.981 m s⁻¹；13×13 和 9×9 滤波分别给出较低的 u/v 对数谱距离。与 DownGAN 相比，RMSE 和谱距离均改善。关键限制是所有配对只覆盖 +6—17 h，论文“把 2.5 km 风预报延伸到 GDPS 的 10 d 窗口”目前是方法潜力，不是 48 h 之后的直接验证结论；模型也未公开权重、代码、冻结配对和站点/极端风检验。

**重降水订正元数据。** Springer/Crossref 已确认 Li、Wang、Xue 的正式文章、期刊和 DOI，题名显示 Transformer 与分带可微 threat score 用于区域强降水偏差订正。但官方可访问记录没有摘要，PDF 端点返回安全页；不能确认模式来源、起报和有效时刻、分带阈值、共同样本、极端雨量效果或独立测试。因此保留 `metadata-only`，不凭题名升级为核心技能。

### 3.3 `core-s2s`：技巧延伸不等于状态信息或大气可预报性延伸

**受控初始条件孪生试验。** Duc 与 Sawada 针对“对 ML 天气模型初始状态反向传播优化后，确定性预报约一个月仍有技巧”的解释做受控检验。真实分析场无法提供已知真值，因此作者用可微原始方程模型生成真值，再用其训练神经模拟器，让同一优化分别穿过真实动力和模拟器。官方摘要报告，优化确实恢复了一部分真实初始误差，模拟器路径甚至恢复更多；但增量还包含很大的“改善后续轨迹拟合、却不修正初始状态”分量，使优化后的初始场整体并不比背景场更接近真值。

优化窗口越长，这个非状态修正分量越大：短窗口更像状态估计，长窗口反而给出更差的状态；预报技巧对窗口长度近乎不敏感，也不需要那部分退化的初始条件。技术上，这说明一个月技巧可以是真实的模型轨迹 shadowing，却不能当作“分析遗漏了可恢复的大气信息”或“可预报极限被推迟”的证据。当前只能核验 ESSOAr/Crossref 摘要，全文在本次环境不可访问，模型方程、窗口、指标、代码和复用许可仍待补齐；因此把它作为 `core-s2s` 的高相关机制信号，而不是业务性能结论。

**粗粒化与 Missing Butterfly。** Hassanzadeh 等建立 ERA5、PlaSim GCM 和两尺度 Lorenz-96 层级，同时训练前向和反向模型，并比较 Transformer、SFNO、条件扩散和官方 Pangu-Weather。ERA5 模型使用 1° 分辨率，训练 1979—2018、验证 2019、测试 2020—2021 月度初始条件；每个初始条件使用 16 个 Perlin 扰动成员。作者报告 ERA5 Z500 的反向预测技巧约 6.5 d，前向技巧约 9.1 d；AI 模型没有显示物理模式中随扰动振幅而变、从小尺度向大尺度传播的 DKE 增长。

Lorenz-96 试验把大尺度变量、快变量和时间采样逐步补回。只用大尺度、稀疏时间间隔时，模型获得较长的大尺度技巧、可反向预测且缺失蝴蝶效应；加入快变量和更细时间步后，振幅依赖的“蝶形”增长恢复，但大尺度技巧下降。作者估计粗粒模型的大尺度最大有限时间 Lyapunov 指数约比真值/完整数据模型小 8 倍。官方 Pangu-Weather 的 24/6/3/1 h 独立网络也呈现相同方向：时间步从 24 h 缩到 1 h，ACC>0.6 的技巧从约 9.3 d 降至 2.0 d，而小扰动增长更接近蝶形；1 h 网络还出现高纬伪影和小尺度方差过冲。

技术判断不是“粗数据好”或“更多尺度坏”，而是常用确定性损失会把不可预报小尺度的过滤转化成大尺度评分优势。这种优势对确定性业务可能有用，却会扭曲误差增长、反向不可逆性、集合离散度和长期气候统计。S2S 模型应明确区分绝对场与异常、初始化信息与模型流形约束，并用扰动振幅—误差增长、谱、spread-skill、概率校准和物理否证共同判断。

<figure class="paper-figure">
  <a href="https://arxiv.org/html/2608.25835v1#S2.F3" target="_blank" rel="noreferrer">
    <img src="/assets/paper-figures/2026-08-27/missing-butterfly/figure-3.svg" alt="Missing the Butterfly Figure 3：不同训练数据粗粒化下 Lorenz-96 AI 模型的集合 DKE 增长" loading="lazy">
  </a>
  <figcaption>
    <strong>论文 Figure 3｜训练数据粗粒化如何改变 Lorenz-96 AI 模型的集合增长。</strong>
    原始图注：Effects of training-data coarse-graining on ensemble growth and the butterfly effect in AI models of Lorenz 96. Curves show DKE of the large-scale variable, Xi (i = 1 ... 8) for 12 independent, separate AI models that have an identical architecture (including the same MSE loss) trained on (A) only the large-scale Xi and (B) on both scales (Xi and Yi,j (j = 1 ... 32)) with time interval Δt = 10δt, 5δt, and 1δt (δt is the time step of the numerical solver). Gray curves show forecasts and backcasts from numerical integrations of the two-scale Lorenz 96 equations (S7)–(S8); crosses mark numerical blow-up in backcasts. Curves are averaged over the same 100 initial conditions from the test set. Perturbations are of different amplitudes, decreasing from a reference value, ε0. See Methods and Data for details about the perturbations and metrics. 来源：Pedram Hassanzadeh 等，<a href="https://arxiv.org/html/2608.25835v1#S2.F3">arXiv:2608.25835v1 Figure 3</a>。许可：<a href="https://creativecommons.org/licenses/by/4.0/">CC BY 4.0</a>。本站逐字节复制 arXiv HTML 原生 SVG，没有裁剪、重绘、改色或添加结论。Figure 4 因图注明确含来自参考文献 [19] 的 ICON 曲线而未镜像。完整来源、许可、第三方材料核验和 SHA-256 见同目录 <code>metadata.json</code>。
  </figcaption>
</figure>

### 3.4 `core-air-quality`：没有新的直接气象驱动预报，SCROLL 只提供不确定性方法线索

SCROLL-MT 在同一个共享骨干上为未来状态、阈值事件和等级标签保留各自的似然与高斯末层 belief，用每个任务的预测对数分数直接组成目标，避免外层任务权重网格；其方差可以随输入变化。受控试验包括解析可得转移核的 Ornstein–Uhlenbeck、可用 Monte Carlo 得到条件方差的随机 Lorenz-63，以及北京 PM2.5 真实序列。真实序列用 24 h 时效，按时间划分并做五个滚动起点；10 个随机种子和相同宽度 50 的候选骨干用于比较固定/网格权重、Kendall 权重、异方差 MLE、Laplace 和 5 成员深度集合。

作者报告 PM2.5 状态 NLL：SCROLL-MT Diag 为 1.250，固定权重 MAP 为 1.312，异方差 MLE 为 3.011；5 成员 SCROLL 为 1.243。五个滚动起点上，联合模型的点估计方向均较好但不足以解决显著性。这个试验只使用一个小型历史污染序列，任务冲突较弱，没有未来气象驱动、CAMS/化学输送模式、跨站/跨城、沙尘阈值或浓度单位层面的业务评估，因此不属于 `core-air-quality`。可借鉴点是让状态、超阈概率和等级概率各用匹配的似然，并把输入相关方差与深度集合区分；剩余问题是高维空间场、跨时效联合相关和概率校准。

## 四、相关方法与基础设施

### 4.1 Prithvi WxC 条件扩散：高频和尾部改善与像素平均分数并不一致

Nascimento Ribeiro 等在科罗拉多河流域做逐日降水降尺度，目标为 0.1° ERA5-Land，条件是把 0.25° ERA5 再粗化到 1° 的大尺度场。动态预测量含 500/700/850 hPa 的比湿、温度、风、垂直速度和位势，以及 CAPE、地面气压、短波辐射、2 m 气温和 10 m 风；静态量含气候、陆海掩膜、地形起伏和位势。模型不把粗分辨率降水作为条件，比较无条件扩散、通道拼接、学习卷积编码器的 cross-attention，以及冻结 Prithvi WxC 编码器的 cross-attention。

训练/验证/测试按时间分为 1985—2009、2010—2012、2013—2015；每个测试日生成 5 成员，20 步采样。指标覆盖像素和区域聚合 CRPS/MSE/偏差、直方图分布、rank histogram、径向平均功率谱、FSS、年最大值和极端事件频率。通道拼接的原始 CRPS/MSE 最低，为 0.511/4.282，但场更平滑；Prithvi 条件模型 CRPS 0.557，却有最低的时间平均绝对偏差 0.095 mm d⁻¹、分布偏差 0.065 和较好的谱 CRPS 2.598。100—200 mm d⁻¹ 的极端像素事件中，Prithvi 模型恢复比例超过 50%，卷积 cross-attention 约 17%，通道拼接近零；但参照只有 263 个像素事件和 3 个测试年，尾部结论仍不稳定。

这项工作说明“更好地恢复分布/谱/极端”和“更低像素 CRPS/MSE”可以分离。冻结基础模型未必改善所有平均分数，却可能提供更有用的多尺度条件表示。它不是未来天气预报，条件来自 ERA5、目标来自 ERA5-Land，也没有检验 GCM/真实预报偏差如何传播；下一步必须换成真正模式预报或不同动力模式，做年代外、区域外和成员校准验证。

<figure class="paper-figure">
  <a href="https://arxiv.org/html/2608.25858v1#S3.F3" target="_blank" rel="noreferrer">
    <img src="/assets/paper-figures/2026-08-27/foundation-diffusion-downscaling/figure-3.png" alt="Precipitation Downscaling Figure 3：冻结 Prithvi WxC 编码器经 cross-attention 条件化扩散 UNet" loading="lazy">
  </a>
  <figcaption>
    <strong>论文 Figure 3｜Prithvi WxC 条件编码器接入扩散 UNet。</strong>
    原始图注：Modifications for the integration of the Prithvi WxC weather foundation model as a conditioning encoder within the diffusion framework. A lightweight convolutional preprocessing stage maps the coarse-resolution ERA5 predictor stack to the input format expected by the Prithvi WxC encoder. The frozen foundation model encoder produces high-dimensional spatiotemporal embeddings, which are subsequently projected to a compact feature map via convolutional post-processing layers and injected into the diffusion UNet via cross-attention. 来源：Victor Nascimento Ribeiro 等，<a href="https://arxiv.org/html/2608.25858v1#S3.F3">arXiv:2608.25858v1 Figure 3</a>。许可：<a href="https://creativecommons.org/licenses/by/4.0/">CC BY 4.0</a>。本站逐字节复制 arXiv HTML 原生 PNG，没有裁剪、缩放、重绘、改色或添加结论。完整来源、许可、修改记录和 SHA-256 见同目录 <code>metadata.json</code>。
  </figcaption>
</figure>

### 4.2 FCI 温湿廓线：去掉 NWP 背景能增加独立性，但不是天气预报

Salgueiro 等用 MTG-FCI 全部 16 个通道和 10 个辅助量，在欧洲检索 1000—300 hPa 的 15 层温度、比湿/相对湿度。目标是 5.5 km CERRA 分析及 +1/+2 h 短预报拼成的逐小时场；IGRA V2.2 探空只用于独立评估，不参与训练。主模型是带 SE 通道注意力和多尺度瓶颈的 Residual U-Net，输入 128×128×26 patch，另设逐像素 1×1-Net 和只含辅助量的基线，以区分空间上下文、辐射和位置气候态贡献。

14 个月数据采用滚动 21 d 训练、3.5 d 验证、7 d 测试、3.5 d 验证的块结构，得到 252 个训练日和约 81 个测试日，主测试有 11,840 条探空；2025-12-01 至 2026-02-28 的第二测试与训练隔 7 d，有 12,419 条探空。作者报告温度偏差低于 0.4 K、标准差 1.5—1.9 K，相对湿度标准差 12%—20%；云下退化小于 0.4 K 和 3 个百分点 RH。输入还包含经纬度、时刻、年内日、地形和 CERRA 地面气压，模型不打算跨训练域使用，因此部分技巧可能来自位置气候态。它适合做 nowcasting/资料同化的上游观测基础，但需要信息含量、观测误差相关、同化影响和跨域测试；公开的只是原始数据来源，代码、权重和处理后的配对集未发布。

### 4.3 “验证—诊断—否证”三层框架：把物理真实性从平均分数中分离

Ben-Bouallègue 将真实性分为三层：功能真实性对应每个实例的预报—观测距离和一致评分函数；结构真实性对应长期分布、方差、谱、尾部和依赖结构；物理真实性对应每个预报实例是否违反已知约束、平衡、守恒或可控动力响应。概率预报中，可靠度改善通常可通过适当评分规则同步改善功能真实性；单个确定性场则存在 accuracy—activity 权衡，方差/小尺度活动更接近观测可能反而使均方误差变差。

正式文章建议把 falsification 作为验证和诊断的补充：先检查负降水等硬约束和变量间 no-go 区域，再检查动力/热力平衡，最后在可运行模型上做受控扰动、超长积分和泛化压力测试。它没有新模型或数据，但为本期“Missing Butterfly”和生成式降尺度提供统一验收框架：像素分数、统计结构和物理可行性应分别报告，不能用一个指标替代另两个。

### 4.4 FlowCast 衍生仓库：代码改动实质存在，科学结论尚未建立

`Kea1b0Om/radar-nowcasting` 在 FlowCast 代码上增加 STDiT 型去噪器、分块自回归采样、unbalanced optimal transport 和 quantile-weighted 训练目标，并加入 CIKM2017、Shanghai2020、MeteoNet 数据加载、校准/评估工具和测试。仓库使用 Apache-2.0，绝对集群路径已改成环境变量；上游 SEVIR 可获取，ARSO 仍不公开。

这是可运行基础设施的潜在扩展，不是新的论文结论。当前没有训练权重、数据版本哈希、环境锁、结果表、共同样本或与原 FlowCast 的消融，且仓库不是上游项目的官方 release。后续只有在公开权重、冻结数据划分和概率/极端/谱结果后，才应升级为 `core-nowcasting` 或 `adjacent-method` 科学事件。

## 五、机构信号、仅元数据、窗口外与排除项

### 5.1 机构信号

ECMWF、NOAA、Met Office、CMA、WMO、Copernicus/CAMS、Google DeepMind 和主要实验室的主窗口官方检索没有发现新的模型上线、权重、业务验证或数据版本，足以改变现有跟踪状态。检索返回的 ECMWF HourGlass（2026-08-20）、Met Office 公众信任研究（2026-08-20）和 Google DeepMind WeatherNext（2026-08-06）均早于连续窗口，本期不作为新增机构信号。正式发表的 AMS 风场降尺度和 IOP 真实性框架已按论文状态变化单列，不重复记为机构新闻。

### 5.2 仅元数据候选

| 对象 | 已核实状态 | 暂不升级原因 | 下一触发器 |
|---|---|---|---|
| *A transformer-based post-processing framework with a band-wise differentiable threat score loss for regional heavy-precipitation bias correction*，DOI `10.1007/s12040-026-02919-9` | *Journal of Earth System Science* 正式期刊文章；Crossref 创建和出版日期均为 2026-08-26 | 无可访问摘要/全文；无法核实模式、时效、雨量阈值、划分、共同样本、作者指标、代码/权重和复用许可 | 官方摘要或全文；起报—有效时刻合同；极端阈值 CSI/FSS/可靠度；跨区域/年份；代码、权重、数据与许可 |

### 5.3 窗口外、例行变化与低价值排除

| 对象 | 分类 | 处理 |
|---|---|---|
| *Planetary Prediction Engine*，arXiv `2608.26088v1` | low-value-exclusion | 自动化广义地理空间预测框架，缺少明确天气/降水/AQ 预报合同、气象基线和业务证据；不因“planetary”题名纳入 |
| `FrancescoCastaldi/hailcast-ml` | low-value-exclusion | 主窗口提交只是自动更新雷达/对流快照；README 混合传统 SHI/MESH/POH、决策树和演示模式，无冻结真实标签、事件隔离、独立技能或标准 LICENSE 文件 |
| `ilianrvd/nowcasting-public` | low-value-exclusion | 多次提交只替换最新地图和 `meta.json` 时间；没有模型逻辑、权重、数据或验证变化 |
| `uba/tathu` | infrastructure，未触发升级 | 新增 747 行 graph-based 示例并修复 UUID；属于对流系统跟踪工具扩展，不含未来预报模型、技能表或版本发布，本期不单列科学新增 |
| `matko-iv/vrijeme` 及普通 AQ 个人仓库 | low-value-exclusion | 主窗口多为自动刷新预报 JSON、单城课程/个人管线或网页应用，没有论文、冻结评估、独立业务比较和可复核科学版本 |
| OpenReview | 检索限制 | 官方 API 本次返回 403；网页检索未发现可由正式页面确认的主窗口气象新条目，不用聚合器替代状态来源 |
| OpenAlex / Semantic Scholar | 检索限制 | OpenAlex 对 2026-08-26—27 关键词返回空；Semantic Scholar 广泛检索返回 429。保留条目均回到 arXiv、Crossref、出版商或 GitHub 一手来源核验 |
| 24—48 h 缓冲条目 | 已去重 | AICON 和云掩膜超分辨率已在上一期跟踪；没有新的 `window-out` 高价值状态 |

## 六、对当前研究的具体启发

1. **把“信息”拆成状态信息、轨迹可跟随性和评分技巧。** 优化初始条件或压制小尺度都可能延长 ACC/RMSE 技巧，却未必让初始状态更接近真值。S2S 试验应同时比较背景/优化场到已知参照的距离、后续轨迹误差和异常技巧，并在理想化孪生与真实分析中分层解释。
2. **可预报尺度与不可预报尺度应分工，而不是混在同一个 MSE。** 大尺度动力锚负责保留可预报异常，小尺度生成模块负责条件分布恢复；模型选择要同时看像素/异常分数、功率谱、对象、极端尾部、spread-skill 和物理否证。
3. **粗粒化是可控设计变量，不只是数据缺陷。** 时间步、空间网格、变量裁剪和 rollout 长度都在改变模型看到的 Lyapunov 结构。应做系统消融，报告它们如何同时影响确定性技巧、扰动增长、反向预测、气候漂移和集合校准。
4. **“任意分辨率输出”必须有独立参照。** CSTF 的连续坐标/时效解码值得借鉴，但无真值的 0.5 h 或更细网格只能叫插值/一致性演示。降尺度必须在原本未见的高分辨率参照、独立年份和极端事件上验证。
5. **高频恢复要区分结构真实性与降水量守恒。** Prithvi 条件扩散、频率分离 WGAN 和 `buitjes` 的概率匹配均值都显示谱、尾部、湿区和总量可能彼此冲突。建议在统一表中报告 CRPS/MSE、RAPSD/RALSD、FSS、事件频率、总量偏差和空间位移。
6. **邻域概率比逐像素概率更适合位移不确定性。** `buitjes` 的 `probability_nearby` 可迁移到雷达集合：逐像素事件概率回答“落在此格”，邻域概率回答“附近发生”，两者应并列并按邻域半径、时效和阈值校准。
7. **AQ 不确定性方法必须回到真实气象驱动。** SCROLL 可作为多任务似然/异方差头的候选，但核心 AQ 试验仍要比较分析场与真实预报驱动、CAMS/MLWP 模式差异、沙尘阈值、跨站空间相关和浓度单位下的覆盖—宽度权衡。
8. **把物理否证纳入发布门禁。** 每个模型除了平均分数，还应有硬约束、变量间一致性、平衡/守恒、受控扰动、超长积分和失败案例档案；这比只在图上挑选“看起来锐利”的样例更能防止生成式幻觉。

## 七、后续跟进触发器

- Missing Butterfly：公开训练代码、模型、推理数据与固定 Pangu/ERA5/PlaSim 配置；独立复核不同 GPU 精度、扰动结构、谱饱和和概率校准。
- ESSOAr 初始条件优化：全文/代码可访问；明确原始方程模型、神经模拟器、优化窗口、状态距离与轨迹距离；在真实再分析和多模型共同样本上验证 shadowing 解释。
- CSTF：公开代码/权重和精确日期划分；用真正业务 NWP 起报、独立高分辨率参照、跨年极端和非整时真值检验连续查询。
- Prithvi 条件扩散：公开模型包；把 ERA5 条件换成不同 GCM/NWP 真预报，扩展多流域/年代外测试并增加成员可靠度、谱和水量联合验收。
- WaveOp-LiteFM：公开东南中国配对数据许可、事件隔离、代码/权重和随机种子；增加跨卫星/跨雷达、真实未来外推下游影响和不确定性校准。
- 加拿大风场降尺度：公开新模型实现、权重和冻结 GDPS/HRDPS 对；直接检验 +48 h—10 d、站点风、山地/沿海、极端分位和集合离散度。
- SCROLL：扩展到多站/格点 PM2.5 与气象协变量，比较 CAMS/分析场/真实预报驱动，并验证跨时效和空间联合概率。
- `buitjes`：冻结 release 和输入产品版本；按事件/lead 报告逐像素与邻域概率的可靠度、Brier/CRPS、FSS、阈值效用和雷达缺测敏感性。
- FlowCast 衍生仓库：公开环境锁、权重、数据哈希和与上游的共同样本消融；UOT、分位目标和 STDiT 只有在极端/校准/谱指标改善后才升级。
- 重降水 Transformer：官方全文确认起报、有效时刻、分带阈值、共同样本、极端效果与代码/权重；此前保持 `metadata-only`。
- 继承未变化高优先级触发器：AICON 专用权重/配置和谱—极端—概率验证；SNPNet 正文与 0—3 h 合同；ECMWF AI Weather Quest 2026 JJA 数据按官方计划发布后的公平多模式比较；上海 AQ 真时效与未来驱动；PCFNet 和 WRF–CMAQ 全文/代码。

## 八、检索覆盖、图件与证据边界

- 学术来源覆盖 arXiv 主窗口和缓冲窗口、Crossref 正式状态、OpenAlex、Semantic Scholar、OpenReview、AMS、IOP、Springer Nature，以及 GitHub 代码/提交。OpenReview 返回 403、Semantic Scholar 返回 429、OpenAlex 当天关键词为空，均在排除表中明示；没有用聚合器替代一手状态。
- 机构来源覆盖 ECMWF、NOAA、Met Office、CMA、WMO、Copernicus/CAMS 和 Google DeepMind。窗口内没有新的机构技术交付；较早新闻不重复收入。
- 已核验的主窗口代码仓库中，AD4DVAR、ERAD 课程、`globalnowcast`、exPreCast、LangPrecip、weather-rf、FMI-PPN 和 Météo-France DGMR 均无截止后新提交。`buitjes` 有概率/缺测语义实质变化；`Kea1b0Om/radar-nowcasting` 有一次大规模方法代码提交；自动地图/预报 JSON 刷新不算科学事件。
- 本期镜像两张代表图：Missing Butterfly Figure 3 和 Prithvi 条件扩散 Figure 3。两篇 arXiv v1 均明确 CC BY 4.0，具体图无单独第三方限制，原生 SVG/PNG 逐字节保存，metadata 记录作者、图号、完整图注、稳定来源、许可、修改和 SHA-256。
- 未镜像的图件边界：Missing Butterfly Figure 4 含来自参考文献 [19] 的 ICON 曲线；WaveOp-LiteFM 和 CSTF 只有 arXiv 非独占分发许可；FCI 论文为 CC BY-NC-ND；ESSOAr 全文/许可不可访问；重降水 Springer 复用权不明。开放获取、PDF 可下载和 arXiv 托管均未被当成自动转载授权。
- 所有数值均作为作者报告，且区分训练目标、作者验证、正式期刊状态、业务产品和独立复现。本期没有保留条目的独立复现；`buitjes` 的单周期水量数字也不作业务技能外推。

## 九、简短结论

本期形成了一条比“模型更锐利”更重要的证据链：确定性 AI 可以通过粗粒化和轨迹 shadowing 获得更长的评分技巧，但这可能同时丢失真实误差增长、初始状态信息和概率真实性；生成式/频率分离方法可以恢复谱、尾部和局地结构，却必须用真预报驱动、独立参照、校准和物理否证证明这些细节是受约束的，而不是幻觉。直接雷达 0—3 h 和气象驱动 AQ 没有新的完整核心技能证据。当前研究最值得落实的是把“动力/大尺度锚—条件生成细化—集合概率—物理否证”做成同一评估合同，并明确每个结果对应的起报、有效时刻、时效、参照、空间尺度和共同样本。
