# 2026-07-29 大气科学 AI 研究日报

> 生成时间：2026-07-29 14:53（北京时间，UTC+8）  
> 严格主窗口：2026-07-28 14:15—2026-07-29 14:15；补充缓冲窗口：2026-07-27 14:15—2026-07-28 14:15。  
> 去重基线：以工作区截至 2026-07-28 13:51 的大气科学 AI 日报、截至 2026-07-27 的历史雷达日报、`tracked_items.md` 与自动化记录为准。  
> 状态口径：论文实际发表日、预印本提交日、Crossref 建档时间、代码提交时间和网页核验时间分开记录；作者报告、仓库作者自测、官方业务材料和独立复现分开；“预测”一词不自动等同于具有明确起报时刻和预报时效的业务预报。

## 一、总体判断与信号地图

本轮严格主窗口保留 **8 个实质事件**，48 h 缓冲窗口单列 **2 个条目**。新增数量不算少，但真正贯穿“保留可预报信息—恢复精细结构—表达不确定性”的信号主要有四个：

1. **从雷达外推到 24 h 的尺度桥接已形成完整系统，但公平性和时间口径仍需拆开。** `ConvScaleCast` 用多雷达融合的 0—2 h 回波预报承接 ECMWF IFS 的 2—24 h 降水订正，作者报告在强降水和城市局地结构上优于原始 IFS。它接近用户的雷达—模式融合问题，但比较同时改变了观测密度、城市下垫面信息和后处理模型，不能把增益全部归为网络结构；正文中的事件年份、FSS 定义及降水—反射率阈值转换还存在需要澄清之处。
2. **存档评测通过不代表真实预报输入可用。** `globalnowcast` 在 HRRR 分析场驱动的存档测试中报告约 0.504/0.344/0.252 的 1/4/8 mm h⁻¹ CSI，均优于 HRRR；但最新 17 个真实输入案例中，训练好的 U-Net 在 1 mm h⁻¹ 上反而低于 HRRR，未通过上线门槛。仓库因此没有把模型投入网站，实际运行的是雷达平流与 HRRR 的时效依赖混合。这一负结果比此前的正向存档分数更有研究价值：**训练驱动与真实预报驱动之间的域差必须进入主实验设计。**
3. **空气质量不确定性开始被显式报告，但“可校准区间”与“真实预报”仍不是同一件事。** Visakhapatnam 单站研究用时间顺序拆分、SHAP 和 conformal prediction 报告 PM₂.₅ 误差与覆盖率；聚合测试集表现较好，但高污染等级样本少且分层 `R²` 为负。更关键的是，目标时刻的气象与共污染物是否在起报时可得没有被业务化定义，因此当前更接近时间对齐估计/一步预测，而不是经真实气象预报驱动的 PM₂.₅ 预报。
4. **精细结构恢复需要与空间外推审计绑定。** Solafune 仓库把总量与空间分布因子化，并加入位置聚类 bootstrap、外层交叉拟合和 GO/HOLD/NO-GO 门槛；但先前通过训练侧诊断的方案在公开区域上仍退化。SSRN 地形降尺度论文也显示随机划分可把技能夸大约 27%。两者共同说明，空间重建或降尺度不能只靠随机样本和平均 RMSE 证明跨区域泛化。

| 研究线 | 严格主窗口信号 | 48 h 缓冲信号 | 本轮判断 |
|---|---:|---:|---|
| `core-nowcasting` | 1 篇 0—24 h 混合系统论文中的 0—2 h 多雷达模块；1 个真实上线失败/替代混合方案 | 1 篇上游多雷达衰减订正预印本 | 没有新的独立 0—3 h 概率集合论文；最强证据来自输入域差和尺度衔接 |
| `core-short-range` | 1 篇正式 AI 融合论文；1 篇区域集合业务评估；1 个仓库实测状态变化 | 0 | 雷达—NWP 融合值得推进，但必须区分 HRRR/IFS 分析、预报与观测有效时刻 |
| `core-s2s` | 0 | 0 | 未发现 1—65 d AI/S2S 新论文、代码、权重、数据或定量业务验证 |
| `core-air-quality` | 1 篇正式 PM₂.₅ 论文 | 1 个标题级 IEEE 记录 | 有不确定性量化，但没有 CAMS/MLWP 等真实预报气象驱动；极端污染技能仍弱 |
| 横向方法与基础设施 | 1 篇生成式空气质量重建预印本；1 篇空间降尺度预印本；2 个代码更新；1 篇集合评估 | 1 篇雷达质控预印本；1 个 `metadata-only` | 空间外推、坐标元数据和分析—预报域差比单一排行榜更值得跟进 |

## 二、新增条目表

| 标题 | 日期（北京时间） | 研究主线 | 相关性分类 | 来源/平台 | 正式状态 | 链接 | 代码/数据状态 |
|---|---:|---|---|---|---|---|---|
| *ConvScaleCast: a physics-informed scale-bridging framework for 0–24 h urban convective precipitation forecasting* | 2026-07-28 15:39（Crossref 建档；同日正式在线） | `core-short-range`，包含 `core-nowcasting` 模块 | `core-short-range` | Nature Portfolio，*npj Natural Hazards* | 正式在线发表，当前页面标为未编辑早期版本 | [论文 DOI](https://doi.org/10.1038/s44304-026-00249-w) | 论文称录用后发布代码，但截至本轮未找到仓库、权重或许可证；雷达与内部预报输出按请求提供 |
| *A robust and uncertainty-aware machine learning framework for PM2.5 prediction in a coastal urban Indian environment* | 2026-07-28 21:16（Crossref 建档；同日正式在线） | `core-air-quality` | `core-air-quality` | *Sustainable Environment Research* | 正式在线，当前为已接受、未编辑版本 | [论文 DOI](https://doi.org/10.1186/s42834-026-00296-y) | 数据按请求提供；未找到官方代码或权重；文章 CC BY 4.0 |
| *From Deterministic to Generative Deep Learning for Urban Air Quality Reconstruction from Sparse Observations* | 2026-07-28 21:03（arXiv v1 提交） | 连接 `core-air-quality` | `adjacent-method` | arXiv | arXiv 预印本，暂无期刊信息 | [arXiv](https://arxiv.org/abs/2607.25687)；[GitHub](https://github.com/Miha5092/Air-Quality-Field-Reconstruction) | 代码、配置和 notebook 公开；无仓库 LICENSE/release/tag；论文所列 Hugging Face 数据集本轮未能公开访问，许可未核实 |
| `andrewnakas/globalnowcast`：存档 U-Net 未通过真实 HRRR 预报输入门槛，线上改用雷达平流—HRRR 混合 | 2026-07-28 16:39—2026-07-29 13:07 | `core-short-range` / `core-nowcasting` | `infrastructure` | GitHub 与公开网站清单 | 仓库作者实测与部署状态变化；无论文 | [仓库](https://github.com/andrewnakas/globalnowcast)；[上线门槛提交](https://github.com/andrewnakas/globalnowcast/commit/ce457714b5cd)；[实时清单](https://andrewnakas.github.io/globalnowcast/data/manifest.json) | 代码、ONNX 和概率匹配表公开；模型未上线；无独立 LICENSE、正式 release、固定训练数据 manifest 或独立复现 |
| `holys519/solafune_precipitation_nowcasting`：总量—空间分布因子化与空间外推门槛 | 2026-07-29 05:18 | 卫星同期降水估计，连接结构恢复 | `adjacent-method` | GitHub / Solafune 竞赛 | 大型代码与实验文档提交；无论文 | [仓库](https://github.com/holys519/solafune_precipitation_nowcasting)；[本轮提交](https://github.com/holys519/solafune_precipitation_nowcasting/commit/8909a6e74a93) | 代码与实验文档公开；原始竞赛数据、最终权重、预测、release 和独立 LICENSE 未公开 |
| pySTEPS KNMI HDF5 投影元数据修正 | 2026-07-29 13:51 | 雷达临近预报输入基础设施 | `infrastructure` | GitHub | 代码提交；非模型结果 | [提交](https://github.com/pySTEPS/pysteps/commit/0fe0a472c33a)；[仓库](https://github.com/pySTEPS/pysteps) | 代码与测试公开，BSD 3-Clause；无新模型、权重、数据集或评分 |
| *Evaluation of an Experimental 15-Member FV3-LAM Ensemble for the Summer 2024 Flash Flood and Intense Rainfall Experiment* | 2026-07-29 01:01（Crossref 建档；官方日期 2026-07-28） | `core-short-range` | `infrastructure` | AMS，*Weather and Forecasting* | 正式期刊发表 | [论文 DOI](https://doi.org/10.1175/WAF-D-25-0256.1) | 未核实到专属代码、成员配置包或可下载验证数据；本轮可访问摘要未给绝对分数 |
| *Spatially adaptive satellite precipitation downscaling in complex terrain for high-resolution rainfall erosivity mapping* | 2026-07-28 19:29（Crossref 建档） | 通用降尺度，连接局地结构恢复 | `adjacent-method` | SSRN | SSRN posted content，非正式期刊发表 | [论文 DOI](https://doi.org/10.2139/ssrn.7196742) | 未核实到代码、数据包或复用许可证 |

### 48 h 缓冲条目

| 标题 | 日期（北京时间） | 研究主线 | 相关性分类 | 状态与链接 | 代码/数据状态 |
|---|---:|---|---|---|---|
| *Integrated Multi-Radar Attenuation Correction for X-Band Phased-Array Networks Using Common-Volume Consistency Constraints* | 2026-07-28 13:36（比主窗口早约 39 min） | `core-nowcasting` 上游雷达质控 | `adjacent-method` | SSRN posted content，非正式期刊发表；[论文 DOI](https://doi.org/10.2139/ssrn.7195318) | 未核实到代码、案例数据或许可证 |
| *A Systematic Machine Learning-Based Benchmark Framework for PM2.5 Prediction Using Meteorological Sensed Inputs* | 2026-07-28 03:09（Crossref 建档） | `core-air-quality` | `metadata-only` | IEEE JSTARS 正式记录；[论文 DOI](https://doi.org/10.1109/JSTARS.2026.3717224) | 本轮未取得摘要或正文，模型、城市/数据、时效、拆分、指标、代码与数据状态均不推断 |

## 三、四条核心研究线

### 3.1 `core-nowcasting`：尺度衔接比单独的 0—2 h 网络更值得检验

本轮没有发现一篇只针对 0—3 h 概率集合雷达临近预报、且同时给出新代码或独立业务验证的论文。最接近直接任务的证据来自 `ConvScaleCast` 中的 0—2 h 多雷达模块，以及 `globalnowcast` 对真实预报输入失败的仓库记录。

#### ConvScaleCast 的 0—2 h 多雷达模块

**任务、观测与模型。** 论文在上海使用 7 部 S 波段和 3 部 X 波段天气雷达构成自适应网络，观测时间分辨率为 1 min。0—2 h 部分采用改造后的 ConvLSTM（GVIP），融合多雷达信息并加入垂直物理约束，输出雷达回波演变；顺序数据共 34,745 个样本、每个样本 15 帧，2019—2022 年用于训练，其中 20% 作验证，2023 年独立测试。这样的按年份测试优于随机帧拆分，但多站融合带来的采样增益与模型结构增益仍需做等观测条件消融。

**作者报告效果。** 作者报告，多雷达融合的 GVIP 在 0—2 h、20 dBZ 阈值的 CSI 为 0.72，相对单一 S 波段雷达提高 28.6%；在 40 dBZ 阈值相对提高 80%。相对拉格朗日外推，CSI 提高约 23%—35%；相对普通 ConvLSTM，质量守恒误差降低 72.4%。这些结果是作者报告，且正文摘要性表述没有给出各时效、各阈值完整共同样本表，不能据此断言所有强对流阶段均改进。

**与 2—24 h 模块的衔接。** GVIP 的观测与预报结果继续进入 PODA 序数自编码/订正模块，并与 ECMWF IFS 及城市下垫面参数融合。作者报告，在 2—6 h 中加入 GVIP 输入后，`TS10` 提高 59.1%。这说明 0—2 h 观测演变可以向短时 NWP 后处理传递信息，但必须核对 GVIP 预报在每个有效时刻的可得性，避免把未来观测或分析场误带入较长时效。

**技术边界。** 论文中的“physics-informed”同时包含模型约束和 ERA5/IFS 物理场；需要进一步区分训练期再分析约束与业务起报时可用预报场。论文还将部分降水结果写成反射率阈值表现，但从 mm h⁻¹ 到 dBZ 的转换未在可核验文本中完全交代。论文给出的 FSS 公式也更接近全场归一化平方误差形式，而不完全等同于常用邻域分数；本日报只沿用作者指标名，不把它与其他论文的标准 FSS 直接比较。

**图件未镜像：**论文页面给出的许可为 [CC BY-NC-ND 4.0](https://creativecommons.org/licenses/by-nc-nd/4.0/)，不在本站图件白名单。可前往[论文页面](https://doi.org/10.1038/s44304-026-00249-w)查看原图。

#### 48 h 缓冲：多 X 波段相控阵雷达共同体积衰减订正

**任务与方法。** SSRN 预印本利用多雷达共同体积一致性，联合求解衰减系数、系统偏差和天线罩水膜衰减，输入包括测得反射率及差分传播相移率。案例包括 2025-07-30 浙江三部雷达网络和 2025-07-26 贵州阵列雷达。它是进入 QPE/QPF 或 AI 临近预报前的上游质控，不是未来回波预测，也不是 AI 模型。

**证据边界。** 摘要只定性报告跨雷达一致性和定量降水估计准确性改善，未提供可复核的绝对指标、共同样本、代码和数据。因其 Crossref 建档时间比严格主窗口早约 39 min，本期只作为缓冲线索，不升级成主窗口新增。

### 3.2 `core-short-range`：0—24 h 城市强对流尺度桥接与区域集合基线

#### ConvScaleCast 的 2—24 h 订正

**来源与正式状态。** *ConvScaleCast* 于 2026-07-28 在 *npj Natural Hazards* 在线发表，当前为未编辑早期版本；论文记录显示 2026-04-19 收稿、2026-07-11 接受。正式在线状态已经核实，但后续编辑版仍可能修正文句、表格或数据声明。

**数据与覆盖。** 除上海雷达外，研究使用 ERA5 的 500/700/850/925 hPa 高空场，水平分辨率 0.25°；地面变量包括 10 m 风和 2 m 温度。2—24 h 模块以 2021—2023 年 ECMWF IFS 预报为主要输入，原始 6 h 累积降水被处理为训练目标/特征，并融合雷达观测或 GVIP 预报及城市地表参数。这里必须把 IFS 起报、有效时刻、累积区间和 GVIP 输出时刻逐一对齐，不能把 6 h 累积量与 1 h 雨强混作同一变量。

**模型构建与训练测试。** PODA 将降水等级作为有序学习问题，结合自编码表示和 focal ordinal regression，目标是校正 IFS 偏差并恢复城市局地降水结构。作者报告使用 2021—2023 年 IFS 数据；但正文案例图又包含 2016-09-07/08 的独立事件，当前文本没有充分解释 2016 案例与所述训练/输入年份之间的关系。这是需在正式编辑版或补充材料中核对的时间一致性问题。

**作者报告效果。** 作者表中原始 IFS 的 CSI/`TS10`/FSS 为 0.212/0.189/0.520，OBA 为 0.312/0.290/0.652，PODA 为 0.406/0.385/0.776；加入城市地表参数使 `TS10` 进一步提高 12.3%。个例空间相关系数据报超过 0.6，而 IFS 低于 0.4。以上比较同时改变了模型、观测约束和高分辨率地表信息，因此是“系统相对原始 IFS”的增益，不是纯网络结构公平消融。原始 9 km IFS 与增强系统的分辨率、输入信息量也不同。

**代码、数据与许可。** 论文的数据可得性说明雷达和内部预报输出受限、可向作者请求；代码声明写明“录用后发布”。论文已经接受并正式在线，但截至本轮未找到相应仓库、权重、release 或许可证，因此不能写成代码已发布。论文许可为 CC BY-NC-ND 4.0，本站不镜像图件。

**与用户研究的连接。** 这篇论文最可借鉴的不是某个单独网络，而是把 0—2 h 观测可预报信息、2—24 h 动力锚和城市下垫面分开处理。迁移到用户研究时，应至少设置：原始 NWP、仅雷达、雷达+NWP、雷达+NWP+静态场四组共同样本；按 `0—2/2—6/6—12/12—24 h` 报告绝对场和异常指标；同时检查高阈值 CSI、邻域 FSS、位移、频谱和概率可靠度。

#### FV3-LAM 15 成员集合：非 AI，但提供业务比较基线

**任务与覆盖。** AMS 论文评估了 2024 年夏季 NOAA Flash Flood and Intense Rainfall Experiment 中的 15 成员 FV3-LAM 集合。系统每天起报一次、积分至 84 h，共 30 天；成员差异包括物理参数化、边界条件、雷达同化和积云方案。它不是 AI 论文，但直接涉及短时至 3.5 d 强降水、集合离散度和业务成员设计，因此归入 `infrastructure`。

**作者报告结论。** 可访问摘要报告：使用积云参数化和 GEFS 边界的某些成员在第 1 天之后可能退化；Noah-MP 成员偏差更强；雷达反射率同化主要改善第 1 天；Spatial Aligned Mean 共识产品表现较好；实验 MPAS 在前 2 天具有竞争力，第 3—4 天略弱。这些都是摘要层面的方向性结果，本轮未取得绝对 CSI/FSS/CRPS、阈值、共同样本和置信区间，不能用于量化排名。

**可借鉴点与剩余问题。** 该研究提醒 AI—动力比较不能只挑一个动力成员：边界、物理、雷达同化和成员后处理都会改变基线。后续若用 AI 订正或生成集合，应该固定有效时刻和共同案例，与原始成员、集合均值、空间对齐共识及校准后集合同时比较。

### 3.3 `core-s2s`：本轮无高价值新增

本轮分源检索了 1—65 d AI 天气、动力—AI 混合、集合/生成式校准、异常可预报性、统计/生成式降尺度和多模式公平比较；同时检查了 Google DeepMind、ECMWF、NOAA、Met Office、中国气象局等机构页面。没有发现落在严格主窗口或 48 h 缓冲窗口、并带来新论文、代码、权重、数据、量化业务验证或明确许可变化的高价值条目。

本栏不以 FGOALS 为检索边界，也没有把一般中长期 AI 天气模型、旧项目页重抓日期或机构议程误写成新 S2S 进展。S2S 当前最值得继续追踪的触发器仍是：真实动力起报驱动、1—65 d 共同样本、异常而非仅绝对场、集合可靠度、局地结构恢复，以及 ECMWF/NCEP/CMA/UKMO/FGOALS 等多系统之间的公平比较。

### 3.4 `core-air-quality`：单站不确定性量化有进展，真实预报驱动仍缺位

#### Visakhapatnam PM₂.₅ 预测与 conformal interval

**来源、任务与数据。** 论文于 2026-07-28 在 *Sustainable Environment Research* 正式在线，当前为已接受、未编辑版本，采用 CC BY 4.0。研究使用印度 Visakhapatnam 的 CPCB GVMC 单站逐日数据，覆盖 2018-01-01—2024-12-31。目标为 PM₂.₅，候选输入包括 PM₁₀、NO₂、NH₃、SO₂、CO、O₃、温度、相对湿度、风速/风向、降水、太阳辐射和气压。

**特征、模型与拆分。** 特征包括 1/3/7/14 d 滞后和严格后移的 3/7/14 d 滚动均值与标准差。特征构造后保留 2,371 个样本、52 个变量，按时间顺序拆成训练/验证/测试 1,659/355/357，并在训练段内用 5 折 TimeSeriesSplit。比较模型包括决策树、随机森林、ElasticNet、SVR、XGBoost、LightGBM，以及平方、Huber、绝对和分位损失的梯度提升回归。

**预测时效边界。** 论文把任务称为预测，但模型用历史滞后以及“时间对齐可用”的当日气象和共污染物估计当日 PM₂.₅；没有把起报时刻、目标有效日和输入截止时刻写成业务预报协议。若目标日 PM₁₀、气象和其他污染物需要等到有效日后才能获得，则当前结果更接近同期估计/补全；若它们来自预报，则需要明确预报来源和误差。因而不能把这些结果直接当作 CAMS/MLWP 驱动的未来 PM₂.₅ 技能。

**作者报告效果。** 随机森林测试集 `R²=0.8444`、RMSE `9.33 µg m⁻³`、MAE `6.43 µg m⁻³`、MAPE `15.14%`、MASE `0.77`；验证集 `R²=0.9028`。Huber 梯度提升测试 `R²=0.8096`、RMSE `10.32`、MAE `7.12 µg m⁻³`。仅气象输入的随机森林 `R²=0.5583`、RMSE `15.73`；移除 PM₁₀ 后 `R²=0.7498`、RMSE `11.84`，说明聚合技能很大程度依赖污染物持续性和共污染物信息。

**极端/等级表现。** 按 CPCB 等级拆分后，最差污染等级只有 11 个样本，随机森林 RMSE `19.21 µg m⁻³`、`R²=-3.4285`；中等级 53 个样本，RMSE `13.48`、`R²=-1.2886`。即使“满意”和“良好”等级的 `R²` 也只有约 0.246 和 0.184。因而总体 `R²` 不能替代高污染过程验证，也不能证明沙尘或阈值敏感过程可用。

**不确定性与校准。** 论文使用 conformal prediction，名义覆盖率为 0.90。作者报告随机森林经验覆盖率 0.8824、平均区间宽度约 `26 µg m⁻³`；分位梯度提升覆盖率 0.9244，但区间最宽、较保守。正文把残差 bootstrap、分位回归和 conformal 区间并列讨论，但三者并非同一种预测区间。另有图注把动态界限写成 95%，与正文名义 0.90 的描述不一致，需在正式编辑版中核对。

**代码、数据与判断。** 数据按请求提供，未找到官方代码、模型权重或可执行环境。单站时间顺序拆分和区间校准值得借鉴，但空间泛化无法评估，气象输入也不是 CAMS/MLWP 真实预报。对用户研究，最直接的扩展是并列“分析气象驱动”和“真实预报气象驱动”，按普通/污染/沙尘过程分别报告偏差、RMSE、覆盖率、区间宽度和阈值命中率。

<figure class="paper-figure">
  <a href="https://doi.org/10.1186/s42834-026-00296-y" target="_blank" rel="noreferrer">
    <img src="/assets/paper-figures/2026-07-29/pm25-visakhapatnam/fig-1-web.webp" alt="PM2.5 时间特征、机器学习比较、SHAP 解释与不确定性量化流程图" loading="lazy">
  </a>
  <figcaption><strong>论文 Figure 1｜PM₂.₅ 机器学习与不确定性量化流程。</strong> 原始图注：Methodological flowchart illustrating the machine learning framework for PM2.5 concentration prediction。作者：Salvator Lawrence、Srimuruganandam Bhathmanabhan。来源：<a href="https://doi.org/10.1186/s42834-026-00296-y" target="_blank" rel="noreferrer">论文 DOI</a>及出版商提供的正式许可接受稿。许可：<a href="https://creativecommons.org/licenses/by/4.0/" target="_blank" rel="noreferrer">CC BY 4.0</a>。本站从许可 PDF 提取完整嵌入图件并转换为 PNG 与无损 WebP；未裁剪、标注或改变图内内容，原始图号和图注完整保留。</figcaption>
</figure>

## 四、相关方法与基础设施

### 4.1 生成式城市空气质量场重建：不等于未来污染预报

**来源与任务。** arXiv `2607.25687v1` 研究稀疏站点条件下的全城市污染场同期重建。它比较 Voronoi U-Net、ViTAE、ConvLSTM 和基于 EDM score diffusion 的生成模型；生成模型使用 U-Net、Transformer Voronoi 编码器和 cross-attention，并通过 DPM-Solver++ 采样、masked back-sampling 强制满足观测点。任务没有未来预报时效，也没有 CAMS/NWP 预报驱动，因此分类为 `adjacent-method`，不能写成 PM₂.₅ 预报成果。

**数据与评估。** 模拟场来自 Polyphemus/Polair3D，巴黎区域 2 km 网格、14 层，变量含 NO₂、O₃、PM₁₀、PM₂.₅；模拟训练覆盖 2014 年 1—10 月。真实 Geod’air 小时观测覆盖 2014 年，站点数随时刻约 9—28 个，场网格为 75 × 110；真实测试使用 11—12 月，并在每个时刻留出一个内城和一个外围站点。论文还向模拟输入加入噪声以缓和 simulation-to-observation 差异。

**作者报告效果。** 在模拟场上，扩散模型对 NO₂/O₃/PM₁₀/PM₂.₅ 的相对误差分别为 0.213/0.091/0.183/0.182，SSIM 为 0.890/0.642/0.699/0.659。真实观测留站测试中，ConvLSTM 的相对误差 0.228 最好，扩散模型为 0.249，VUNet 0.264，Kriging 0.282，ViTAE 0.300。也就是说，生成式模型能表达多个可能场，但在真实稀疏站点误差上并未胜过确定性 ConvLSTM。

**代码、数据与不确定性。** GitHub 仓库包含代码、配置和 notebook，但无 LICENSE、release 或 tag；最后提交早于本窗口，所以本轮新事件是论文而不是代码发布。论文列出的 Hugging Face 数据集本轮返回未授权/不可公开访问，数据许可和可复现性未核实。作者使用 20 成员、10 次重复讨论集合均值，但未给可靠度、覆盖率或场级校准，因此“生成多个样本”不能自动写成“校准的不确定性”。

**图件未镜像：**arXiv 记录采用 CC BY-NC-SA 4.0，不在本站白名单；arXiv 可下载也不等于本站可以镜像图件。可前往[原文页面](https://arxiv.org/abs/2607.25687)查看。

### 4.2 `globalnowcast`：真实 HRRR 预报输入暴露分析—预报域差

**存档训练与正向结果。** 仓库的 U-Net 以过去 4 个逐小时 MRMS 场和 6 个 HRRR 侧变量预测未来 `+1…+6 h` 的 MRMS，约 0.93 M 参数，ONNX 文件约 3.8 MB。作者仓库记录 48,316 个训练序列、1,500 个留出序列，并从 2014—2026 年抽取 10 个留出月份。在 HRRR 分析/存档通道上，概率匹配后的 1/4/8 mm h⁻¹ CSI 为 0.5038/0.3441/0.2522，HRRR 为 0.4125/0.2388/0.1542，作者换算增益为 22.1%/44.1%/63.6%。这些是仓库作者报告，不是论文或独立复现；文档中的不同种子峰值约 0.524，但不同文件最后几位不一致。

**真实预报输入失败。** 最新提交把训练模型接到真实 HRRR 预报输入，并评估 17 个实时案例。`ml/out_live_eval.json` 中 1 mm h⁻¹ 汇总 CSI 为：模型原始 0.138、概率匹配后 0.106、HRRR 0.149；相对 HRRR 的门槛增益为 `−28.9%`。微调版本 `out_live_eval_fc.json` 的门槛增益为 `−55.3%`。仓库明确标记 gate fail，因此没有把模型投入线上。这里的关键不是模型“彻底无效”，而是训练时使用的 HRRR 分析/存档变量与真实业务预报变量分布不一致，存档评测不能代表部署通道。

**实际线上方案。** 网站实际采用雷达平流与最新 HRRR 的确定性混合：约 `+1.5 h` 前平流较优，`+2.5 h` 后 HRRR 较优，使用中心约 120 min、尺度约 45 min 的 logistic 权重衔接。仓库作者在同一 17 个案例上报告，1 mm h⁻¹ 汇总 CSI 为平流 0.125、HRRR 0.149、混合 0.170，混合相对 HRRR 约提高 14%；4 mm h⁻¹ 也被报告为改善。核验时公开 manifest 返回 `corrected:false` 和 `conus.source:"radar+hrrr"`，确认线上层不是 U-Net 输出。

**外部校验与边界。** 仓库还用 ASOS 点雨量检查 MRMS，低阈值 CSI 较低且雷达湿区偏大约 2.2 倍；但点站—网格与累积窗口并未完全统一，不能把该数值当成最终雷达真值误差。仓库公开代码和模型工件，但无独立 LICENSE、正式 release、固定数据清单或独立复现。

**研究连接。** 这次状态变化直接支持用户在 PM₂.₅/CAMS、雷达—模式融合和 S2S 混合研究中采用同一原则：训练/验证阶段必须加入“分析驱动—真实预报驱动”双通道，并把差异当作主要结果而不是上线后的异常。动力锚仍可能保留可预报信息，但 AI 修正只有在真实输入域上通过逐时效、逐阈值门槛后才能替代简单混合。

### 4.3 Solafune：总量—空间分布因子化与外推门槛

**任务边界。** 仓库处理 Solafune 卫星降水竞赛：最多 3 帧、16 波段地球同步卫星观测映射到对应时刻的 GPM-IMERG 降水 GeoTIFF。新共享管线把输入处理为 164 × 164、输出 41 × 41；数据预计约 18 GB 训练、13 GB 评测。它不是天气雷达，也不是未来回波或未来降水预报，分类为 `adjacent-method`。

**新增方法。** 大型提交把预测显式分解为 `tile_total × spatial_distribution`，其中空间分布归一化为和为 1，并增加降水发生辅助任务。其动机与用户的多尺度问题一致：总量/大尺度信号与局地空间结构不由同一损失承担。仓库同时加入位置聚类 GroupKFold、按地点聚类的 bootstrap 80% 区间、增益集中度和泄漏审计、外层 cross-fit blend，以及 GO/HOLD/NO-GO 门槛。

**训练测试与仓库作者结果。** 训练区和评测区分别含 20 和 18 个位置。当前两种子 `exp056` 公开榜 RMSE 为 0.682772；但种子组合经过公开榜选择，不能视为无偏独立测试。简单叠加更长历史帧 `cr2/cr3/cr4` 反而变差。Swin 预训练候选在 fold 0 为 0.27404、优于基线 0.28159；fold 4 为 0.58572，与基线 0.58503 近似持平，其余折和完整 OOF 仍在运行，不能宣布整体胜出。

**最重要的负结果。** 先前 `exp055` 通过嵌套交叉验证、bootstrap 和训练侧诊断，但公开榜仍退化，仓库将原因指向训练/评测位置分布差异。任何只在训练区域上重采样的检验都不能证明向未知位置迁移。原始数据、最终权重、预测和独立 LICENSE 均未公开，所有分数都是竞赛仓库作者报告。

**可借鉴点。** 总量—空间分布因子化可以迁移到雷达/模式融合、S2S 降尺度和空气质量场恢复，但应同时报告总量误差、频谱、对象位置、极端阈值、区域/过程留出和概率覆盖率。若空间外推未通过，局地纹理更锐利不能被解释为真实结构恢复。

### 4.4 pySTEPS：投影元数据也是科学正确性的一部分

pySTEPS 提交扩展 KNMI HDF5 导入器，读取真实 Proj4、像元偏移和像元大小，支持 km、m 和 degree 单位及 y 原点，并为历史上格式不规范的投影元数据增加修正与测试。仓库采用 BSD 3-Clause。

这不是模型或指标更新，但它直接影响雷达拼图与 NWP/地形/卫星场的网格对齐。若投影、像元中心或 y 方向错误，后续 CSI、FSS、对象位移和多模态融合都会产生系统偏差。对用户工作流的可执行要求是：把 CRS、轴方向、像元中心/边界和单位检查放到数据预检，而不是等模型训练后才通过图像错位发现问题。

### 4.5 复杂地形卫星降水降尺度：随机划分夸大空间泛化

**任务与数据。** SSRN 预印本把 2001—2019 年西南中国高山峡谷区的年尺度 GPM-IMERG 从约 10 km 降到约 1 km，用于高分辨率降雨侵蚀力制图。比较全局随机森林和地理加权随机森林，并使用空间 block cross-validation 和 16 个独立雨量站核验。它是历史气候/遥感降尺度，不是未来降水预报。

**作者报告效果。** 摘要报告，随机拆分可把技能夸大最高约 27%；空间验证下地理加权随机森林 `R²=0.82`、RMSE `115.2 mm yr⁻¹`，全局随机森林 `R²=0.64`、RMSE `164.8 mm yr⁻¹`。在 16 个留出站点上，相对原始 IMERG，绝对偏差从 17.5% 降到 5.3%，RMSE 从 223.8 降到 101.0。局地控制因子随区域从高程转向云、蒸散、风和地表温度。

**边界与连接。** 结果支持“局地结构恢复要使用空间隔离验证”，但年尺度侵蚀力与逐小时强对流、0—72 h 预报或 S2S 异常不是同一任务。未核实到代码、数据包或复用许可；图件不镜像。

## 五、机构信号、仅元数据、窗口外与排除项

### 5.1 `institution-signal`

本轮检查 Google DeepMind、ECMWF、NOAA、Met Office、中国气象局、WMO 和 Copernicus/CAMS 的官方页面，**未发现严格主窗口内新的模型、代码、权重、数据、结果表或许可变化**。一般 AI 天气新闻、旧项目页搜索重抓和会议议程不计为成果。

WMO 2026-07-30 AI webinar 仍是有效的下一触发器，而不是今日新增。若会后出现录像、幻灯片、系统链接、共同样本验证或代码/数据，再按真实产物归入 `institution-signal`、`infrastructure` 或相应核心主线。[WMO AI webinars](https://wmo.int/media/news/wmo-ai-webinars)

### 5.2 `metadata-only`

- IEEE JSTARS *A Systematic Machine Learning-Based Benchmark Framework for PM2.5 Prediction Using Meteorological Sensed Inputs* 位于 48 h 缓冲窗口。正式 DOI 可核验，但本轮没有摘要/正文，因此不推断预测时效、数据城市、模型或指标；题目相关不等于技术证据。
- *Air Quality Prediction and Disease Risk Forecasting Using a Hybrid Ensemble Learning Framework*（[DOI](https://doi.org/10.1109/CONIT69683.2026.11621476)）和 *Integrating ANN, RNN, and Multi-Head Attention for PM10 Prediction*（[DOI](https://doi.org/10.1109/IAICT71158.2026.11620978)）在主窗口出现 Crossref 元数据，但会议实际日期早于建档时刻，且无摘要/正文可核验。本期只记索引状态，不写入空气质量方法进展。

### 5.3 `window-out`

本轮未发现一个需要因严重索引延迟而重新升级的高价值窗口外成果。2026-07-28 日报已经收录的 IOP 网格降水变量组合论文和 ITM 空气质量论文没有状态变化；它们继续留在历史日报和 tracker，不重复抄写成今日新增。

### 5.4 `low-value-exclusion`

- SSRN `10.2139/ssrn.7196740` 与 `10.2139/ssrn.7196735` 具有相同热带气旋降水估计题名、作者和摘要，且任务是估计而非预报；按重复元数据排除，不把两个 DOI 计作两项进展。
- *OceanForecastBench*（DOI `10.1029/2025JH000838`）虽涉及机器学习预报基准，但主体是海洋，不属于本监测的四条大气研究线，按范围边界排除。
- 汽车毫米波雷达、一般物联网空气质量分类、无摘要的宽泛 AQI 疾病风险会议记录，以及仅更新网页抓取时间、依赖或自动日志的仓库，不进入实质更新表。

## 六、对当前研究的具体启发

1. **把分析驱动与真实预报驱动做成一组主实验。** `globalnowcast` 的失败说明，用 HRRR 分析/存档通道训练得到的正向分数不能外推到真实 HRRR 预报输入。PM₂.₅/CAMS、雷达—NWP 和 S2S 混合研究都应固定同一有效时刻，分别输入分析、真实预报和可选偏差订正预报，直接量化域差。
2. **按时效决定信息源权重，而不是让一个网络统包。** 0—2 h 雷达演变、2—6 h 雷达—NWP融合、6—24 h 动力锚和更长时效异常预测的可预报信息来源不同。简单 logistic 混合虽不复杂，却在真实输入上胜过失配 U-Net；它应作为所有复杂混合模型的强基线。
3. **把“总量/低频背景”和“空间分布/高频结构”分开评估。** Solafune 的因子化与 ConvScaleCast 的尺度桥接均支持这一方向。主结果不能只有 RMSE 或视觉图，应同时给区域总量、频谱、邻域 FSS、对象位移、极端阈值和小尺度方差。
4. **空间外推要用区域或天气过程留出。** 随机拆分可显著夸大复杂地形降尺度技能，训练区域上的 bootstrap 也不能证明新区域泛化。雷达研究应按站点/雷达域/天气过程，空气质量按城市/站点，S2S 按起报年份和独立事件隔离。
5. **不确定性必须验证覆盖率，而不是只生成多个样本。** Visakhapatnam 论文至少给出 conformal 覆盖率和区间宽度；空气质量场扩散论文虽有 20 成员，却没有可靠度或覆盖率。对所有生成式结果，应在共同样本上报告 CRPS、可靠度、覆盖率、区间/集合宽度及高影响事件条件覆盖。
6. **极端事件分层可能推翻平均结论。** PM₂.₅ 模型整体 `R²` 较高，但污染等级分层后 `R²` 为负；强降水也应按阈值、对象生命周期和地区分层，避免用普通样本主导的平均指标证明极端可用性。
7. **坐标、单位和时间窗口应进入发布前硬校验。** pySTEPS 的投影修正与 ASOS—MRMS 对比都表明，点—格点、累积—瞬时、mm h⁻¹—dBZ、像元中心—边界、起报—有效时刻不一致会制造虚假增益或失败。

## 七、后续跟进触发器

- **ConvScaleCast：** 官方代码/权重/许可证发布；2016 案例与 2021—2023 输入年份关系得到解释；FSS 定义和 mm h⁻¹—dBZ 转换澄清；出现跨城市、跨雷达或逐时效共同样本验证。
- **`globalnowcast`：** 使用真实 HRRR 预报通道重新训练后通过预注册 live gate；公开固定月份与输入版本 manifest、权重/license；完成累积窗口统一的 ASOS/MRMS 核验或独立复现。
- **Visakhapatnam PM₂.₅：** 明确目标有效日和输入截止时刻；加入 CAMS/MLWP/区域 NWP 真实预报气象；公开代码和数据提取 manifest；对高污染/沙尘过程扩大样本并校准条件覆盖。
- **城市空气质量重建：** Hugging Face 数据集恢复公开访问并明确许可证；仓库补 LICENSE/release；增加未来时效、真实预报气象驱动和场级可靠度/覆盖率。
- **Solafune：** 完成 5 折 OOF 和未触碰评测区验证；公开最终权重、预测、数据获取说明和许可证；若迁移到 radar target 或未来时效，重新分类。
- **FV3-LAM：** 取得全文的绝对阈值/共同样本/置信区间、15 成员配置与可复现实验包；出现 AI 订正或生成集合在同一 30 天上的公平比较。
- **WMO 2026-07-30 webinar：** 会后录像、幻灯片、系统、代码、数据或量化验证出现时再升级；只有议程和观点时保持机构信号。
- **四条主线持续检索：** 重点补查晚到 arXiv/OpenReview 索引、期刊正式页、GitHub/Hugging Face 实质发布，以及 DeepMind、ECMWF、NOAA、Met Office、CMA、WMO 和 CAMS 的可下载成果。

## 八、简短结论

2026-07-29 的最强信号不是某个新模型刷新了单一分数，而是三条更可操作的证据：**真实预报输入可以让存档评测中的正增益转为负增益；大尺度总量与局地结构需要分解建模和分开验证；不确定性只有在覆盖率、宽度和高影响条件下被核验才有意义。** `ConvScaleCast` 提供了雷达到短时 NWP 的系统化尺度桥接，Visakhapatnam 论文提供了明确的区间校准示例，但二者都没有闭合真实业务驱动、极端样本和可复现性。当前研究应优先建立分析—预报双通道、时效依赖混合强基线、区域/事件留出和条件概率验证，而不是继续扩大网络后只比较平均误差或图像锐度。
