# 2026-08-02 大气科学 AI 研究日报

> 生成与科学核验截止时间：2026-08-02 13:00（北京时间，UTC+8）。  
> 严格滚动主窗口：2026-08-01 13:00-2026-08-02 13:00；补充缓冲窗口：2026-07-31 13:00-2026-08-01 13:00。  
> 连续增量边界：上一期实际科学核验截止为 2026-08-01 15:00；因此“上次截止后新增”只计 2026-08-01 15:00-2026-08-02 13:00。主窗口 13:00-15:00 的未跟踪内容只作为重叠恢复，不重复写成连续新增。  
> 去重基线：工作区最近两类日报、`tracked_items.md` 与本自动化记录。论文、预印本、仓库提交、作者榜单、独立复现和元数据建档分别记录。

## 一、总体判断与信号地图

本轮**没有发现新的 `core-nowcasting`、`core-short-range`、`core-s2s` 或 `core-air-quality` 直接论文、公开权重或独立业务验证**。连续边界后保留 4 个实质事件，均属于横向方法或基础设施：TinyEarth 给出一个真实 EarthNet2021 上的受控结构-效率-模糊权衡基准；Solafune 同时刻卫星到 GPM 项目报告新的异构集合榜单结果；`globalnowcast` 新增 AIFS 与 GFS 的共样本评估脚本但尚无运行结果；`AD4DVAR-radar` 发布一个确定性雷达变分/平流基线，但没有真实数据技能证据。

另有两条 Springer 空气质量章节在主窗口内完成 Crossref 建档。其官方页面只标 2026 年，未给可核验的精确在线日期，因此统一记为 `metadata-only`，不把建档时刻等同于新实验发生时刻。缓冲窗口保留一篇海雾能见度开放环生成式预报正式论文和一篇 CCIC-IMERG/ERA5/DYAMOND 对流日变化评估预印本。前者是海雾时间序列而非雷达降水临近预报；后者使用机器学习卫星产品作为观测基准，而不是训练新的 AI 天气预报模型。

1. **“保留可预报信息”最清楚的新证据来自一个相邻任务。** TinyEarth 的小模型主要学到 35 天后的季节性绿度趋势，却在纹理和异常干旱场景上回归平均；平均误差略优于持续性，并不等于结构更真实。
2. **“表达不确定性”需要先区分开放环和闭合环。** 海雾论文用自回归开放环和 Monte Carlo dropout 给出 95% 区间，但仅有两段约一天的同次航次个例，且未报告区间覆盖率，不能视为已校准集合。
3. **模型臂替换必须在同一有效时刻、同一参照、同一掩膜上重评。** `globalnowcast` 的新脚本准备把 AIFS 降水率和 GFS 组合反射率都转为 dBZ，再对 RRQPE 共样本评分；当前只有协议，没有 AIFS 得分。
4. **集合多样性可能比单体排名更重要，但需防止榜单过拟合。** Solafune 的作者报告显示，两个单体未胜出的异构骨干加入 6 路集合后进一步降低公开榜单 RMSE；结果来自竞赛公开榜单，不是独立地域测试。
5. **四条核心线当天整体偏静。** arXiv 的六组定向 API 检索在窗口内未返回匹配新增；机构页未发现新模型、权重、数据或共同样本业务验证。Semantic Scholar 返回 429，OpenReview API 返回 403；两者只记访问限制，不能写成“确认没有”。

| 研究线 | 连续新增直接结果 | 相邻/基础设施信号 | 本轮判断 |
|---|---:|---:|---|
| `core-nowcasting` | 0 | 3 | 有雷达确定性基线、卫星到降水集合和 1-48 h 混合评估协议变化；无新的雷达未来帧技能、概率校准或业务验证 |
| `core-short-range` | 0 | 1 | AIFS-GFS 共样本脚本覆盖 6-48 h，但没有提交运行输出，不能判定模型臂优劣 |
| `core-s2s` | 0 | 1 | TinyEarth 关注 50-100 d 地表影像演化，只能作“慢变信号与结构模糊”类比，不是大气 S2S 预报 |
| `core-air-quality` | 0 | 2 条仅元数据 | 两章均为历史污染物时间序列预测，未检验 CAMS/MLWP 真实预报驱动、输送误差或概率阈值 |
| 横向方法与基础设施 | 4 | 缓冲 2 | 有真实代码、作者结果和开放归档，但没有新权重独立复现或可迁移业务结论 |

## 二、新增条目表

| 标题 | 日期（北京时间） | 研究主线 | 相关性分类 | 来源/平台 | 正式状态 | 链接 | 代码/数据状态 |
|---|---:|---|---|---|---|---|---|
| TinyEarth: matched-budget SSM/Transformer/ConvLSTM Earth-surface benchmark | 2026-08-02 02:23-06:29（实质提交） | 连接 `core-s2s` 的慢变信号/结构恢复问题 | `adjacent-method` | GitHub / EarthNet2021 | 仓库作者实验；无论文、DOI 或独立复现 | [仓库](https://github.com/thebrownkidd/Earth-Simulation-using-light-SSMs)；[真实数据实验提交](https://github.com/thebrownkidd/Earth-Simulation-using-light-SSMs/commit/9537f9676cfb5ff6674830a2dda249d925740167) | MIT 代码、结果 JSON 和图公开；数据不再分发，未核实训练 checkpoint/release |
| `holys519/solafune_precipitation_nowcasting`：6 路异构集合与 exp066 时间融合 | 2026-08-01 20:44（提交；文档榜单时刻未标时区） | 连接 `core-nowcasting` 的上游卫星降水估计 | `adjacent-method` | GitHub / Solafune 作者榜单 | 同时刻卫星到 GPM 竞赛结果；无论文、独立复现或正式 release | [提交](https://github.com/holys519/solafune_precipitation_nowcasting/commit/df4e4158567498e52245c61f78894d5cc247bc49) | 代码/OOF 文档公开；原始数据、最终权重、预测、独立 LICENSE 未核实；exp066 只有代码无结果 |
| `andrewnakas/globalnowcast`：AIFS 与 GFS 共样本评估脚本 | 2026-08-02 10:29（提交） | 连接 `core-nowcasting` / `core-short-range` | `infrastructure` | GitHub | 评估协议状态变化；无 AIFS 结果、论文或独立复现 | [提交](https://github.com/andrewnakas/globalnowcast/commit/28c604f5bf09d58845666304d2680d048de721d9) | 新增 `eval_aifs_vs_gfs.py`；复用既有 GFS-RRQPE 对；无运行输出、LICENSE 或冻结样本清单 |
| `gonos2k/AD4DVAR-radar`：3 帧确定性雷达回波基线 | 2026-08-02 11:46-12:38（提交） | 连接 `core-nowcasting` | `infrastructure` | GitHub | 代码仓库；非 AI/DL 论文，无真实技能证据 | [仓库](https://github.com/gonos2k/AD4DVAR-radar) | 算法、CLI 和测试公开；无 LICENSE、真实雷达样本、指标、权重、论文或 release |
| *Forecasting Air Quality Index Using LSTM and CNN-LSTM Methods* | 2026-08-02 06:55（Crossref 建档） | 连接 `core-air-quality` | `metadata-only` | Springer / DaSET proceedings | 2026 年正式会议论文集章节；官方页无精确在线日，订阅访问 | [DOI](https://doi.org/10.1007/978-3-032-23407-0_17) | 未发现代码、处理后数据、权重或软件许可；可核验信息限于官方摘要 |
| *Air Quality Forecasting with Hybrid Statistical-Deep Learning Models* | 2026-08-02 07:12（Crossref 建档） | 连接 `core-air-quality` | `metadata-only` | Springer / DaSET proceedings | 2026 年正式会议论文集章节；官方页无精确在线日，订阅访问 | [DOI](https://doi.org/10.1007/978-3-032-23407-0_14) | 未发现代码、处理后数据、权重或软件许可；可核验信息限于官方摘要 |
| *Open-Loop Generative AI Nowcasting of Dense Marine Fog Visibility...* | 2026-07-31 18:11（Crossref 建档；缓冲） | 相邻于 `core-nowcasting` | `adjacent-method` | Atmosphere / MDPI | 2026-07-31 正式论文，CC BY 4.0 | [DOI](https://doi.org/10.3390/atmos17080749) | FATIMA 数据需向 ONR/作者申请；论文未给公开代码或权重；合法镜像 Figure 3 |
| *Diurnal cycles of deep convective processes...* | 2026-07-31 20:27（Crossref 建档；缓冲） | 连接 `core-short-range` / AI-NWP 评估 | `infrastructure` | EGUsphere / Copernicus | 预印本，公开讨论中；CC BY 4.0 | [预印本](https://doi.org/10.5194/egusphere-2026-3869) | [15.2 GB 处理数据](https://doi.org/10.5281/zenodo.20842369)，CC BY 4.0；[24.1 MB 代码 v0.1pre](https://doi.org/10.5281/zenodo.21041037)，MIT |

表中时间优先写可核验的建档或提交时刻；Crossref 建档不等于实验完成、同行评审或论文首次公开的准确时刻。缓冲条目单列，不计入上次截止后的连续新增。

## 三、四条核心研究线

### 3.1 `core-nowcasting`：没有新的雷达技能结果，新增的是基线与评估边界

`AD4DVAR-radar` 以 -20、-10、0 min 三帧 dBZ 场为输入，输出 +10 至 +180 min。当前实现先用相位相关估计单一全局位移，以峰旁比作为失效保护，再由积分比估计对数增长率并施加 60 min 衰减，最后从最新回波做正值守恒的直接重映射。仓库还强调输入时间、网格、单位、状态和输出结构的 fail-close 合约。

它可以作为透明的平流-增长基线，但**不是 AI/DL 模型，也不是完整 Bayesian 4D-Var**。README 明确承认只有全局运动和增长，不能表达旋转、形变、多单体运动、局地生消或新对流触发；输出确定性且没有校准不确定性。仓库没有真实雷达数据、共同样本指标、论文、许可证或独立复现，因此本期只记 `infrastructure`，不把 +180 min 输出长度误写成技能范围。

`globalnowcast` 新脚本面向既有 `ml/gfs_pairs`：每个有效时刻包含 GFS composite reflectivity 和 RRQPE 观测，AIFS 使用公开 `ecmwf-aifs-single` 的 `precipitation_surface`。脚本把 AIFS 降水率和 GFS 场按同一 Marshall-Palmer 关系转成 dBZ，只在原样本卫星掩膜内，对 5/10/20/30 dBZ 阈值汇总 CSI 和湿区面积比，目标覆盖 6-48 h，并显式按初始化时刻和时效匹配有效时刻。

这一步的价值是把“换模型臂”变成共样本检验；但提交没有任何 AIFS 输出。脚本文档引用的 GFS CSI 约 0.19 和 1.7-1.9 倍湿区偏差属于仓库既有作者诊断，不能自动推导 AIFS 更好。还需核对 AIFS 累积量/率的单位、6 h 初始化可用性、每个有效时刻对应样本数，以及模型臂替换后的最终雷达平流-AIFS 组合，而不只比较单体。

Solafune 仍是同一时刻或近同一时刻的地球同步卫星到 GPM-IMERG 映射，不是未来雷达回波序列。它在第四节作为相邻方法详述。

### 3.2 `core-short-range`：AIFS-GFS 协议已出现，结论尚未出现

本轮没有新的 0-72 h 高分辨率 NWP 订正、强对流/降水业务验证或雷达-模式融合论文。`globalnowcast` 的 6-48 h 脚本是唯一直接相连的状态变化，但没有共同样本运行结果，也没有按区域、时效、阈值、降水类型和有效样本数分层。只有当 AIFS/GFS 的初始化、累积窗、单位、网格和 RRQPE 有效时刻严格对齐，并在最终混合系统而非单体上重评，才可讨论短时模式臂替换。

EGUsphere 对流日变化论文提供的不是预报技能，而是验证基础：逐格统一到 1°/1 h 后比较振幅和峰值时刻，能揭示日平均误差隐藏的相位偏差。它在第四节归入 `infrastructure`。

### 3.3 `core-s2s`：没有新的大气 S2S 条目

arXiv、Crossref、OpenAlex、期刊页和机构页未发现窗口内可核验的新 1-65 d AI 天气/S2S 直接结果。TinyEarth 的输入为 50 d Sentinel-2 历史、目标为未来 100 d 地表影像；它不预测大气状态、动力模式偏差或 S2S 异常，也没有 FGOALS/IFS/AIFS 等共同样本，因此只能作为“慢变可预报成分与局地纹理恢复相互分离”的方法类比。

### 3.4 `core-air-quality`：两章均停留在历史序列基线，未进入真实气象驱动链

*Forecasting Air Quality Index Using LSTM and CNN-LSTM Methods* 使用 Surabaya 环境部门空气质量站的日数据，分别对 PM10、SO2、CO、O3、NO2 构建单变量 LSTM 和 CNN-LSTM。摘要可核验的处理包括 Kalman smoothing 缺测填补、Min-Max 归一化、最优滞后选择和超参数调优；作者只定性报告 CNN-LSTM 对全部污染物更优，没有给出预测时效、时间划分、绝对指标或跨站测试。该章不能回答未来气象输入、输送、沙尘阈值或不确定性问题。

*Air Quality Forecasting with Hybrid Statistical-Deep Learning Models* 使用 Jakarta DKI4 站 2011-2025 年 PM10 和 O3 日序列，季节分解填补缺测，比较 RNN、LSTM、GRU、NNAR 和 N-BEATS，并用 MAE、RMSE、MAPE、sMAPE 评估训练和测试。作者报告测试期 PM10 以 NNAR 的 MAPE 23.56% 最低；N-BEATS 的 O3 测试 MAPE 为 64.24%，GRU 为 97.37%。这些数值说明单站 O3 外推仍很困难，但摘要未给预测时效、测试年份、污染/气象输入可用时刻或显著性。两章均无代码、数据快照和独立复现，本期只作 `metadata-only` 线索。

## 四、相关方法与基础设施

### 4.1 TinyEarth：模型保留季节趋势，却以结构模糊和均值回归为代价

TinyEarth 固定逐帧 CNN 编码器和解码器，只更换时间骨干，在约 2M 参数预算下比较对角 SSM（S4D）、selective SSM（Mamba）、ConvLSTM 和 temporal Transformer，并包含 persistence 与 climatology。真实实验使用 EarthNet2021：10 个 Sentinel-2 帧（50 d）输入、20 帧（100 d）输出；1,650 个 cubes 来自 5 个 tile，以 161 个窗口作验证，训练只跑 6 epochs，32×32 crop 训练、128×128 全场验证，官方 test track 未使用。

仓库作者报告 S4D 和 Transformer 的验证 MAE 均约 0.0282，persistence 为 0.0299，平均误差只改善约 5.8%；但 persistence 的 SSIM 为 0.803，反而高于 S4D 0.739 和 Transformer 0.762。分时效看，约 35 d 前持续性最好，较长时效后学习模型通过跟踪季节性绿度变化获得平均误差优势。干旱场景中，模型却把实测约 0.30 的 NDVI 推向 0.53-0.62，暴露均值回归。S4D 的整模推理约 611 ms，Transformer 约 384 ms，二者 MAE 差仅约 0.1%；参数效率没有转化成速度或质量优势。

这是与用户主问题高度同构的负-正混合证据：慢变成分可以被保留，纹理和场景异常仍会被平滑。仓库自己的下一步“对最新观测做残差预测”值得借鉴，因为它把 persistence 作为起点，而不是让模型重建静态地表。但当前样本地域很窄、训练未收敛、邻近窗口可能共享场景、无官方测试和公开 checkpoint，所以不把 5.8% 平均优势外推到大气 S2S。

### 4.2 Solafune：异构骨干改善集合，但任务仍不是未来预报

该竞赛任务使用地球同步卫星多通道历史影像估计 41×41 GPM-IMERG 降水场。新文档报告 6 路集合由 from-scratch CompactUNet、EfficientNet-B3、EfficientNetV2-S、Swin-Tiny、PVTv2-B0 和 Swin-Small 组成，权重通过外层 cross-fit 的 nested OOF 拟合，并叠加只使用过去时次的 causal smoothing。

作者记录 6 路版本的公开榜单 RMSE 为 0.667033，优于此前 4 路 v2 的 0.668478 和 v1 的 0.669662；nested OOF 从 v1 的 0.58813 降至 0.58418。单体未胜出的 PVTv2-B0 在 6 路权重中最大（0.2487），Swin-Small 也被纳入，支持“互补误差可胜过单体排名”的作者判断。需要严格区分：这些是作者提交到公开榜单的结果，不是 final/private leaderboard、独立地域测试或雷达未来时效验证；仓库没有独立 LICENSE、最终权重、原始数据或预测包。

同一提交新增 exp066：在相同 T 与输入预算下，把粗暴通道堆叠替换为共享逐帧编码器，并在 bottleneck 用 ConvLSTM 或标量注意力融合；最新帧的 skip connection 保留精细空间细节，历史帧只影响抽象趋势。该设计直接对应“最新状态保结构、历史信息调演变”，但目前只有实验代码和判读门槛，没有 OOF 或榜单结果，不能把架构意图写成有效增益。

### 4.3 海雾开放环论文：多时间尺度输入有效，但样本和校准证据很窄

Atmosphere 正式论文使用 2022 年 7 月 FATIMA Grand Banks/Sable Island 航次，在 R/V Atlantic Condor 上测得的 1 min 聚合序列。作者抽取两段连续稠密雾：2022-07-21 17:55 至 07-22 16:50、2022-07-24 08:02 至 07-25 05:18；只保留能见度不高于 400 m 且降水率不高于 0.05 mm h-1 的条件。输入为风速、露点差、相对湿度和能见度，预测 +10、+20、+30、+60、+90、+120、+180 min 能见度。

多 lookback architecture 为每个 1-90 min 历史窗建立独立双层 GRU/LSTM/Transformer/MLP 子网，拼接后经 dense、dropout 和线性层预测下一分钟；开放环从训练末尾 seed 开始，把模型自己的四变量预测递归回填，不接触测试观测。训练/测试按时间顺序切分，并在训练段内以三个滚动验证窗口选择 lookback；归一化统计只由训练段计算。最终超参数为 64 units、Adam、MSE、batch 16、20 epochs、patience 5；测试用 100 次 MC dropout 生成作者称为 95% 的预测区间。

作者报告开放环 GRU-MLW 在两案例、三种变率和各时效平均 RMSE 11.829±1.260 m、相对 persistence 的 skill score 0.073±0.061；10/20 min 平均 skill score 0.132±0.082、RMSE 7.013±1.105 m。只有 GRU-MLW 的开放环平均 skill score 为正，LSTM、Transformer 和 MLP 平均均劣于 persistence；与 ARIMA(2,1,2) 相比，作者报告 Wilcoxon Z=2.55、p<0.01。

技术边界同样重要：训练样本每个分组仅约 695-1260 min，测试是相同两段航次的尾部而非独立航次；Case 1 的均匀雾只够 60 min；154 种 lookback 组合和多轮调参相对于样本较多；数据需向 ONR/作者申请，代码和权重未公开；论文没有报告 95% 区间的覆盖率、宽度校准或可靠性。它证明多时间尺度开放环设计值得测试，不足以证明跨海域或业务概率可靠性。它也不是雷达回波/降水临近预报。

<figure class="paper-figure">
  <a href="https://doi.org/10.3390/atmos17080749" target="_blank" rel="noreferrer"><img src="/assets/paper-figures/2026-08-02/marine-fog-mlw/fig-3-web.webp" alt="海雾能见度多 lookback 子网络与预测模块框架" loading="lazy"></a>
  <figcaption><strong>论文 Figure 3｜多 lookback window 架构。</strong> 原始图注：The general multiple lookback window architecture utilizing similarly structured time series data. The figure shows the maximal case where three lookback windows where used for the input time series. If only two lookback windows are used for the data, then the architecture will also use only two subnetworks. In the case of a single lookback window, then the there is a single subnetwork. The learning layers in the architecture can either be LSTM, GRUs, Transformer, or basic MLP (dense) neural network models. 作者：Sushrit Kafle、Eren Gultepe、Sen Wang、Byron Walter Blomquist、Harindra J. S. Fernando、O. Patrick Kreidl、David J. Delene、Ismail Gultepe。来源：<a href="https://www.mdpi.com/2073-4433/17/8/749" target="_blank" rel="noreferrer">Atmosphere 正式论文</a>；具体原图来自该文 Figure 3。许可：<a href="https://creativecommons.org/licenses/by/4.0/" target="_blank" rel="noreferrer">CC BY 4.0</a>。本站下载完整作者发布 PNG，从 1805×2566 等比例缩放至 1600×2275 并转为无损 WebP；未裁剪、标注或改变任何面板、文字、箭头或数据内容，图注中未见独立第三方材料署名。</figcaption>
</figure>

### 4.4 CCIC-IMERG/ERA5/DYAMOND：用振幅和峰时刻审计对流日变化

EGUsphere 预印本不训练新的天气模型。它以半小时 CCIC 机器学习卫星产品给出 frozen water path 和高云量，以 IMERG v7 给出降水，并比较 ERA5 与 DYAMOND 冬季 km-scale 模式。CCIC/IMERG 使用 2018-2023，ERA5 同期，高云量为 2018；DYAMOND 使用 2020 年 2 月，FWP 覆盖 9 个模式、降水覆盖 5 个模式。所有资料保守重网格到 1°，聚合到 1 h，并在 60°S-60°N 按逐月 24 h 合成日分析。

方法同时拟合 24 h 和 12 h 谐波，以最大-最小定义日振幅、以局地太阳时最大值定义峰时刻；低于全球 FWP 25 分位或拟合 R²<0.6 的格点不写峰时刻。作者报告卫星观测中海洋 FWP/降水多在后半夜或清晨达峰，热带陆地多在下午；陆地高云量落后 FWP/降水数小时。ERA5 的热带陆地 FWP 日振幅偏小，局地峰时刻偏差可超过 ±6 h；ERA5 陆地降水振幅偏大，并缺失与 MCS 和地形相关的夜间峰。km-scale 模式相位偏差较小，但 SPCZ 和热带陆地振幅仍有区域系统偏差。

其价值是把“日平均场接近”拆成振幅和相位是否正确，也提示 CCIC 这类 ML 反演本身应与 IMERG/雷达参照分开。作者已归档 15.2 GB 预处理 CCIC/IMERG/ERA5/DYAMOND 数据（CC BY 4.0，版本 DOI `10.5281/zenodo.20842369`）和 24.1 MB 代码 v0.1pre（MIT，版本 DOI `10.5281/zenodo.21041037`）。这是一套可复核评估基础设施，不是 AI 模型优于 NWP 的技能榜单。

## 五、机构信号、仅元数据、窗口外与排除项

### 5.1 `institution-signal`

Google DeepMind、ECMWF、NOAA、Met Office、中国气象局、WMO 和 Copernicus/CAMS 的定向检查未发现本连续边界内新的四主线模型、权重、数据、共同样本结果或正式业务验证交付物。ECMWF 最新新闻列表仍停留在 7 月既有事件；旧模型页、活动议程和一般 AI 治理信息不用于填充日报。

### 5.2 `metadata-only`

- Springer 两章已在 3.4 详述。其新事件是 DOI/书章元数据可见，不是精确在线日期已核实；没有代码、数据或气象驱动实验，因此不升级为 `core-air-quality`。
- IEEE TGRS DOI [`10.1109/TGRS.2026.3714386`](https://doi.org/10.1109/TGRS.2026.3714386) 是对 *ADNM-UNet...Cloud Mask Nowcasting* 的一页 correction，Crossref 在 2026-08-01 02:12 +08 建档。当前可取材料没有说明改动影响模型、数据、指标或代码，且任务是云掩膜而非降水/雷达未来预报；只记 correction 元数据，不产生技能结论。
- Semantic Scholar 定向查询持续返回 429，OpenReview 新近 notes API 返回 403；Web 索引只找回旧条目。这里记录访问不完整，不把失败响应当成零结果证明。

### 5.3 `window-out`

Zenodo 数据集 *Beijing 2017-2018 3-Hourly PM2.5 and Meteorological Dataset (35 Monitoring Stations)* 的精确创建时间为 2026-07-31 12:09 +08，比 48 h 缓冲边界早 51 min，故记 `window-out`，不计本期新增。它仍值得后续跟踪：35 站、2017-01-01 22:00 至 2018-01-31 22:00、每站 3161 个 3 h 时次；变量含 PM2.5、PM10、NO2、CO、O3、SO2、温度、气压、湿度、风速和 u/v 风，另有原始观测 mask。短于等于 5 h 的缺口用前向填充，更长缺口用过去 24 个有效小时均值，属于因果填补。版本 DOI [`10.5281/zenodo.21713339`](https://doi.org/10.5281/zenodo.21713339)，单个 2.25 MB ZIP，CC BY 4.0。

该数据集说明用于尚未检索到正式论文/代码的 “LightVMD: Constraint-aware multi-scale forecasting for multi-station PM2.5 prediction”。它包含历史气象观测，不等于未来 CAMS/MLWP 气象预报驱动；下一触发器是论文、代码、严格时间/站点划分、真实未来气象输入和极端污染评估公开。

### 5.4 `low-value-exclusion`

- *Recent Advances in Air Pollution Monitoring and Forecasting*（DOI [`10.37773/ees.v9i2.1685`](https://doi.org/10.37773/ees.v9i2.1685)）在主窗口重叠段完成建档，但属于面向土木工程的 IoT/大数据/ML 宽泛综述，没有新数据、模型、统一样本或可复核预测结果，不进入新增证据集。
- `matko-iv/vrijeme` 的窗口内提交均由 GitHub Actions 自动刷新预报；`boncz/hawaii-airquality-forecasting` 和 `Zeref538/hangin` 同样只是数据/预报定时刷新。没有模型、代码逻辑、权重、许可证或科学解释变化，不计新事件。
- Hugging Face 检索只见既有天气预报数据集的自动时间更新，没有新模型卡、权重、数据版本、许可证或结果；不以更新时间代替实质载荷。
- `JoshuaKimsey/LibreWXR` 是雷达/NWP 自托管 API 应用，当前未核实 AI 算法或科学评估变化；不纳入。`matko-iv/vrijeme` 虽有完整后处理资产，但本窗口只有自动输出提交，同样排除。

## 六、对当前研究的具体启发

1. **把 persistence 写进模型结构，而不只当成表格基线。** TinyEarth 的残差预报建议与 Solafune“最新帧走 skip、历史帧只调 bottleneck”可以组合：大尺度/慢变分量预测增量，最新分析或动力模式保留确定性结构，再由生成分支表达未解析部分。
2. **同时报告平均误差和结构保持。** TinyEarth 的 MAE 胜、SSIM 败说明单一像素损失会奖励模糊。雷达/降水和 S2S 都应并列谱能量、对象位移/生命周期、阈值尾部和异常相关，而非只用 RMSE/CSI 均值。
3. **集合成员应按互补误差选，不按单体榜单机械排序。** Solafune 结果支持异构架构进入组合，但权重拟合必须 outer cross-fit，并在未参与选择的地域/时期验证；同一公开榜单反复提交不等于独立泛化。
4. **开放环、闭合环和业务再初始化必须分列。** 海雾论文证明闭合环一分钟吸收观测会极大改变问题难度。雷达临近预报、CAMS 订正和 S2S 混合均应明确何时能得到新观测、何时只能递归自己的输出。
5. **不确定性区间必须做覆盖率审计。** MC dropout 的“95%”只是构造方式；还要按时效、强度、天气型报告 empirical coverage、平均区间宽度、PIT/reliability 和极端漏报，避免把宽区间自动解释为可靠。
6. **相位偏差是多时效共用诊断。** CCIC-IMERG 评估提示，绝对场日平均接近时，振幅和峰时刻仍可能错 6 h 以上。区域短时降水、气象驱动 PM2.5 和 S2S 异常都应加入相位/时段诊断，并严格使用局地有效时刻。
7. **模型臂替换要在最终系统上评分。** `globalnowcast` 应先完成 AIFS-GFS 共样本对比，再重拟合雷达平流与模式臂的交接和权重；单体更强但与平流误差高度相关时，组合仍可能退化。

## 七、后续跟进触发器

- TinyEarth：官方 EarthNet test、跨 tile/区域严格隔离、收敛训练、多随机种子、checkpoint/release，以及 residual-forecasting 后 MAE-SSIM-谱/异常共同改善。
- Solafune：6 路集合的 final/private 或未触碰地域验证、成员误差相关、最终权重/预测/LICENSE；exp066 ConvLSTM 与 attention 的完整 5-fold OOF 和榜单结果。
- `globalnowcast`：提交 AIFS/GFS 逐时效共同样本输出，核对累积量/率与 dBZ 转换，公开初始化-有效时刻清单，并在最终雷达平流-模式混合上重评。
- `AD4DVAR-radar`：标准许可证、真实雷达数据和基线清单、阈值/FSS/对象/位移指标、强对流新生失败案例、概率扩展或正式论文出现。
- 海雾 MLW：公开代码/权重、跨航次/跨海域测试、传感器缺测和海盐偏差、95% 区间覆盖与可靠性、与 NWP/业务再初始化的共同样本比较。
- CCIC-IMERG/DYAMOND：正式同行评审版本、Zenodo 代码/数据的独立重跑、更多年份/季节，以及 AI 天气模型在相同 FWP/降水相位协议下的比较。
- 空气质量 Springer 两章：全文中的明确预测时效、严格测试年份/站点、绝对指标、未来气象驱动与代码数据；LightVMD 论文/代码出现后检查其划分、因果填补和真实预报驱动。
- 机构页：只有出现模型/权重/数据/共同样本业务报告、许可证变化或明确科学解释时才升级；一般活动和旧项目回顾继续排除。

## 八、简短结论

2026-08-02 的严格窗口没有新的核心业务证据，最有用的新增是四个方法边界：慢变信号可以学到但会牺牲纹理；异构成员可以提高集合但必须独立外推；模型臂替换需要共同有效时刻和最终组合评分；开放环的不确定性必须用覆盖率而不是名义区间验证。当前研究仍应围绕同一条主线推进：先明确不同变量、尺度和时效上真正可预报的部分，再保留最新分析/动力锚定的可信结构，用残差或生成分支恢复局地细节，最后在共同样本和真实可用输入下校准不可预报部分。
