大气科学 AI 4 核心主线

2026-07-31 大气科学 AI 研究日报

本轮主窗口保留 3 个实质事件 :1 篇直接面向 10–15 d 高温可预报性的 AI 天气模型比较预印本、1 组雷达平流—NWP—学习模型混合链的实测与验证修正、1 篇可迁移到强降水评价的嵌套时间窗预印本。缓冲窗口另保留 1 个 PM₂.₅ 预测题名级正式记录 。WMO 第四场 AI webinar 的会后触发器已经到期,但仍没有可点击幻灯片、录像或模型材料,不算研究交付。 1. 本期最强信号来自 core-s2s ,但结论不是“AI…

4 条表格状态 下载原始 Markdown ↓
本篇目录(19 节)

2026-07-31 大气科学 AI 研究日报#

生成与科学核验截止时间:2026-07-31 17:00(北京时间,UTC+8)。
严格滚动主窗口:2026-07-30 17:00—2026-07-31 17:00;补充缓冲窗口:2026-07-29 17:00—2026-07-30 17:00。
连续增量边界:上一期实际科学核验截止时间为 2026-07-30 13:30;本期另行审计 13:30—17:00 的 3.5 h 连续边界,避免严格 24 h 窗口造成漏检。该边界与本期缓冲窗口重叠,条目只出现一次。
去重基线:工作区截至 2026-07-30 的大气科学 AI 日报、截至 2026-07-27 的历史雷达日报、tracked_items.md 与本自动化记录。
状态口径:预印本提交、期刊/会议正式记录、Crossref 建档、代码提交与网页核验分别记录;作者论文结果、仓库作者自测、机构材料与独立复现严格分开。

一、总体判断与信号地图#

本轮主窗口保留 3 个实质事件:1 篇直接面向 10–15 d 高温可预报性的 AI 天气模型比较预印本、1 组雷达平流—NWP—学习模型混合链的实测与验证修正、1 篇可迁移到强降水评价的嵌套时间窗预印本。缓冲窗口另保留 1 个 PM₂.₅ 预测题名级正式记录。WMO 第四场 AI webinar 的会后触发器已经到期,但仍没有可点击幻灯片、录像或模型材料,不算研究交付。

  1. 本期最强信号来自 core-s2s,但结论不是“AI 已突破两周极端预报”。 六个确定性 AI 天气模型在 10–15 d 的全球近地面温度和六次 2021–2024 年高温事件上被共同评估。FuXi 和 ArchesWeather 的全球 RMSE 最低,却伴随明显谱能量损失;AIFS 的平均误差未必最优,但在事件区的 RMSE、ACC 与尺度结构之间更平衡;IFS 的高温召回率仍高于所有 AI 模型。结果直接显示:低 RMSE、精细结构和极端覆盖不能由一个指标同时代表。
  2. globalnowcast 给出了一次有价值的负部署结果。 加入干样本后的学习模型首次在 17 个真实完整场样本上略优于 HRRR,但把它替换进现有雷达平流—HRRR 混合后,1 mm h⁻¹ 汇总 CSI 反而由 0.1698 降至 0.1619,因此没有上线。单模型分数不是系统增益;与平流分支的误差相关性会决定混合结果。
  3. 评估协议开始触及“短时强核是否被错误拖长”。 新的嵌套时间窗框架把 1/2/4 h 强降水与 12/24 h 强降水的时间包含关系分开。两套 2–3 km 对流许可资料比 ERA5 更接近观测,却都过度耦合短时与长时极端,表现为过强时间持续性。它不是 AI 或真实预报检验,但可直接迁移到雷达临近预报与 0–72 h 降水订正。
  4. 空气质量线只有弱缓冲信号。 Jakarta 的 SETAR/SETAR-Tree 章节使用 2022–2023 年历史 PM₂.₅ 序列,摘要只报告 SETAR-Tree 的样本内外 MAPE 更低;没有未来气象驱动、预报时效、数值指标、代码或数据。它不能回答 CAMS/MLWP 气象误差传播。
研究线 主窗口信号 24–48 h 缓冲信号 本轮判断
core-nowcasting 0 篇新直接论文;1 个实质基础设施状态变化 0 学习模型单独略胜 HRRR,但替换到现有混合链后降分;未部署是正确的证据边界
core-short-range 0 篇新直接 AI 论文;1 篇强降水评估协议预印本 0 时间组织、有效分辨率和双重惩罚应进入 0–72 h 评价;当前证据来自再分析/回报,不是业务起报
core-s2s 1 篇高价值直接预印本 0 AI 可在平均误差上接近或超过动力模式,但平滑、峰值漏报和参照不统一仍限制极端预警结论
core-air-quality 0 1 个题名与摘要级正式章节记录 无真实预报气象驱动、阈值事件或业务共同样本证据
横向方法与基础设施 2 个实质事件;1 个机构触发器到期 0 最强共同结论是:分量化评价、真实输入、部署网格和组合误差必须同时核验

二、新增条目表#

标题 日期(北京时间) 研究主线 相关性分类 来源/平台 正式状态 链接 代码/数据状态
Weather Emulators at the Frontier of Heat Extremes Predictability 2026-07-30 21:54(arXiv v1) core-s2s core-s2s arXiv arXiv 预印本,暂无期刊信息;CC BY 4.0 arXiv论文所列代码仓库 ERA5 ARCO、TIGGE/ECDS、AIFS Hugging Face 与各 AI 模型公开来源均有说明;论文所列基准代码仓库核验时返回 404,故代码内容、版本和许可证未验证
andrewnakas/globalnowcast:完整场学习模型、混合链替换检验与 0.1° 验证修正 2026-07-31 08:07—15:43(4 次提交) 连接 core-nowcastingcore-short-range infrastructure GitHub / 仓库作者自测 代码与结果状态变化;无论文、正式 release 或独立复现 仓库混合链检验部署网格修正扫参错误修正全单元排序 评估脚本、JSON/日志和概率匹配表公开;被评估的 nowcast_frame_g0.onnx 未在当前树中找到;仓库无独立 LICENSE、tag/release 或固定跨季节样本清单
A nested time-window framework for evaluating sub-daily precipitation extremes in two convection permitting model datasets 2026-07-30(公开讨论;Crossref 约 23:32 建档) 连接 core-short-range 与临近预报评价 infrastructure EGUsphere / Copernicus EGUsphere 预印本,正在 NHESS 公开讨论与审稿;CC BY 4.0 论文与公开讨论页 两套 CPM 资料与两地雨量站数据给出公开入口;未提供专用分析代码或冻结样本包
SETAR and SETAR-Tree Methods for PM2.5 Air Quality Forecasting 2026-07-30 14:25(Crossref 建档,严格缓冲窗口) 连接 core-air-quality metadata-only Springer / ISBIS 书章 Springer 章节页已上线且为订阅内容;官方页标 2027,Crossref 标 2026-07-31,日期口径不一致 Springer 章节DOI 摘要可读;无代码、数据、拆分、绝对指标、许可或可复现实验包

24–48 h 缓冲窗口#

严格缓冲窗口中仅保留 Jakarta PM₂.₅ 章节这一条新元数据事件。它同时位于上一期截止后的连续边界内,因此没有漏检,也不重复计数。两篇 SSRN 空气质量稿虽然在缓冲窗口由 Crossref 重新建档,但 SSRN 官方页分别显示早在 2026-04-28 和 2026-05-05 发布,归入后文 window-out。上一期已经记录的 IMDAA、WindCastNet、CCAM 等条目不重复抄写。

三、四条核心研究线#

3.1 core-nowcasting:模型首次单独胜过 HRRR,但没有胜过现有混合链#

本轮没有发现新的 0–3 h 雷达/降水概率集合论文、权重或独立业务验证。最直接的实质变化来自 globalnowcast,但应把 CONUS 1–6 h 混合、全球 0.1° 产品和 GFS 长时效订正分开理解。

任务、数据与训练变化#

仓库中的完整场模型以最近雷达场和 HRRR 预报为输入,生成未来 1–6 h 降水/反射率场。此前只保留湿区 tile 的训练样本,导致 tile 验证为正、真实完整场为负。新模型改用 35,600 个序列并保留约 35% 的干窗口,使训练分布更接近运行场。当前提交给出 17 个 2026-07-21—28 的实时完整场样本,评价阈值为 1、4 和 8 mm h⁻¹;这是仓库作者自测,不是独立复现。

作者仓库报告效果与部署决定#

  • 学习模型经概率匹配后,在 1 mm h⁻¹、+1—6 h 汇总 CSI 为 0.1549,HRRR 为 0.1490;提交说明中的另一汇总口径为 0.1552 对 0.1490,约提高 4%。
  • 现有 CONUS 产品把雷达平流逐渐交给 HRRR,约 120 min 为交接尺度。保持平流分支不变、只用学习模型替换 HRRR 分支后,1 mm h⁻¹ 汇总 CSI 从 0.1698 降至 0.1619(-4.6%);4 和 8 mm h⁻¹ 也分别由 0.0692/0.0370 降至 0.0552/0.0273。
  • 因此该模型没有部署。仓库作者给出的解释是:概率匹配使学习模型与平流分支的气候分布和误差更相关;HRRR 单独略弱,却为组合提供更多独立信息。这个判断合理,但仍需更多事件和误差协方差诊断。

这组结果比“学习模型超过 HRRR”更重要:混合系统优化的是组合后的条件误差,而不是每个分支的单项排名。对雷达—NWP 融合、FGOALS—AI 混合和 CAMS—ML 订正,都应报告单支、替换试验和最终组合三套共同样本结果。

验证链修正:部署网格和扫参程序曾不一致#

随后三次提交修复了另一条全球产品验证链:

  1. 产品已经使用 0.1° 网格,验证仍在旧的 0.25° 网格上运行;观测、光流像素尺度、反经线处理和 GFS 插值均与部署不一致。
  2. Python 默认参数在函数定义时绑定,使交接时刻扫参实际被冻结;例行扫参曾反复比较同一个配置。
  3. 修复后,0.1°、4 d 样本在 20 dBZ 阈值上显示:+30 min 雷达平流 CSI 约 0.584,GFS 约 0.217;GFS 频率偏差约 1.72–1.91。若只看 20 dBZ 和长时效,较短交接看似占优;在产品实际显示的 5 dBZ 阈值上,过早交接明显失败。对 20 个“时效 × 阈值”单元排序后,现行 360 min 全球交接在平均排名上仍最好,因此参数不变。

这里没有新的科学模型突破,但有明确的基础设施价值:验证网格必须等于部署网格;扫参必须证明参数真的变化;交接参数不能只在一个阈值或一个时效上选择。

代码、许可与剩余不确定性#

当前提交公开了评估脚本、结果 JSON/日志和概率匹配表,但仓库 API 未找到被评估的 ml/model/nowcast_frame_g0.onnx,根目录也没有独立 LICENSE。17 个样本集中在一个夏季短窗口,尚不足以覆盖热带、中纬度、干湿季、不同雷达缺测和强对流生命周期;4/8 mm h⁻¹ 结果仍明显偏弱。下一步需要冻结样本清单、提交权重与许可证、扩展跨季节共同样本,并直接报告分支误差相关、FSS、位移和可靠性。

3.2 core-short-range:新信号是评价协议,不是新的 AI 业务预报#

严格主窗口未发现新的 0–72 h 高分辨率 AI 降水订正或雷达—模式融合论文。EGUsphere 预印本提供的是两套对流许可再分析/回报资料的验证框架,不含起报时刻或预报时效,不能写成短期预报技能。

来源、数据与共同样本#

论文于 2026-07-30 进入 EGUsphere 公开讨论,状态为正在 NHESS 审稿的预印本,全文与图件采用 CC BY 4.0。研究使用 2014-01-01—2023-12-31 的共同样本:

  • VHR-REA_IT:ERA5 单层嵌套驱动 COSMO-CLM,约 2.2 km;原资料覆盖 1981–2024;
  • LAM-HIND:ERA5 → BOLAM → 非静力 MOLOCH 双层嵌套,约 2.7 km;原资料覆盖 1979–2019;
  • ERA5:0.25°,作为粗分辨率参照;
  • Emilia-Romagna 与 Campania 高频雨量站:质量控制后分别保留 89 和 140 站;缺测超过 10 d、日雨量超过 500 mm 和温度低于 2°C 的降水被排除。

模式小时降水经双线性插值到站点;极端定义为每站湿小时(>0 mm)的第 95 百分位,累计时间窗为 1、2、4、12 和 24 h。点—格比较仍受有效分辨率和“双重惩罚”影响,论文也明确区分了 2.2/2.7 km 网格距与约四倍网格距的有效分辨率。

方法与作者报告结果#

嵌套时间窗框架不只问“某个 1 h 极端是否命中”,还计算短时间窗极端(STWE)有多少被包含在较长时间窗极端(LTWE)内。观测中只有约 7%–15% 的 1 h 极端落在 24 h 极端期间,说明短时强核和长时累计并不等价。

两套 CPM 对这种跨尺度时间组织的再现明显优于 ERA5,但都高估 STWE—LTWE 的联系,即把短促强降水过多延长到较长累计窗。LAM-HIND 的探测和事件重叠略高,同时虚警与跨时间窗耦合偏强;VHR-REA_IT 更接近观测中的短—长时关联。差异可能来自嵌套策略、有效分辨率、湍流通量表示和双重惩罚,论文没有把其中任何一个归因为已证实机制。

与当前研究的连接、可借鉴点与边界#

该框架可直接加入雷达临近预报、区域降水订正和生成式降尺度:分别评价 10–60 min 强核、1–4 h 组织体和 12–24 h 累计,检查模型是否通过“拖长生命史”换取累计量命中。它也适合检验 diffusion/flow matching 是否只恢复局部高值,却错误维持过久。

数据入口公开,但论文没有专用代码或冻结后的站点—网格共同样本包;当前比较是历史再分析/回报,不涉及真实起报、未来驱动或集合概率。图件本期未镜像:代表图额度优先用于直接 core-s2s 论文,原论文与具体图件可在EGUsphere 页面查看。

3.3 core-s2s:10–15 d 高温预测暴露“低误差—谱真实性—极端召回”的三方张力#

来源与正式状态#

Weather Emulators at the Frontier of Heat Extremes Predictability 于 2026-07-30 13:54:53 UTC 提交 arXiv v1,目前只有 arXiv 预印本身份,暂无期刊信息。论文与具体图件明确采用 CC BY 4.0。

科学任务、模型与数据#

研究比较六个确定性 AI 天气模型——Pangu-Weather、FuXi、ArchesWeather、AIFS、GraphCast 和 Aurora——与 ECMWF IFS、CMA GRAPES、NCEP GEFS v12 三个动力系统,以及 ERA5 气候态和持续性。目标为 10–15 d 的全球陆地 2 m 温度与六次 2021–2024 年高温事件;所有事件晚于各 AI 模型最晚 2020 年的训练资料。

每个 AI 模型生成 392 个固定时效回报,覆盖每日 00/06/12/18 UTC 初始化和六个事件期;只提供 00/12 UTC 的 IFS 与 CMA 各有 196 个样本。除 1.5°、24 h 步长的 ArchesWeather 外,AI 模型主要为 0.25°、6 h;TIGGE 动力资料统一到 0.5°、6 h。

绝对温度与异常必须分开理解:异常均相对 ERA5 1990–2019 气候态;高温阈值为目标格点/时段 T ≥ μ + 2σ。AI 模型以 ERA5 为参照,三个动力系统却以各自同一有效时刻的 fc0 初始状态为参照。这减少了模式自身气候偏差,却使 AI—动力的绝对公平比较不完全统一,是本论文最重要的评估边界之一。

训练/测试方式与指标#

论文不重新训练模型,而是调用公开实现和权重进行回报。全球指标包括 RMSE、R²、ACC、时间相关和谱分数;极端事件另有 accuracy、precision、recall、ETS 与条件概率。作者把固定时效序列与单次连续 rollout 分开,避免把不同初始化拼接后的高变率误读为单条预报轨迹的活动度。

作者报告效果#

  • 10–15 d 平均下,FuXi 和 ArchesWeather 的全球 RMSE 分别比气候态低 8.0% 和 5.3%,是仅有的两个持续超过气候态 RMSE 的 AI 模型;FuXi 在 15 d 仍低约 3%。
  • 低 RMSE 伴随结构损失。FuXi 与 ArchesWeather 的谱分数明显较差;FuXi 在 10→11 d 的谱技能突降与其 0–5/5–10/10–15 d 三级模型切换一致。ArchesWeather 使用四个随机种子输出的 microensemble 均值,本身会平均掉不可预报的小尺度和极端。
  • AIFS 的全球平均误差不是最优,但在高温事件区的 RMSE 与 ACC 最平衡,且 AI 模型中谱真实性最好。作者六城市案例称 AIFS 相对气候态降低 RMSE 41.5%,但多数峰值仍被低估;这是作者报告,不是独立复现。
  • AIFS 的极端召回率由 10 d 的 17.7% 降至 15 d 的 11.2%,预测的全球极端面积约为参照的 65%。IFS 的召回率高于所有 AI 模型。所有模型仍有低但为正的 ETS,说明存在可利用信号,但远未达到完整极端覆盖。
十到十五天全球温度与高温事件模型比较,以及随时效变化的RMSE和谱分数
论文 Figure 3|标准误差排名与谱真实性并不一致。 原始图注:Model benchmarking results. Left panels: fixed-lead-time model forecast scores across events and averaged over lead days 10 to 15, per metric (Section 4.5). A dark blue fill denotes a model performing best for that metric, whereas a white fill denotes the opposite. For each metric, the best score is reported in white font. Metrics considered are RMSE, R2, ACC, temporal correlation and spectral score (Section 4.5). Global subpanel: evaluation for all surface temperature data over global land area. Events subpanel: evaluation bounded to the event boxes, and restricted to the affected (red-hued) regions in Figure 1 at times of recorded heat extremes. The spectral metric is global-only (Section 4.5), and extreme heat time series are too short to get a stable R2 estimate, which is why these metrics are reported for the global evaluation only. ACC, temporal correlation and spectral score are based on deviations from ERA5 climatology, and therefore not available for the climatological baseline (Section 4.5). Right panels: RMSE and spectral score for each model and dependency on forecast lead time. Averaging over these lead times yields the summary scores in the left panel. 作者:Cas Decancq、Thomas Mortier、Jessica Keune、Diego G. Miralles。来源:arXiv v1。许可:CC BY 4.0。本站从 CC BY 论文 PDF 中提取完整嵌入式 Figure 3,将 4393 × 2660 px 等比例缩放为 1600 × 969 px 并转换为无损 WebP;未裁剪、标注或改变面板、坐标、图例、标签与数据内容。

代码、权重、数据与许可#

ERA5 使用公开 ARCO 数据;IFS、GRAPES 和 GEFS 来自 TIGGE/ECDS;AIFS 使用 ecmwf/aifs-single-0.2.1,其余模型引用各自公开 GitHub/项目实现。论文写明全部基准代码位于 Cas-Dec/HEAT-S2S-Benchmarking,但本轮 GitHub API 与网页端点均返回 404,故不能把“论文声明可用”升级为已核验公开代码,也无法确认版本锁定和许可证。

技术判断、可借鉴点与剩余不确定性#

这篇论文与用户 S2S 研究的连接非常直接:可预报的大尺度异常可以在 10–15 d 保留,但用 L1/L2 类损失追求均值技能会把局地结构和峰值压平;生成式或集合模块应表达剩余不可预报分量,而不是把确定性平均场重新锐化。

可借鉴的评价矩阵是“绝对场 RMSE/R² + 异常 ACC + 谱分数 + 极端 precision/recall/ETS + 事件区共同样本”。迁移到多动力模式或 FGOALS 案例时,应统一有效时刻、网格、参照和共同样本,另列 ERA5 参照与各模式自身分析参照,不能混成一个排行榜。

论文只覆盖六次近期高温、只评估确定性模型;AIFS-CRPS、GenCast、ArchesWeatherGen 等集合模型因可访问性和算力被排除。SST、土壤湿度、积雪、植被和海冰等慢变量没有被系统诊断,六城市结果也不足以代表区域业务可靠性。

3.4 core-air-quality:缓冲条目仍停留在单变量历史序列#

Springer 官方章节页确认 SETAR and SETAR-Tree Methods for PM2.5 Air Quality Forecasting 面向 DKI Jakarta 的日 PM₂.₅ 预测,数据来自空气质量站 2022-01—2023-11。模型均为自激阈值自回归类时间序列方法,SETAR-Tree 用树结构选择分段状态;摘要只报告其样本内和样本外 MAPE 低于 SETAR,没有数值。

正式状态需要保守表述:章节页已经上线并标注 Business and Industrial Statistics、ISBIS 与出版年 2027,Crossref 则于 2026-07-30 14:25 +08 建档并给出 2026-07-31 发表日期。日期不一致,因此本期把它作为缓冲窗口 metadata-only,不把 Crossref 建档时间写成确定的正式上线时刻。

当前一手摘要没有给出预测步长、训练/测试边界、站点数、缺测处理、绝对 MAPE、气象变量或未来气象来源;章节为订阅内容,未发现代码、数据或许可。它与用户空气质量研究的连接只在“PM₂.₅ 时间序列基线”:可作为低成本自回归对照,但不能评价 CAMS/MLWP 驱动误差、沙尘阈值、空间传输或概率不确定性。

**图件未镜像:**Springer 页面未给出允许本站复制具体图件的 CC 许可;可查看原始章节页

四、相关方法与基础设施#

4.1 本轮可复用的评价与部署规则#

  • 分量不能由单一平均分数代替。 S2S 高温比较同时出现“FuXi 平均误差最低、AIFS 事件与谱更平衡、IFS 召回最高”;三者回答不同问题。
  • 模型替换必须在最终组合上评分。 globalnowcast 的学习模型单独超过 HRRR,却降低雷达平流—NWP 组合技能。组合价值取决于条件偏差和误差协方差。
  • 部署网格是实验定义的一部分。 0.25° 上拟合的交接策略不能直接用于 0.1° 产品;像素尺度、平流位移、反经线和插值都随网格改变。
  • 强核持续时间需要单独诊断。 嵌套时间窗可识别模型是否把 1 h 爆发错误扩展为 12/24 h 持续降水,这一偏差可能被累计量指标掩盖。
  • 概率匹配只校准边际分布。 它不能保证高值位置、生命史或与其他分支的误差独立性;生成式模型还需 reliability、CRPS、覆盖率和集合离散度。

4.2 代码、数据与检索基础设施状态#

  • GitHub 主线检查未发现 WaveCastNet 的真实代码发布、WindCastNet 仓库恢复或 IMDAA 仓库新增;holys519/solafune_precipitation_nowcasting 在本窗口没有新提交。
  • HeatPre 的 DOI 目前重定向到 IEEE 记录并返回空的 202 响应,仍无可解析摘要或正文,状态不变。
  • OpenAlex 在本轮多次返回 429;Hugging Face 公共搜索首个查询正常、后续匿名请求返回 401。没有条目仅因这些受限源而被认定为“不存在”;保留项均由 arXiv、Copernicus、Springer、Crossref 或 GitHub 一手来源复核。

五、机构信号、仅元数据、窗口外与排除项#

5.1 institution-signal#

WMO 第四场 AI webinar 已于 2026-07-30 12:00–13:00 UTC(北京时间 20:00–21:00)结束。官方页面列出三个主题:智利浮动光伏水体蒸发估计、阿根廷 NWP 太阳辐射 MLP 订正、南美可再生能源图集 AI 降尺度。页面资源列出现 “presentation(pdf), recording” 字样,但三项均没有可点击链接;官方 Vimeo showcase 也未检索到第四场标题或录像。因此状态更新为“活动已结束、成果物未公开”,不能写成模型、数据或业务验证发布。
WMO AI webinars

同一主窗口检查 Google DeepMind、ECMWF、NOAA、Met Office、中国气象局和 Copernicus/CAMS 官方页面,未发现新的四条主线模型、权重、数据集、共同样本定量验证或代码发布。宽泛 AI 治理、能源服务议程和旧项目页不补入更新列表。

5.2 metadata-only#

  • **SETAR / SETAR-Tree Jakarta PM₂.₅:**缓冲窗口正式元数据与摘要可得,日期口径冲突、实验细节不足,暂不升级。
  • **HeatPre / IEEE JIoT:**昨日已跟踪;本轮 DOI 仍无可解析摘要/正文,未发现代码、权重、数据或边缘硬件指标,不重复列为新增。

5.3 window-out#

  • Attention-Enhanced Spatio-Temporal Graph Convolutional Network for Interpretable Multi-Source Air Quality Forecasting(SSRN DOI 10.2139/ssrn.6586439)虽在缓冲窗口由 Crossref 重建档,SSRN 官方页显示 2026-04-28 已发布。摘要描述 Nanjing 2020–2022、13 站、网格气象与 POI、3/6/12 h,但没有真实未来气象输入的证据;不冒充本期新增。
  • An End-to-End Air Quality Prediction System Using Temporal Fusion Transformer with Multi-Horizon Forecasting(SSRN DOI 10.2139/ssrn.6622198)同样由 Crossref 重建档,官方页显示 2026-05-05 已发布,且摘要说明使用模拟的 2021–2024 小时数据;不作为真实空气质量预报证据。

5.4 low-value-exclusion#

  • Class Imbalance in Machine Learning for Weather and Rainfall Prediction: A PRISMA-Aligned Systematic Review(DOI 10.32628/ijsrst2613425)于主窗口建档。当前只能核验题名、作者、期刊与日期,未取得可审计检索式、纳入表、数据或新实验;它是一般综述,不提供四条主线的新模型、共同样本或业务证据,保留为稳定排除。
  • 只更新动画、当前预报图、日志或展示页而没有模型、权重、数据、许可、结果或科学解释变化的仓库不计为新事件。
  • 太阳能功率、一般环境分类、LLM 气象服务和不含预测/气象驱动/评估的环境 AI 不纳入四条核心研究线。

六、对当前研究的具体启发#

  1. S2S 论文应把“保留信号”和“恢复结构”分成两组结论。 低波数异常和事件区 ACC 描述可预报信号;谱分数、局地峰值和高温面积描述结构。Hybrid 的价值应体现在二者同时改善,而不是只降低绝对场 RMSE。
  2. 公平多模式比较至少保留两套参照。 同一 ERA5 验证可比较实际误差,各模式自身分析/fc0 可诊断内部漂移;两者不能混成一个总排名。初始化、有效时刻、时效、共同样本与网格应写在表头。
  3. 生成式模型的目标应是条件分布,而不是锐化确定性均值。 高温研究显示平滑与极端漏报并存。若使用 diffusion/flow matching,应比较集合平均、成员场和分位数场,分别报告谱、CRPS、覆盖率、召回和空间对象误差。
  4. 融合实验要做“替换矩阵”。 分别评价动力/HRRR 分支、AI 分支、平流/持续性分支及所有组合;单支最优不等于组合最优。误差相关系数和分天气型协方差应成为混合权重依据。
  5. 短时降水增加生命周期诊断。 在 CSI/FSS 之外,统计 10–60 min 强核被嵌入 1/3/6/12/24 h 极端的比例,识别“位置错了”“强度弱了”和“持续太久”三类失真。
  6. 空气质量仍应优先解决驱动真实性。 至少建立分析气象、真实 CAMS/MLWP 预报气象和理想未来气象三组共同样本;单变量自回归只作为下限基线,不能替代气象误差传播实验。

七、后续跟进触发器#

  • 高温 S2S 基准:Cas-Dec/HEAT-S2S-Benchmarking 公开可访问并提供版本、环境、许可证和固定事件清单;加入 AIFS-CRPS、GenCast 或 ArchesWeatherGen;在统一 ERA5 与统一共同样本下复现极端召回、谱分数和城市结果。
  • **globalnowcast:**提交 nowcast_frame_g0.onnx、训练配置和独立 LICENSE;将 17 个实时样本扩展到跨季节/跨天气型;报告模型—平流误差相关、FSS、位移与可靠性;IMERG cross-truth 得到可复核结果。
  • **嵌套时间窗框架:**公开分析代码和冻结站点清单;迁移到真正有初始化与时效的 0–3 h 雷达、0–24 h NWP/AI 共同样本,并与对象生命史和邻域评分联合。
  • **SETAR PM₂.₅:**全文或补充材料可得后核验预报步长、拆分、绝对 MAPE、缺测、站点、数据访问和代码;若无真实未来气象,继续只作自回归基线。
  • **WMO 第四场 webinar:**出现可点击 PDF、录像、代码、数据或共同样本定量验证后再升级;仅网页资源占位文字不触发。
  • **既有等待项:**HeatPre 摘要/正文、WaveCastNet 真实代码/权重、WindCastNet 仓库恢复、IMDAA 可移植环境与独立观测验证出现时再更新,不因页面重抓重复记录。

八、简短结论#

本期的直接新成果集中在 10–15 d 高温预测,而不是雷达或空气质量。最重要的科学信息是:低平均误差可以与谱平滑并存,事件区技能可以与极端漏报并存,单模型改进也可以在混合系统中转为退化。 因而用户的多时效研究应继续沿同一证据链推进:先用统一初始化、有效时刻和共同样本识别真正可预报的信息,再用谱与生命周期评价精细结构,最后以集合可靠性表达不可预报部分。