2026-07-31 大气科学 AI 研究日报#
生成与科学核验截止时间:2026-07-31 17:00(北京时间,UTC+8)。
严格滚动主窗口:2026-07-30 17:00—2026-07-31 17:00;补充缓冲窗口:2026-07-29 17:00—2026-07-30 17:00。
连续增量边界:上一期实际科学核验截止时间为 2026-07-30 13:30;本期另行审计 13:30—17:00 的 3.5 h 连续边界,避免严格 24 h 窗口造成漏检。该边界与本期缓冲窗口重叠,条目只出现一次。
去重基线:工作区截至 2026-07-30 的大气科学 AI 日报、截至 2026-07-27 的历史雷达日报、tracked_items.md与本自动化记录。
状态口径:预印本提交、期刊/会议正式记录、Crossref 建档、代码提交与网页核验分别记录;作者论文结果、仓库作者自测、机构材料与独立复现严格分开。
一、总体判断与信号地图#
本轮主窗口保留 3 个实质事件:1 篇直接面向 10–15 d 高温可预报性的 AI 天气模型比较预印本、1 组雷达平流—NWP—学习模型混合链的实测与验证修正、1 篇可迁移到强降水评价的嵌套时间窗预印本。缓冲窗口另保留 1 个 PM₂.₅ 预测题名级正式记录。WMO 第四场 AI webinar 的会后触发器已经到期,但仍没有可点击幻灯片、录像或模型材料,不算研究交付。
- 本期最强信号来自
core-s2s,但结论不是“AI 已突破两周极端预报”。 六个确定性 AI 天气模型在 10–15 d 的全球近地面温度和六次 2021–2024 年高温事件上被共同评估。FuXi 和 ArchesWeather 的全球 RMSE 最低,却伴随明显谱能量损失;AIFS 的平均误差未必最优,但在事件区的 RMSE、ACC 与尺度结构之间更平衡;IFS 的高温召回率仍高于所有 AI 模型。结果直接显示:低 RMSE、精细结构和极端覆盖不能由一个指标同时代表。 globalnowcast给出了一次有价值的负部署结果。 加入干样本后的学习模型首次在 17 个真实完整场样本上略优于 HRRR,但把它替换进现有雷达平流—HRRR 混合后,1 mm h⁻¹ 汇总 CSI 反而由 0.1698 降至 0.1619,因此没有上线。单模型分数不是系统增益;与平流分支的误差相关性会决定混合结果。- 评估协议开始触及“短时强核是否被错误拖长”。 新的嵌套时间窗框架把 1/2/4 h 强降水与 12/24 h 强降水的时间包含关系分开。两套 2–3 km 对流许可资料比 ERA5 更接近观测,却都过度耦合短时与长时极端,表现为过强时间持续性。它不是 AI 或真实预报检验,但可直接迁移到雷达临近预报与 0–72 h 降水订正。
- 空气质量线只有弱缓冲信号。 Jakarta 的 SETAR/SETAR-Tree 章节使用 2022–2023 年历史 PM₂.₅ 序列,摘要只报告 SETAR-Tree 的样本内外 MAPE 更低;没有未来气象驱动、预报时效、数值指标、代码或数据。它不能回答 CAMS/MLWP 气象误差传播。
| 研究线 | 主窗口信号 | 24–48 h 缓冲信号 | 本轮判断 |
|---|---|---|---|
core-nowcasting |
0 篇新直接论文;1 个实质基础设施状态变化 | 0 | 学习模型单独略胜 HRRR,但替换到现有混合链后降分;未部署是正确的证据边界 |
core-short-range |
0 篇新直接 AI 论文;1 篇强降水评估协议预印本 | 0 | 时间组织、有效分辨率和双重惩罚应进入 0–72 h 评价;当前证据来自再分析/回报,不是业务起报 |
core-s2s |
1 篇高价值直接预印本 | 0 | AI 可在平均误差上接近或超过动力模式,但平滑、峰值漏报和参照不统一仍限制极端预警结论 |
core-air-quality |
0 | 1 个题名与摘要级正式章节记录 | 无真实预报气象驱动、阈值事件或业务共同样本证据 |
| 横向方法与基础设施 | 2 个实质事件;1 个机构触发器到期 | 0 | 最强共同结论是:分量化评价、真实输入、部署网格和组合误差必须同时核验 |
二、新增条目表#
| 标题 | 日期(北京时间) | 研究主线 | 相关性分类 | 来源/平台 | 正式状态 | 链接 | 代码/数据状态 |
|---|---|---|---|---|---|---|---|
| Weather Emulators at the Frontier of Heat Extremes Predictability | 2026-07-30 21:54(arXiv v1) | core-s2s |
core-s2s |
arXiv | arXiv 预印本,暂无期刊信息;CC BY 4.0 | arXiv;论文所列代码仓库 | ERA5 ARCO、TIGGE/ECDS、AIFS Hugging Face 与各 AI 模型公开来源均有说明;论文所列基准代码仓库核验时返回 404,故代码内容、版本和许可证未验证 |
andrewnakas/globalnowcast:完整场学习模型、混合链替换检验与 0.1° 验证修正 |
2026-07-31 08:07—15:43(4 次提交) | 连接 core-nowcasting 与 core-short-range |
infrastructure |
GitHub / 仓库作者自测 | 代码与结果状态变化;无论文、正式 release 或独立复现 | 仓库;混合链检验;部署网格修正;扫参错误修正;全单元排序 | 评估脚本、JSON/日志和概率匹配表公开;被评估的 nowcast_frame_g0.onnx 未在当前树中找到;仓库无独立 LICENSE、tag/release 或固定跨季节样本清单 |
| A nested time-window framework for evaluating sub-daily precipitation extremes in two convection permitting model datasets | 2026-07-30(公开讨论;Crossref 约 23:32 建档) | 连接 core-short-range 与临近预报评价 |
infrastructure |
EGUsphere / Copernicus | EGUsphere 预印本,正在 NHESS 公开讨论与审稿;CC BY 4.0 | 论文与公开讨论页 | 两套 CPM 资料与两地雨量站数据给出公开入口;未提供专用分析代码或冻结样本包 |
| SETAR and SETAR-Tree Methods for PM2.5 Air Quality Forecasting | 2026-07-30 14:25(Crossref 建档,严格缓冲窗口) | 连接 core-air-quality |
metadata-only |
Springer / ISBIS 书章 | Springer 章节页已上线且为订阅内容;官方页标 2027,Crossref 标 2026-07-31,日期口径不一致 | Springer 章节;DOI | 摘要可读;无代码、数据、拆分、绝对指标、许可或可复现实验包 |
24–48 h 缓冲窗口#
严格缓冲窗口中仅保留 Jakarta PM₂.₅ 章节这一条新元数据事件。它同时位于上一期截止后的连续边界内,因此没有漏检,也不重复计数。两篇 SSRN 空气质量稿虽然在缓冲窗口由 Crossref 重新建档,但 SSRN 官方页分别显示早在 2026-04-28 和 2026-05-05 发布,归入后文 window-out。上一期已经记录的 IMDAA、WindCastNet、CCAM 等条目不重复抄写。
三、四条核心研究线#
3.1 core-nowcasting:模型首次单独胜过 HRRR,但没有胜过现有混合链#
本轮没有发现新的 0–3 h 雷达/降水概率集合论文、权重或独立业务验证。最直接的实质变化来自 globalnowcast,但应把 CONUS 1–6 h 混合、全球 0.1° 产品和 GFS 长时效订正分开理解。
任务、数据与训练变化#
仓库中的完整场模型以最近雷达场和 HRRR 预报为输入,生成未来 1–6 h 降水/反射率场。此前只保留湿区 tile 的训练样本,导致 tile 验证为正、真实完整场为负。新模型改用 35,600 个序列并保留约 35% 的干窗口,使训练分布更接近运行场。当前提交给出 17 个 2026-07-21—28 的实时完整场样本,评价阈值为 1、4 和 8 mm h⁻¹;这是仓库作者自测,不是独立复现。
作者仓库报告效果与部署决定#
- 学习模型经概率匹配后,在 1 mm h⁻¹、+1—6 h 汇总 CSI 为 0.1549,HRRR 为 0.1490;提交说明中的另一汇总口径为 0.1552 对 0.1490,约提高 4%。
- 现有 CONUS 产品把雷达平流逐渐交给 HRRR,约 120 min 为交接尺度。保持平流分支不变、只用学习模型替换 HRRR 分支后,1 mm h⁻¹ 汇总 CSI 从 0.1698 降至 0.1619(-4.6%);4 和 8 mm h⁻¹ 也分别由 0.0692/0.0370 降至 0.0552/0.0273。
- 因此该模型没有部署。仓库作者给出的解释是:概率匹配使学习模型与平流分支的气候分布和误差更相关;HRRR 单独略弱,却为组合提供更多独立信息。这个判断合理,但仍需更多事件和误差协方差诊断。
这组结果比“学习模型超过 HRRR”更重要:混合系统优化的是组合后的条件误差,而不是每个分支的单项排名。对雷达—NWP 融合、FGOALS—AI 混合和 CAMS—ML 订正,都应报告单支、替换试验和最终组合三套共同样本结果。
验证链修正:部署网格和扫参程序曾不一致#
随后三次提交修复了另一条全球产品验证链:
- 产品已经使用 0.1° 网格,验证仍在旧的 0.25° 网格上运行;观测、光流像素尺度、反经线处理和 GFS 插值均与部署不一致。
- Python 默认参数在函数定义时绑定,使交接时刻扫参实际被冻结;例行扫参曾反复比较同一个配置。
- 修复后,0.1°、4 d 样本在 20 dBZ 阈值上显示:+30 min 雷达平流 CSI 约 0.584,GFS 约 0.217;GFS 频率偏差约 1.72–1.91。若只看 20 dBZ 和长时效,较短交接看似占优;在产品实际显示的 5 dBZ 阈值上,过早交接明显失败。对 20 个“时效 × 阈值”单元排序后,现行 360 min 全球交接在平均排名上仍最好,因此参数不变。
这里没有新的科学模型突破,但有明确的基础设施价值:验证网格必须等于部署网格;扫参必须证明参数真的变化;交接参数不能只在一个阈值或一个时效上选择。
代码、许可与剩余不确定性#
当前提交公开了评估脚本、结果 JSON/日志和概率匹配表,但仓库 API 未找到被评估的 ml/model/nowcast_frame_g0.onnx,根目录也没有独立 LICENSE。17 个样本集中在一个夏季短窗口,尚不足以覆盖热带、中纬度、干湿季、不同雷达缺测和强对流生命周期;4/8 mm h⁻¹ 结果仍明显偏弱。下一步需要冻结样本清单、提交权重与许可证、扩展跨季节共同样本,并直接报告分支误差相关、FSS、位移和可靠性。
3.2 core-short-range:新信号是评价协议,不是新的 AI 业务预报#
严格主窗口未发现新的 0–72 h 高分辨率 AI 降水订正或雷达—模式融合论文。EGUsphere 预印本提供的是两套对流许可再分析/回报资料的验证框架,不含起报时刻或预报时效,不能写成短期预报技能。
来源、数据与共同样本#
论文于 2026-07-30 进入 EGUsphere 公开讨论,状态为正在 NHESS 审稿的预印本,全文与图件采用 CC BY 4.0。研究使用 2014-01-01—2023-12-31 的共同样本:
- VHR-REA_IT:ERA5 单层嵌套驱动 COSMO-CLM,约 2.2 km;原资料覆盖 1981–2024;
- LAM-HIND:ERA5 → BOLAM → 非静力 MOLOCH 双层嵌套,约 2.7 km;原资料覆盖 1979–2019;
- ERA5:0.25°,作为粗分辨率参照;
- Emilia-Romagna 与 Campania 高频雨量站:质量控制后分别保留 89 和 140 站;缺测超过 10 d、日雨量超过 500 mm 和温度低于 2°C 的降水被排除。
模式小时降水经双线性插值到站点;极端定义为每站湿小时(>0 mm)的第 95 百分位,累计时间窗为 1、2、4、12 和 24 h。点—格比较仍受有效分辨率和“双重惩罚”影响,论文也明确区分了 2.2/2.7 km 网格距与约四倍网格距的有效分辨率。
方法与作者报告结果#
嵌套时间窗框架不只问“某个 1 h 极端是否命中”,还计算短时间窗极端(STWE)有多少被包含在较长时间窗极端(LTWE)内。观测中只有约 7%–15% 的 1 h 极端落在 24 h 极端期间,说明短时强核和长时累计并不等价。
两套 CPM 对这种跨尺度时间组织的再现明显优于 ERA5,但都高估 STWE—LTWE 的联系,即把短促强降水过多延长到较长累计窗。LAM-HIND 的探测和事件重叠略高,同时虚警与跨时间窗耦合偏强;VHR-REA_IT 更接近观测中的短—长时关联。差异可能来自嵌套策略、有效分辨率、湍流通量表示和双重惩罚,论文没有把其中任何一个归因为已证实机制。
与当前研究的连接、可借鉴点与边界#
该框架可直接加入雷达临近预报、区域降水订正和生成式降尺度:分别评价 10–60 min 强核、1–4 h 组织体和 12–24 h 累计,检查模型是否通过“拖长生命史”换取累计量命中。它也适合检验 diffusion/flow matching 是否只恢复局部高值,却错误维持过久。
数据入口公开,但论文没有专用代码或冻结后的站点—网格共同样本包;当前比较是历史再分析/回报,不涉及真实起报、未来驱动或集合概率。图件本期未镜像:代表图额度优先用于直接 core-s2s 论文,原论文与具体图件可在EGUsphere 页面查看。
3.3 core-s2s:10–15 d 高温预测暴露“低误差—谱真实性—极端召回”的三方张力#
来源与正式状态#
Weather Emulators at the Frontier of Heat Extremes Predictability 于 2026-07-30 13:54:53 UTC 提交 arXiv v1,目前只有 arXiv 预印本身份,暂无期刊信息。论文与具体图件明确采用 CC BY 4.0。
科学任务、模型与数据#
研究比较六个确定性 AI 天气模型——Pangu-Weather、FuXi、ArchesWeather、AIFS、GraphCast 和 Aurora——与 ECMWF IFS、CMA GRAPES、NCEP GEFS v12 三个动力系统,以及 ERA5 气候态和持续性。目标为 10–15 d 的全球陆地 2 m 温度与六次 2021–2024 年高温事件;所有事件晚于各 AI 模型最晚 2020 年的训练资料。
每个 AI 模型生成 392 个固定时效回报,覆盖每日 00/06/12/18 UTC 初始化和六个事件期;只提供 00/12 UTC 的 IFS 与 CMA 各有 196 个样本。除 1.5°、24 h 步长的 ArchesWeather 外,AI 模型主要为 0.25°、6 h;TIGGE 动力资料统一到 0.5°、6 h。
绝对温度与异常必须分开理解:异常均相对 ERA5 1990–2019 气候态;高温阈值为目标格点/时段 T ≥ μ + 2σ。AI 模型以 ERA5 为参照,三个动力系统却以各自同一有效时刻的 fc0 初始状态为参照。这减少了模式自身气候偏差,却使 AI—动力的绝对公平比较不完全统一,是本论文最重要的评估边界之一。
训练/测试方式与指标#
论文不重新训练模型,而是调用公开实现和权重进行回报。全球指标包括 RMSE、R²、ACC、时间相关和谱分数;极端事件另有 accuracy、precision、recall、ETS 与条件概率。作者把固定时效序列与单次连续 rollout 分开,避免把不同初始化拼接后的高变率误读为单条预报轨迹的活动度。
作者报告效果#
- 10–15 d 平均下,FuXi 和 ArchesWeather 的全球 RMSE 分别比气候态低 8.0% 和 5.3%,是仅有的两个持续超过气候态 RMSE 的 AI 模型;FuXi 在 15 d 仍低约 3%。
- 低 RMSE 伴随结构损失。FuXi 与 ArchesWeather 的谱分数明显较差;FuXi 在 10→11 d 的谱技能突降与其 0–5/5–10/10–15 d 三级模型切换一致。ArchesWeather 使用四个随机种子输出的 microensemble 均值,本身会平均掉不可预报的小尺度和极端。
- AIFS 的全球平均误差不是最优,但在高温事件区的 RMSE 与 ACC 最平衡,且 AI 模型中谱真实性最好。作者六城市案例称 AIFS 相对气候态降低 RMSE 41.5%,但多数峰值仍被低估;这是作者报告,不是独立复现。
- AIFS 的极端召回率由 10 d 的 17.7% 降至 15 d 的 11.2%,预测的全球极端面积约为参照的 65%。IFS 的召回率高于所有 AI 模型。所有模型仍有低但为正的 ETS,说明存在可利用信号,但远未达到完整极端覆盖。
代码、权重、数据与许可#
ERA5 使用公开 ARCO 数据;IFS、GRAPES 和 GEFS 来自 TIGGE/ECDS;AIFS 使用 ecmwf/aifs-single-0.2.1,其余模型引用各自公开 GitHub/项目实现。论文写明全部基准代码位于 Cas-Dec/HEAT-S2S-Benchmarking,但本轮 GitHub API 与网页端点均返回 404,故不能把“论文声明可用”升级为已核验公开代码,也无法确认版本锁定和许可证。
技术判断、可借鉴点与剩余不确定性#
这篇论文与用户 S2S 研究的连接非常直接:可预报的大尺度异常可以在 10–15 d 保留,但用 L1/L2 类损失追求均值技能会把局地结构和峰值压平;生成式或集合模块应表达剩余不可预报分量,而不是把确定性平均场重新锐化。
可借鉴的评价矩阵是“绝对场 RMSE/R² + 异常 ACC + 谱分数 + 极端 precision/recall/ETS + 事件区共同样本”。迁移到多动力模式或 FGOALS 案例时,应统一有效时刻、网格、参照和共同样本,另列 ERA5 参照与各模式自身分析参照,不能混成一个排行榜。
论文只覆盖六次近期高温、只评估确定性模型;AIFS-CRPS、GenCast、ArchesWeatherGen 等集合模型因可访问性和算力被排除。SST、土壤湿度、积雪、植被和海冰等慢变量没有被系统诊断,六城市结果也不足以代表区域业务可靠性。
3.4 core-air-quality:缓冲条目仍停留在单变量历史序列#
Springer 官方章节页确认 SETAR and SETAR-Tree Methods for PM2.5 Air Quality Forecasting 面向 DKI Jakarta 的日 PM₂.₅ 预测,数据来自空气质量站 2022-01—2023-11。模型均为自激阈值自回归类时间序列方法,SETAR-Tree 用树结构选择分段状态;摘要只报告其样本内和样本外 MAPE 低于 SETAR,没有数值。
正式状态需要保守表述:章节页已经上线并标注 Business and Industrial Statistics、ISBIS 与出版年 2027,Crossref 则于 2026-07-30 14:25 +08 建档并给出 2026-07-31 发表日期。日期不一致,因此本期把它作为缓冲窗口 metadata-only,不把 Crossref 建档时间写成确定的正式上线时刻。
当前一手摘要没有给出预测步长、训练/测试边界、站点数、缺测处理、绝对 MAPE、气象变量或未来气象来源;章节为订阅内容,未发现代码、数据或许可。它与用户空气质量研究的连接只在“PM₂.₅ 时间序列基线”:可作为低成本自回归对照,但不能评价 CAMS/MLWP 驱动误差、沙尘阈值、空间传输或概率不确定性。
**图件未镜像:**Springer 页面未给出允许本站复制具体图件的 CC 许可;可查看原始章节页。
四、相关方法与基础设施#
4.1 本轮可复用的评价与部署规则#
- 分量不能由单一平均分数代替。 S2S 高温比较同时出现“FuXi 平均误差最低、AIFS 事件与谱更平衡、IFS 召回最高”;三者回答不同问题。
- 模型替换必须在最终组合上评分。
globalnowcast的学习模型单独超过 HRRR,却降低雷达平流—NWP 组合技能。组合价值取决于条件偏差和误差协方差。 - 部署网格是实验定义的一部分。 0.25° 上拟合的交接策略不能直接用于 0.1° 产品;像素尺度、平流位移、反经线和插值都随网格改变。
- 强核持续时间需要单独诊断。 嵌套时间窗可识别模型是否把 1 h 爆发错误扩展为 12/24 h 持续降水,这一偏差可能被累计量指标掩盖。
- 概率匹配只校准边际分布。 它不能保证高值位置、生命史或与其他分支的误差独立性;生成式模型还需 reliability、CRPS、覆盖率和集合离散度。
4.2 代码、数据与检索基础设施状态#
- GitHub 主线检查未发现 WaveCastNet 的真实代码发布、WindCastNet 仓库恢复或 IMDAA 仓库新增;
holys519/solafune_precipitation_nowcasting在本窗口没有新提交。 - HeatPre 的 DOI 目前重定向到 IEEE 记录并返回空的 202 响应,仍无可解析摘要或正文,状态不变。
- OpenAlex 在本轮多次返回 429;Hugging Face 公共搜索首个查询正常、后续匿名请求返回 401。没有条目仅因这些受限源而被认定为“不存在”;保留项均由 arXiv、Copernicus、Springer、Crossref 或 GitHub 一手来源复核。
五、机构信号、仅元数据、窗口外与排除项#
5.1 institution-signal#
WMO 第四场 AI webinar 已于 2026-07-30 12:00–13:00 UTC(北京时间 20:00–21:00)结束。官方页面列出三个主题:智利浮动光伏水体蒸发估计、阿根廷 NWP 太阳辐射 MLP 订正、南美可再生能源图集 AI 降尺度。页面资源列出现 “presentation(pdf), recording” 字样,但三项均没有可点击链接;官方 Vimeo showcase 也未检索到第四场标题或录像。因此状态更新为“活动已结束、成果物未公开”,不能写成模型、数据或业务验证发布。
WMO AI webinars
同一主窗口检查 Google DeepMind、ECMWF、NOAA、Met Office、中国气象局和 Copernicus/CAMS 官方页面,未发现新的四条主线模型、权重、数据集、共同样本定量验证或代码发布。宽泛 AI 治理、能源服务议程和旧项目页不补入更新列表。
5.2 metadata-only#
- **SETAR / SETAR-Tree Jakarta PM₂.₅:**缓冲窗口正式元数据与摘要可得,日期口径冲突、实验细节不足,暂不升级。
- **HeatPre / IEEE JIoT:**昨日已跟踪;本轮 DOI 仍无可解析摘要/正文,未发现代码、权重、数据或边缘硬件指标,不重复列为新增。
5.3 window-out#
- Attention-Enhanced Spatio-Temporal Graph Convolutional Network for Interpretable Multi-Source Air Quality Forecasting(SSRN DOI
10.2139/ssrn.6586439)虽在缓冲窗口由 Crossref 重建档,SSRN 官方页显示 2026-04-28 已发布。摘要描述 Nanjing 2020–2022、13 站、网格气象与 POI、3/6/12 h,但没有真实未来气象输入的证据;不冒充本期新增。 - An End-to-End Air Quality Prediction System Using Temporal Fusion Transformer with Multi-Horizon Forecasting(SSRN DOI
10.2139/ssrn.6622198)同样由 Crossref 重建档,官方页显示 2026-05-05 已发布,且摘要说明使用模拟的 2021–2024 小时数据;不作为真实空气质量预报证据。
5.4 low-value-exclusion#
- Class Imbalance in Machine Learning for Weather and Rainfall Prediction: A PRISMA-Aligned Systematic Review(DOI
10.32628/ijsrst2613425)于主窗口建档。当前只能核验题名、作者、期刊与日期,未取得可审计检索式、纳入表、数据或新实验;它是一般综述,不提供四条主线的新模型、共同样本或业务证据,保留为稳定排除。 - 只更新动画、当前预报图、日志或展示页而没有模型、权重、数据、许可、结果或科学解释变化的仓库不计为新事件。
- 太阳能功率、一般环境分类、LLM 气象服务和不含预测/气象驱动/评估的环境 AI 不纳入四条核心研究线。
六、对当前研究的具体启发#
- S2S 论文应把“保留信号”和“恢复结构”分成两组结论。 低波数异常和事件区 ACC 描述可预报信号;谱分数、局地峰值和高温面积描述结构。Hybrid 的价值应体现在二者同时改善,而不是只降低绝对场 RMSE。
- 公平多模式比较至少保留两套参照。 同一 ERA5 验证可比较实际误差,各模式自身分析/
fc0可诊断内部漂移;两者不能混成一个总排名。初始化、有效时刻、时效、共同样本与网格应写在表头。 - 生成式模型的目标应是条件分布,而不是锐化确定性均值。 高温研究显示平滑与极端漏报并存。若使用 diffusion/flow matching,应比较集合平均、成员场和分位数场,分别报告谱、CRPS、覆盖率、召回和空间对象误差。
- 融合实验要做“替换矩阵”。 分别评价动力/HRRR 分支、AI 分支、平流/持续性分支及所有组合;单支最优不等于组合最优。误差相关系数和分天气型协方差应成为混合权重依据。
- 短时降水增加生命周期诊断。 在 CSI/FSS 之外,统计 10–60 min 强核被嵌入 1/3/6/12/24 h 极端的比例,识别“位置错了”“强度弱了”和“持续太久”三类失真。
- 空气质量仍应优先解决驱动真实性。 至少建立分析气象、真实 CAMS/MLWP 预报气象和理想未来气象三组共同样本;单变量自回归只作为下限基线,不能替代气象误差传播实验。
七、后续跟进触发器#
- 高温 S2S 基准:
Cas-Dec/HEAT-S2S-Benchmarking公开可访问并提供版本、环境、许可证和固定事件清单;加入 AIFS-CRPS、GenCast 或 ArchesWeatherGen;在统一 ERA5 与统一共同样本下复现极端召回、谱分数和城市结果。 - **
globalnowcast:**提交nowcast_frame_g0.onnx、训练配置和独立 LICENSE;将 17 个实时样本扩展到跨季节/跨天气型;报告模型—平流误差相关、FSS、位移与可靠性;IMERG cross-truth 得到可复核结果。 - **嵌套时间窗框架:**公开分析代码和冻结站点清单;迁移到真正有初始化与时效的 0–3 h 雷达、0–24 h NWP/AI 共同样本,并与对象生命史和邻域评分联合。
- **SETAR PM₂.₅:**全文或补充材料可得后核验预报步长、拆分、绝对 MAPE、缺测、站点、数据访问和代码;若无真实未来气象,继续只作自回归基线。
- **WMO 第四场 webinar:**出现可点击 PDF、录像、代码、数据或共同样本定量验证后再升级;仅网页资源占位文字不触发。
- **既有等待项:**HeatPre 摘要/正文、WaveCastNet 真实代码/权重、WindCastNet 仓库恢复、IMDAA 可移植环境与独立观测验证出现时再更新,不因页面重抓重复记录。
八、简短结论#
本期的直接新成果集中在 10–15 d 高温预测,而不是雷达或空气质量。最重要的科学信息是:低平均误差可以与谱平滑并存,事件区技能可以与极端漏报并存,单模型改进也可以在混合系统中转为退化。 因而用户的多时效研究应继续沿同一证据链推进:先用统一初始化、有效时刻和共同样本识别真正可预报的信息,再用谱与生命周期评价精细结构,最后以集合可靠性表达不可预报部分。