Skip to content

Berechnete Werte und ihre Güte

Die meteorologischen Reihen der Level-II-Flächen haben Lücken: Sensorausfälle, Stromausfälle, Wartung. Für Auswertungen, die durchgehende Reihen brauchen — klimatische Wasserbilanz, Verdunstung, Trockenstress — werden diese Lücken auf Tagesebene modelliert geschlossen.

Gefüllte Werte sind keine Messungen und jederzeit von Messungen zu unterscheiden. Sie ersetzen keine Messung und überschreiben keine: Kommen Messwerte später nach, tritt die Messung an ihre Stelle.

Woran man einen berechneten Wert erkennt

Jeder Tageswert trägt das ICP-Herkunftskennzeichen code_data_origin:

KennzeichenBedeutung
1gemessen (auch ein aus Stundenwerten aggregierter Tageswert)
3modelliert zur Lückenfüllung
4modelliert
9Fehlwert

In den Diagrammen des Portals sind modellierte Zeiträume flächig hinterlegt; beim Überfahren eines solchen Tages nennt die Tooltip-Zeile die Spanne („in 95 von 100 Fällen zwischen A und B") und den Wert, aus dem geschätzt wurde. Der CSV-Download führt code_data_origin als eigene Spalte mit.

Die Lückenfüllung schreibt unter der echten Sensornummer. Ältere, bereits vor diesem Verfahren gefüllte Werte liegen unter Sensornummern ab +20000; laufende Sensordaten aus der Datenfernübertragung sind mit +10000 indiziert.

Zwei Stufen

Gefüllt wird in zwei Stufen, weil die beiden Stationstypen einer Fläche verschiedene Prädiktoren verdienen.

Stufe F — Freifläche aus dem Wetterraster. Die Freiflächenstationen werden aus den regionalisierten Rasterdaten des Deutschen Wetterdienstes (HYRAS/CDC) geschätzt, ausgelesen an den Koordinaten der jeweiligen Fläche.

Stufe S — Bestand aus der Freifläche. Die Bestandesstationen werden anschließend aus der Freifläche derselben Fläche geschätzt. Das ist der bessere Prädiktor als ein Kilometerraster: gleicher Standort, gleicher Tag, gleiche Bauart der Station. Zwei Flächen ohne eigene Freifläche leihen sich die der Nachbarfläche (1207 von 1202, 1209 von 1203, 3–4 km entfernt).

Gelernt wird ausschließlich aus gemessenen Tagen. Ein Modell, das von eigenen Füllwerten lernt, würde seinen Fehler festschreiben.

Der Rechenweg

Je Fläche, Standort und Größe wird ein verallgemeinertes additives Modell (GAM, R-Paket mgcv) angepasst. y ist der gemessene Tageswert der Fläche, x der Prädiktor — in Stufe F der Rasterwert, in Stufe S der Freiflächenwert.

Stufe F. Ein glatter, nicht vorgegebener Zusammenhang zwischen Rasterwert und Messwert:

y = f(x) + ε          f: Dünnplatten-Spline, Glättung per Kreuzvalidierung

Stufe S, Temperatur und Feuchte. Zwischen Bestand und Freifläche gibt es kaum einen Niveauunterschied — ein Modell auf dem Niveau würde nur bestätigen, dass es Sommer und Winter gibt. Modelliert wird deshalb die Abweichung, mit einem zyklischen Spline über den Tag im Jahr (doy), der den Jahresgang des Kronendacheffekts trägt und zwischen 31.12. und 1.1. ohne Sprung schließt:

y − x = g(doy) + h(x) + ε        g: zyklischer Spline
ŷ     = x + ĝ(doy) + ĥ(x)

Stufe S, Globalstrahlung. Hier ist der Zusammenhang multiplikativ: Der Bestand empfängt einen Bruchteil τ der Freiflächenstrahlung, und dieser Bruchteil folgt der Belaubung (Eiche 1208: 0,77 im Winter, 0,15 im Sommer; Kiefer 1203: 0,47 / 0,29). Das Modell hat deshalb einen veränderlichen Koeffizienten:

ŷ = x · τ(doy)                   τ: zyklischer Spline

Nachbehandlung. Der Rohschätzwert wird physikalisch gekappt: Niederschlag, Strahlung und Verdunstung nicht negativ, relative Feuchte auf 0–100 %. Meldet das Raster null Millimeter Niederschlag, wird der Füllwert auf genau null gesetzt — ein glatter Zusammenhang kann keine exakten Nullen erzeugen und erzeugte sonst über das Jahr mehrere Zentimeter Phantomniederschlag.

Ein Modell braucht mindestens 180 gemeinsame Lerntage. Werte außerhalb plausibler Grenzen (AT −40…45 °C, PR 0…150 mm, RH 0…100 %, SR 0…500 W/m²) gehen nicht ins Lernmaterial ein.

Wie die Güte beurteilt wird

Maßgeblich ist nicht, wie gut ein Modell die Tage beschreibt, aus denen es gelernt hat — das fällt immer zu optimistisch aus. Maßgeblich ist die Kreuzvalidierung: Die Lernjahre werden in bis zu fünf zusammenhängende Blöcke geteilt, und jeder Block wird von einem Modell vorhergesagt, das diese Jahre nie gesehen hat. Das ist genau die Situation einer echten Lücke. Blockweise nach Jahren, nicht zufällig tageweise — aufeinanderfolgende Tage ähneln sich, eine zufällige Aufteilung würde die Güte beschönigen.

Daraus ergeben sich drei Kennzahlen je Modell:

KennzahlBedeutung
cv_r2kreuzvalidierter Anteil erklärter Varianz
cv_rmsemittlerer Fehler eines vorhergesagten Tages, in der Einheit der Größe
skillGewinn gegenüber einer trivialen Referenz
skill = 1 − MSE(Modell) / MSE(Naivreferenz)

Die Naivreferenz ist je Stufe verschieden: in Stufe F das Klimamittel, in Stufe S die unveränderte Freifläche (additiv) bzw. eine konstante Transmission (multiplikativ). Diese Kennzahl ist in Stufe S unverzichtbar, weil dort auch ein Modell, das nichts tut, ein cv_r2 von 0,99 erreicht — wenn der Prädiktor fast schon die Antwort ist, sagt das Bestimmtheitsmaß nichts mehr aus.

Geschrieben wird nur, wenn beide Bedingungen erfüllt sind: cv_r2 über der Schranke der Stufe (F: keine, S: 0,5) und skill nicht negativ. Ein Modell, das schlechter ist als die triviale Referenz seiner Stufe, füllt nicht. So werden etwa die Bestandesstrahlung an 1204 und 1205 ausgeschlossen, obwohl ihr cv_r2 bei 0,53 bzw. 0,64 liegt.

Ein niedriger skill ist in Stufe S dagegen kein Mangel: Bei der Tagesmitteltemperatur liegt er an den Kiefernflächen bei rund 0,05, weil das bloße Kopieren der Freifläche dort schon auf 0,4–0,6 K genau ist. Am Tagesminimum steigt er auf 0,36–0,75 — dort dämpft das Kronendach die Extreme, und genau das leistet das Modell.

Aktueller Stand

Stufe F, acht Freiflächen:

Größecv_r2mittlerer Fehler
Lufttemperatur0,990,72 K
relative Feuchte0,83–0,934,5 %
Niederschlag0,23–0,582,9 mm

Stufe S, acht Bestandesflächen:

Größecv_r2skill
Lufttemperatur0,98–1,000,06–0,54
relative Feuchte0,80–0,970,03–0,70
Globalstrahlung0,44–0,96−0,35–0,86

Die Temperatur lässt sich praktisch fehlerfrei übertragen, die Feuchte gut, der Niederschlag nur eingeschränkt. Das ist keine Schwäche des Verfahrens, sondern eine Eigenschaft der Größe: Ein Kilometerraster trifft konvektive Schauer nicht punktgenau.

Unsicherheit eines einzelnen Tages

Eine Kennzahl je Modell reicht nicht, um einen einzelnen gefüllten Tag zu beurteilen. Deshalb wird je Tag eine Spanne abgelegt.

Zur Unsicherheit der mittleren Beziehung (se_fit, sehr klein bei zehntausend Lerntagen) kommt die Streuung der Einzelwerte um diese Kurve (sigma):

se_pred = √(se_fit² + sigma²)

Bei der Temperatur sind das rund 0,64 K statt 0,015 K. Ein festes Band aus fit ± 2 · se_pred deckt im Mittel tatsächlich 95 % der Fälle ab — beim Niederschlag ist dieses Mittel aber irreführend, weil der Fehler mit der Menge wächst: An Trockentagen wäre das Band etwa viermal zu weit, an Starkregentagen etwa fünffach zu eng, und die Abweichungen sind stark schief verteilt.

Die ausgewiesene Spanne wird deshalb empirisch aus den tatsächlichen Abweichungen der Kreuzvalidierung gebildet, getrennt nach Klassen des Prädiktorwerts (Niederschlag: 0 / ≤1 / ≤5 / >5 mm; Strahlung: ≤50 / ≤150 / >150 W/m²; Temperatur und Feuchte brauchen keine Klassen):

untere Grenze = Füllwert + 2,5-%-Quantil der Abweichungen seiner Klasse
obere  Grenze = Füllwert + 97,5-%-Quantil der Abweichungen seiner Klasse

Wenn der Prädiktor selbst geschätzt ist. Ein Bestandestag, dessen Freiflächenwert aus Stufe F stammt, trägt zwei unabhängige Fehler. Ihre Halbbreiten werden quadratisch addiert:

Halbbreite = √(Halbbreite_Bestand² + (k · Halbbreite_Freifläche)²)

Dabei ist k = 1 für die additiven Modelle und k = τ für das multiplikative Strahlungsmodell. Welcher Fall vorliegt, ist je Tag festgehalten: dwd (Stufe F), measured (Freifläche hat gemessen) oder modelled (Freiflächenwert war selbst ein Füllwert).

Grenzen

  • Niederschlag. Auf Tagesebene bleibt die Güte begrenzt. Für Monats- und Jahressummen sind die gefüllten Reihen brauchbar, für die Analyse einzelner Starkregenereignisse nicht.
  • Strahlung auf der Freifläche. Nicht füllbar, solange die HYRAS-Strahlungsreihe des DWD 2020 endet. Im Bestand dagegen schon — aus der Freifläche, sofern diese an dem Tag einen Wert hat.
  • Stundenwerte. Das DWD-Raster ist täglich; Stundenlücken werden nicht gefüllt.
  • Gleichzeitige Ausfälle. Stufe S hilft nur, wenn die Freifläche an dem Tag misst. Meist ist das an 83–98 % der Bestandeslückentage der Fall, ein Stromausfall trifft aber beide Stationen. Wo die Freifläche selbst gefüllt wurde, wird die Spanne entsprechend breiter.
  • Geliehene Freiflächen. Für 1207 und 1209 stammt der Prädiktor von einer 3–4 km entfernten Fläche. Für Tagesmittel von Temperatur und Feuchte ist das im flachen Brandenburg unkritisch, für die Strahlung bei durchziehender Bewölkung weniger.

Die Zahlen selbst abrufen

Güte- und Unsicherheitsangaben sind offen zugänglich:

  • fuk.mm_gapfilling_model — eine Zeile je Fläche, Standort und Größe mit Lernumfang, cv_r2, cv_rmse, skill und Prädiktorart
  • fuk.mm_gapfilling_day — eine Zeile je gefülltem Tag mit Prädiktorwert, Füllwert, Standardfehlern, Spanne und Herkunft des Prädiktors