FORSCHUNG UND PRAXIS

Walk-forward-Validierung für Krypto bei überlappenden Prognosehorizonten

Nutzen Sie zeitlich geordnete Bewertungen mit abgeschlossenen Zielwerten, bereinigten Überschneidungen und separater Kalibrierung, damit wiederholte Prognosen keine Zukunftsinformationen übertragen.

Redaktionelle Illustration zu: Walk-forward-Validierung für Krypto bei überlappenden Prognosehorizonten
Redaktionelle Illustration; keine Live-Marktdaten. Photo: Jakub Zerdzicki · Pexels

Beobachtungen nach ihrem Ausgabezeitpunkt zu sortieren ist für einen realistischen Prognosetest notwendig, reicht aber möglicherweise nicht aus. Eine Prognose kann vor dem Testzeitraum ausgegeben werden, während ihr Ergebnis bis in diesen Zeitraum reicht. Wiederholte Vorhersagen können außerdem nahezu dieselbe Marktbewegung beschreiben. Ein nützliches Walk-forward-Verfahren verfolgt daher sowohl die Entscheidungs- als auch die Ergebniszeitachse und erklärt genau, wann Informationen das nächste Modell beeinflussen dürfen.

01

Für jede Beobachtung eine Informationszeitachse festhalten

Bewahren Sie mindestens Ausgabezeitpunkt, spätesten Verfügbarkeitszeitpunkt der Eingabedaten, Bewertungsbeginn, Bewertungsende und den Zeitpunkt auf, zu dem der Zielwert tatsächlich abschließend bestimmt wurde. Ein Modell, das zu einem bestimmten Stichtag angepasst wird, darf nur bis dahin bekannte Zielwerte nutzen. Dieselbe Bedingung gilt für die Wahl von Schwellenwerten, die Richtung eines Scores, die Kalibrierung und jede Regel, die über die Zulässigkeit eines Forschungsmodells entscheidet. Ein alter Ausgabezeitstempel macht ein späteres Ergebnis nicht zu bereits bekanntem Wissen. Besonders wichtig ist diese Unterscheidung, wenn kurz- und langfristige Prognosen in derselben Tabelle stehen.

02

Anpassung, Kalibrierung und Abschlusstest trennen

Verwenden Sie ein früheres Intervall zum Anpassen des Prädiktors, ein späteres zulässiges Intervall zur Wahl von Kalibrierungs- oder Entscheidungseinstellungen und ein nochmals späteres zur Bewertung. Das letzte Intervall muss von Auswahlentscheidungen unberührt bleiben. Wiederholen Sie den Ablauf über die Zeit nach einem vorab festgelegten Plan und bewahren Sie das genaue Modell samt Einstellungen jeder Prognose auf. Die Schnittstelle TimeSeriesSplit von scikit-learn bietet chronologische Aufteilungen und einen in Beobachtungen gemessenen Abstand. Sie versteht nicht automatisch Marktergebnisse variabler Länge und rechnet diese Anzahl nicht in Minuten um. Solche Anforderungen muss das Datenprotokoll des Experiments selbst festlegen.

03

Eine hypothetische Überschneidung an der Trennlinie

Eine um 10:00 ausgegebene Prognose hat ein 90-minütiges Ergebnisfenster, das um 11:30 endet. Sie kann keinem um 10:30 eingesetzten Modell einen bekannten Trainingszielwert liefern, obwohl ihr Ausgabezeitpunkt vor der neuen Testbeobachtung liegt. Eine 240-Minuten-Prognose vom selben Ausgabezeitpunkt bleibt bei entsprechender Horizontdefinition bis 14:00 offen. Entfernen oder verschieben Sie Trainingsdatensätze, deren benötigte Ergebnisinformationen zum Anpassungszeitpunkt noch nicht verfügbar waren. Beginnt die Bewertung mit einem späteren Einstieg an einer vollständigen Kerze, verwenden Sie das tatsächliche Ende dieses Fensters. Eine gerundete Zeitgruppenkennung ersetzt das Informationsintervall des Zielwerts nicht.

04

Überschneidungen bereinigen, ohne Unabhängigkeit vorzutäuschen

Prüfen Sie nahe einer Trennlinie die Intervalle, aus denen Zielwerte berechnet werden, und entfernen Sie laut schriftlichem Protokoll unzulässige Überschneidungen. Wenn eine Sperrzone verwendet wird, definieren Sie deren Richtung und Zweck. Eine Lücke behebt nicht pauschal jeden Informationsleck-Pfad. Innerhalb des Tests können mehrere Prognosen derselben fortlaufenden Bewegung weiterhin berechtigte Live-Beobachtungen sein, aber stark voneinander abhängen. Berichten Sie sowohl die Zahl der Prognosen als auch eine sinnvolle Gruppierung, etwa nach Tagen oder Marktereignissen. Eine Unsicherheitsschätzung durch erneute Stichprobenziehung vermeintlich unabhängiger Zeilen kann einen stark überlappenden Strom sonst sicherer erscheinen lassen, als er ist.

05

Auch Transformationen und Modellauswahl prüfen

Merkmalsskalierung, Behandlung fehlender Werte und Merkmalsauswahl dürfen für jede Aufteilung nur aus der zulässigen Historie angepasst werden. Eine Transformation, die aus dem gesamten Datensatz gelernt wurde, kann Informationen übertragen, selbst wenn das Prognosemodell chronologisch trainiert wird. Dokumentieren Sie die getesteten Alternativen und die Regel für ihre Auswahl. Die Arbeit von Bailey und Kollegen zur Überanpassung von Backtests behandelt die Gefahr, aus vielen historischen Experimenten auszuwählen. Eine saubere abschließende Zeitachse macht wiederholtes Tuning auf demselben angeblich zurückgehaltenen Datensatz nicht rückgängig. Bewahren Sie Belege auf, die die bevorzugte Konfiguration noch widerlegen können.

06

Den Ablauf wiedergeben, den Nutzer tatsächlich gesehen hätten

Laden Sie für jede Testausgabe den damals vorhandenen Modellzustand, berechnen Sie die Prognose aus verfügbaren Eingaben und frieren Sie das ausgegebene Ergebnis ein. Bewerten Sie es erst abschließend, wenn die erforderlichen zukünftigen Daten vollständig sind. Prüfen Sie die Leistung nach Horizont und Marktbedingungen zusammen mit der Abdeckung fehlender Daten und einem einfachen Vergleichsmaßstab. Ändert eine spätere Kalibrierung die Bedeutung eines früheren Scores, speichern Sie dies als rückblickende Analyse, statt die ursprüngliche Ausgabe zu überschreiben. Entscheidend ist, ob das Verfahren als chronologischer Entscheidungsprozess funktioniert, nicht ob eine nachträgliche Transformation seine Historie attraktiv aussehen lässt.

Quellen und Einordnung der Beispiele

Die Quellen belegen Definitionen und Mechanismen. Die Zahlenbeispiele sind hypothetische Lernbeispiele, keine aktuellen Kurse, Prognosen oder berichteten HOSTuvo-Ergebnisse. Bilder dienen der redaktionellen Illustration.