FORSCHUNG UND PRAXIS

Kalibrierte Krypto-Wahrscheinlichkeiten: Zuverlässigkeit, Brier-Score und Basisraten

Prüfen Sie anhand eines definierten Zielereignisses, von Zuverlässigkeitsgruppen, geeigneten Bewertungsregeln und unabhängigen Testdaten, ob eine Krypto-Wahrscheinlichkeit hält, was sie aussagt.

Redaktionelle Illustration zu: Kalibrierte Krypto-Wahrscheinlichkeiten, Zuverlässigkeit, Brier-Score und Basisraten
Redaktionelle Illustration; keine Live-Marktdaten. Photo: Jakub Zerdzicki · Pexels

Ein Score von 70 ist nicht automatisch eine Wahrscheinlichkeit von 70 %. Eine Wahrscheinlichkeit benötigt ein bestimmtes Ereignis, einen Horizont und Belege, die zuvor ausgegebene Zahlen mit später beobachteten Ergebnissen verbinden. Auch ein Modell, das Gelegenheiten gut einordnet, kann deren Wahrscheinlichkeit über- oder unterschätzen. Dieser Artikel erläutert eine praktische Prüfung mit hypothetischen Beispielen. Keine der folgenden Prozentangaben beschreibt gemessene HOSTuvo-Ergebnisse.

01

Das Ereignis definieren, bevor es um Sicherheit geht

Legen Sie fest, ob Erfolg eine positive Rendite am Horizont, das zuerst erfolgende Berühren einer oberen Schwelle oder das Übertreffen geschätzter Kosten bedeutet. Nennen Sie Einstiegsreferenz, Beobachtungsfenster und den Umgang mit uneindeutigen Kursverläufen. Diese Ziele können derselben Kursfolge unterschiedliche Zielwerte zuordnen. Lassen Sie ungültige oder unvollständige Ergebnisse aus der binären Zielwertberechnung heraus, berichten Sie deren Häufigkeit aber gesondert. Eine Wahrscheinlichkeit gilt bedingt für die Population, auf die sie sich bezieht. Eine aus liquiden Märkten abgeleitete Schätzung darf daher nicht stillschweigend zum Versprechen für ein anderes Universum oder ein neu hinzugefügtes illiquides Instrument werden.

02

Angegebene Wahrscheinlichkeiten mit beobachteten Häufigkeiten vergleichen

Gruppieren Sie Prognosen aus tatsächlich unabhängigen Testdaten in vorab festgelegte Wahrscheinlichkeitsbereiche und vergleichen Sie in jedem Bereich die mittlere Prognose mit der beobachteten Ereignishäufigkeit. Zeigen Sie die Anzahl jeder Gruppe. Liegt der Durchschnitt von hypothetisch 100 Prognosen bei 70 % und treten 70 Ereignisse ein, stimmt diese Gruppe mit der angegebenen Rate überein. Das einzelne Ergebnis beweist jedoch keine künftige Zuverlässigkeit. Kleine Gruppen können stark schwanken, und überlappende Prognosen verringern die Menge unabhängiger Belege. Untersuchen Sie Unterschiede der Kalibrierung nach Horizont und Bedingungen, statt alle Muster in einer beruhigenden Gesamtprozentzahl zu verbergen.

03

Eine Bewertungsregel nutzen, ohne sie mit der gesamten Antwort zu verwechseln

Bei einem binären Ereignis ist der Brier-Verlust die mittlere quadrierte Differenz zwischen vorhergesagter Wahrscheinlichkeit und dem als null oder eins kodierten Ergebnis. Zwei hypothetische Prognosen von 0,8, auf die ein Ereignis und ein Nicht-Ereignis folgen, haben Verluste von 0,04 und 0,64; der Durchschnitt beträgt 0,34. Für dieselben beiden Ergebnisse liefert eine Prognose von jeweils 0,5 einen Wert von 0,25. Dieses winzige Beispiel zeigt die Bestrafung selbstsicherer Fehler, keinen statistisch aussagekräftigen Modellvergleich. Wie die Dokumentation von scikit-learn erklärt, spiegelt der Brier-Verlust neben Kalibrierung auch Trennschärfe wider. Ein niedrigerer Wert allein belegt daher keine bessere Zuverlässigkeit.

04

Einen Vergleichsmaßstab wählen, der die Ereignishäufigkeit berücksichtigt

Angenommen, eine andere hypothetische Population enthält 20 Ereignisse unter 100 Beobachtungen. Eine konstante Wahrscheinlichkeit von 0,2 ergibt einen mittleren Brier-Verlust von 0,16; eine konstante 0,5 ergibt 0,25. Stets die negative Klasse vorherzusagen würde in dieser Population 80 % Klassifikationsgenauigkeit erreichen. Diese Schlagzeile sagt dennoch wenig über den Nutzen einer Ereigniswarnung aus. Schätzen Sie jede Basisrate aus Informationen, die zum Bewertungszeitpunkt zulässig waren, nicht aus dem vollständigen zukünftigen Testdatensatz. Vergleichen Sie identische Beobachtungen und Zielereignisse, damit eine veränderte Ereigniszusammensetzung nicht als Modellverbesserung erscheinen kann.

05

Kalibrieren, ohne die zur Beurteilung benötigten Belege aufzubrauchen

Ein Kalibrator lernt eine Abbildung von der Rohausgabe eines Modells auf Wahrscheinlichkeiten. Wird er mit Beobachtungen trainiert, an die bereits der ursprüngliche Prädiktor angepasst wurde, kann die Abbildung übermäßig sicher werden. Bei Marktdaten sind neben der Trennung von Anpassung und Bewertung auch zeitliche Reihenfolge und abgeschlossene Zielwerte erforderlich. Verknüpfen Sie jede ausgegebene Prognose mit ihrer Kalibrierungsversion. Stützen zu wenige Ergebnisse eine fein abgestufte Abbildung, beschränken Sie die Aussagen und legen Sie diese Grenze offen. Eine flexible Kurve erzeugt keine zusätzlichen Informationen. Prüfen Sie, ob die relevanten positiven und negativen Ergebnisse in der Kalibrierungsstichprobe vertreten sind.

06

Aus der Prüfung eine zurückhaltende Oberfläche ableiten

Zeigen Sie eine Prozentzahl nur dann, wenn Ziel und Belege eine Interpretation als Wahrscheinlichkeit tragen. Bezeichnen Sie die Zahl andernfalls als Score oder Rangwert und erklären Sie, was damit geordnet wird. Ergänzen Sie Wahrscheinlichkeitsangaben um Stichprobengröße, Abdeckung, Bewertungszeitraum und, soweit schätzbar, Unsicherheit. Bewahren Sie den ursprünglich veröffentlichten Wert, damit spätere Korrekturen die Beleglage nicht umschreiben. Kalibrierung belegt auch keine wirtschaftliche Attraktivität: Ein korrekt geschätztes Ereignis kann zu klein, zu kostspielig oder zu schwer handelbar sein. Behandeln Sie Wahrscheinlichkeitsqualität, Kandidatenauswahl und tatsächlich ausführbare Wirtschaftlichkeit als getrennte Fragen.

Quellen und Einordnung der Beispiele

Die Quellen belegen Definitionen und Mechanismen. Die Zahlenbeispiele sind hypothetische Lernbeispiele, keine aktuellen Kurse, Prognosen oder berichteten HOSTuvo-Ergebnisse. Bilder dienen der redaktionellen Illustration.