INVESTIGAÇÃO E PRÁTICA

Validação progressiva de criptomoedas quando os horizontes se sobrepõem

Use avaliação cronológica, resultados já conhecidos, remoção de sobreposições e calibração separada para impedir que previsões repetidas utilizem informação futura.

Ilustração editorial que acompanha: Validação progressiva de criptomoedas quando os horizontes se sobrepõem
Ilustração editorial; não são dados de mercado em tempo real. Photo: Jakub Zerdzicki · Pexels

Ordenar observações pela hora de emissão é necessário para um teste realista de previsões, mas pode não bastar. Uma previsão pode ser emitida antes do período de teste enquanto o seu resultado se prolonga para dentro desse período. Previsões repetidas também podem descrever praticamente o mesmo movimento de mercado. Uma validação progressiva útil acompanha, por isso, a cronologia da decisão e a do resultado, explicando exatamente quando a informação pode influenciar o modelo seguinte.

01

Escreva uma cronologia de informação para cada observação

Conserve pelo menos a hora de emissão, a última hora de disponibilidade dos dados de entrada, o início e o fim da avaliação e o momento em que o resultado foi efetivamente apurado. Um modelo ajustado num determinado limite temporal só pode utilizar resultados conhecidos até esse limite. A mesma condição aplica-se à escolha de limiares, à polaridade da pontuação, à calibração e a qualquer regra que decida a elegibilidade de um modelo de investigação. Uma emissão antiga não transforma um resultado posterior em conhecimento histórico. Esta distinção é especialmente importante quando previsões de curto e longo horizonte coexistem na mesma tabela.

02

Separe ajuste, calibração e teste final

Utilize um intervalo anterior para ajustar o preditor, outro posterior permitido para escolher a calibração ou as definições de decisão, e um intervalo ainda mais tardio para avaliar. Mantenha o intervalo final fora das decisões de seleção. Repita o processo ao longo do tempo segundo um calendário previamente definido, preservando o modelo e as definições exatas usados em cada previsão. A interface TimeSeriesSplit do scikit-learn fornece divisões cronológicas e uma separação medida em amostras. Não interpreta automaticamente resultados de mercado com duração variável nem converte esse número de amostras em minutos; essas exigências pertencem ao contrato de dados da experiência.

03

Uma sobreposição hipotética na fronteira da divisão

Uma previsão emitida às 10:00 tem um resultado de 90 minutos que termina às 11:30. Não pode fornecer um rótulo conhecido de treino para um modelo colocado em funcionamento às 10:30, embora a emissão seja anterior à nova observação de teste. Uma previsão de 240 minutos com a mesma emissão permanece por resolver até às 14:00, segundo uma convenção de horizonte correspondente. Remova ou adie registos cujo resultado necessário não estava disponível no momento do ajuste. Se a avaliação começar numa entrada posterior de vela completa, utilize esse fim efetivo. Um identificador de intervalo arredondado não substitui o intervalo informativo do resultado.

04

Remova sobreposições sem presumir independência

Perto da fronteira de uma divisão, examine os intervalos usados para construir os resultados e remova interseções proibidas segundo o protocolo escrito. Quando utilizar um período de embargo, defina a sua direção e finalidade; uma separação não resolve universalmente todas as fugas de informação. Dentro do teste, várias previsões do mesmo movimento em evolução podem continuar a ser observações legítimas em direto, mas fortemente dependentes. Apresente o número de previsões e um agrupamento relevante, como dias ou acontecimentos de mercado. Reamostrar incerteza a partir de linhas que apenas parecem independentes pode fazer um fluxo com muita sobreposição parecer mais seguro do que realmente é.

05

Audite também transformações e seleção de modelos

Escalonamento de variáveis, tratamento de valores em falta e seleção de atributos devem ser ajustados apenas com o historial permitido em cada divisão. Uma transformação aprendida com todo o conjunto pode introduzir informação futura mesmo quando o preditor é treinado cronologicamente. Registe as alternativas experimentadas e a regra usada para escolher entre elas. O trabalho de Bailey e colegas sobre sobreajuste de testes históricos aborda o perigo de selecionar entre muitas experiências passadas; uma cronologia final correta não apaga ajustes repetidos no mesmo suposto conjunto reservado. Preserve evidência que ainda possa contrariar a configuração preferida.

06

Reproduza a sequência que um utilizador teria visto

Para cada emissão de teste, carregue o estado do modelo existente nessa altura, calcule a previsão com dados disponíveis e fixe o resultado emitido. Apure-o apenas depois de os dados futuros necessários estarem completos. Analise desempenho por horizonte e condição de mercado, juntamente com cobertura de dados em falta e uma referência simples. Se uma calibração posterior mudar a interpretação de uma pontuação antiga, guarde-a como análise retrospetiva em vez de substituir a saída original. A pergunta central é se o procedimento funciona como processo cronológico de decisão, não se uma transformação posterior consegue tornar o seu historial atrativo.

Fontes e âmbito dos exemplos

As fontes sustentam as definições e os mecanismos. Os cenários numéricos são exemplos educativos hipotéticos, não preços atuais, previsões nem resultados reportados pela HOSTuvo. As imagens são ilustrações editoriais.