Run courant

Recherche DL Quant

Page dédiée au dernier run. Les historiques sont séparés dans une page dédiée pour garder la lecture claire.

Runs comparables32après purge
Best robust score0.5671run_0001_cnn1d_directional_adamw
Val mean best0.6978non sélectionnant
Rendu0.0 mingénération page

Raisonnement

Introduction avant tests

Lecture mémoire: 32 runs archivés, meilleur run run_0001_cnn1d_directional_adamw avec robust Val score=0.5671461337080594. Research planner: Où en est-on: meilleur officiel run_0001_cnn1d_directional_adamw score robuste=0.5671; familles fortes: cnn1d/directional best=0.567, cnn1d/pnl best=0.564, tcn/directional best=0.551. Blocage: la meilleure v2 TCN baisse encore sa loss; tester un chemin plus profond mais régularisé. Direction choisie: structure richer under budget. Pourquoi maintenant: Tester une TCN résiduelle légère: plus de profondeur/dilatation sans dépasser le budget de paramètres. Niveau protocole: L1. Comparabilité directe: pas de changement data/features/cible/folds/augmentation/sélection (L0-L2). Succès attendu: Val robuste proche du best v2 avec gap Test-Val contenu. Échec: surajustement ou instabilité folds. Suite prévue: si positif, explorer la profondeur/dilatation; sinon revenir TCN simple File d'hypothèses candidates: Tester une TCN résiduelle légère: plus de profondeur/dilatation sans dépasser le budget de paramètres. | Tester une TCN depthwise separable pour élargir le champ temporel avec très peu de paramètres. | Tester un micro-transformer causal-ish comme diagnostic d'attention temporelle sous 100k params.

Run courant / dernier test

run_0032_mlp_directional_adamw

mlp · directional · adamw
Val DirAcc mean0.5613sélection
Val DirAcc std0.0549stabilité folds
Robust Val score0.5065mean - std
Val BT score1.6534research only
Val PNL proxy1.44407diagnostic
Test DirAcc mean0.5136confirmation
Test DirAcc std0.0465stabilité folds
Gap Test-Val-0.0477alerte si très négatif
Test PNL proxy0.47149sans frais
Test BT score0.6400report only
Max DD proxy-1.00529diagnostic
Sharpe proxy0.410diagnostic
Folds12/ 12
Params79937<100k

Résumé modèle

arch=mlp · loss=directional · opt=adamw · dense=32 · layers=1 · dropout=0.09 · l2=0.0004 · params=79937

Stratégiemutation anti-répétition guidée par diagnostic
NiveauL1
Succès attenduproduire un signal nouveau comparable
Échecrésultat dominé par les familles déjà testées

Réflexion et direction prise

Où en est-on: meilleur officiel run_0001_cnn1d_directional_adamw score robuste=0.5671; familles fortes: cnn1d/directional best=0.567, cnn1d/pnl best=0.564, tcn/directional best=0.551. Blocage: le backlog comparable est consommé mais on refuse de relancer un doublon. Direction choisie: mutation anti-répétition guidée par diagnostic. Pourquoi maintenant: Mutation anti-répétition: exploiter le signal MLP/Test sans changer les données. Niveau protocole: L1. Comparabilité directe: pas de changement data/features/cible/folds/augmentation/sélection (L0-L2). Succès attendu: produire un signal nouveau comparable. Échec: résultat dominé par les familles déjà testées. Suite prévue: si les mutations plafonnent, préparer explicitement un protocol_v2 L3

Hypothèse opérationnelle

Mutation anti-répétition: exploiter le signal MLP/Test sans changer les données.

Conclusion

WF folds=12/12; Robust Val score=0.5065; Val DirAcc mean=0.5613; Test DirAcc mean=0.5136; Val/Test PNL proxy=1.44407/0.471488.

Ouvrir graphique loss
Loss run_0032_mlp_directional_adamw

Best run à battre

run_0001_cnn1d_directional_adamw

cnn1d · directional · adamw
Val DirAcc mean0.6978sélection
Val DirAcc std0.1307stabilité folds
Robust Val score0.5671mean - std
Val BT score7.3602research only
Val PNL proxy5.42699diagnostic
Test DirAcc mean0.5099confirmation
Test DirAcc std0.1191stabilité folds
Gap Test-Val-0.1880alerte si très négatif
Test PNL proxy0.54902sans frais
Test BT score0.5597report only
Max DD proxy-3.56554diagnostic
Sharpe proxy0.488diagnostic
Folds12/ 12
Params4845<100k

Résumé modèle

arch=cnn1d · loss=directional · opt=adamw · conv=24/12 · kernel=5 · dropout=0.12 · l2=1e-05 · params=4845

Stratégien/a
Niveaun/a
Succès attendun/a
Échecn/a

Réflexion et direction prise

CNN causale légère + loss directionnelle: améliorer le signe des rendements de panier sans sacrifier l'erreur.

Hypothèse opérationnelle

CNN causale légère + loss directionnelle: améliorer le signe des rendements de panier sans sacrifier l'erreur.

Conclusion

WF folds=12/12; Val DirAcc mean=0.6978; Test DirAcc mean=0.5099; Test PNL proxy=0.549022.

Ouvrir graphique loss
Loss run_0001_cnn1d_directional_adamw

Diagnostic Val/Test

Un écart Test-Val négatif important signale une instabilité temporelle ou un sur-ajustement validation. Le modèle est sélectionné sur le robust Val score; le Test reste confirmation/reporting.

Dernières lignes log

[2026-07-01T00:02:12+00:00] Nouvelle session autonome
[2026-07-01T00:02:12+00:00] Chargement cache dataset: /home/aalex/dev/quant_trading/data/dataset_processed_6h.pkl
[2026-07-01T00:02:12+00:00] INTRO HYPOTHÈSES: Lecture mémoire: 32 runs archivés, meilleur run run_0001_cnn1d_directional_adamw avec robust Val score=0.5671461337080594. Research planner: Où en est-on: meilleur officiel run_0001_cnn1d_directional_adamw score robuste=0.5671; familles fortes: cnn1d/directional best=0.567, cnn1d/pnl best=0.564, tcn/directional best=0.551. Blocage: la meilleure v2 TCN baisse encore sa loss; tester un chemin plus profond mais régularisé. Direction choisie: structure richer under budget. Pourquoi maintenant: Tester une TCN résiduelle légère: plus de profondeur/dilatation sans dépasser le budget de paramètres. Niveau protocole: L1. Comparabilité directe: pas de changement data/features/cible/folds/augmentation/sélection (L0-L2). Succès attendu: Val robuste proche du best v2 avec gap Test-Val contenu. Échec: surajustement ou instabilité folds. Suite prévue: si positif, explorer la profondeur/dilatation; sinon revenir TCN simple File d'hypothèses candidates: Tester une TCN résiduelle légère: plus de profondeur/dilatation sans dépasser le budget de paramètres. | Tester une TCN depthwise separable pour élargir le champ temporel avec très peu de paramètres. | Tester un micro-transformer causal-ish comme diagnostic d'attention temporelle sous 100k params.
[2026-07-01T00:02:12+00:00] Supervised X=(9673, 80, 31), features=31, folds=12; sign_flip_train=True; flipped_features=11