Run courant

Recherche DL Quant

Page dédiée au dernier run. Les historiques sont séparés dans une page dédiée pour garder la lecture claire.

Runs comparables3après purge
Best robust score26.9547run_0003_tcn_huber_adamw
Val mean best0.5559non sélectionnant
Rendu3.5 mingénération page

Raisonnement

Introduction avant tests

Lecture mémoire: 2 runs archivés, meilleur run None avec score sélection=None. Research planner: Où en est-on: meilleur officiel n/a score sélection=nan; familles fortes: pas encore assez d'historique. Blocage: dégrossir l'idée temporal_gap_val6m_test1m_tcn sans conclure sur un seul run. Direction choisie: protocole scout 4 runs/idée. Pourquoi maintenant: Scout temporal_gap_val6m_test1m_tcn: TCN très contrainte pour tester contexte temporel sans sur-capacité ni timeout. Niveau protocole: L3. Comparabilité directe: pas de changement data/features/cible/folds/augmentation/sélection (L0-L2). Succès attendu: amélioration du Test pessimiste médian ou baisse worst-month/gap. Échec: Val meilleure mais Test fragile ou run isolé non répétable. Suite prévue: après 4 runs, passer à l'idée suivante; après 2-3 jours, promouvoir les directions robustes File d'hypothèses candidates: Scout temporal_gap_val6m_test1m_tcn: TCN très contrainte pour tester contexte temporel sans sur-capacité ni timeout. | Scout temporal_gap_val6m_test1m_tcn: MLP alternative pour vérifier répétabilité sous même idée.

Run courant / dernier test

run_0003_tcn_huber_adamw

tcn · huber · adamw
Val DirAcc mean0.5559sélection
Val DirAcc std0.0499stabilité folds
Robust Val score0.5060mean - std
Capital score Test89.2426gain% - 1.5×DD%
Gain Test %131.64capital 100
Max DD Test %-28.27drawdown capital
Capital score Val272.9923seuil capital choisi sur Val
Capital seuil p0appliqué au Test capital
Calmar Test4.657gain% / DD%
Econ Val score26.9547ancien score éco
Val raw score36.1504avant pénalités
No-trade seuil70percentile confidence
Worst month Val-1.26456pénalité transfert
Econ Test score-12.9670report only
Worst month Test-4.24963report only
Econ DD Test-11.71571drawdown réel
Val BT score6.2781legacy research
Val PNL proxy15.08804diagnostic
Test DirAcc mean0.5740confirmation
Test DirAcc std0.1432stabilité folds
Gap Test-Val0.0181alerte si très négatif
Test PNL proxy2.81454sans frais
Test BT score3.3571report only
Max DD proxy-2.23871diagnostic
Sharpe proxy2.972diagnostic
Folds12/ 12
Params1257<100k

Résumé modèle

arch=tcn · loss=huber · opt=adamw · filters=8 · dilations=[1, 2] · blocks=2 · dropout=0.3 · l2=0.0003 · scaler=robust_winsor · features=regime · win/out=80/40 · params=1257

Stratégieprotocole scout 4 runs/idée
NiveauL3
Succès attenduamélioration du Test pessimiste médian ou baisse worst-month/gap
ÉchecVal meilleure mais Test fragile ou run isolé non répétable

Réflexion et direction prise

Où en est-on: meilleur officiel n/a score sélection=nan; familles fortes: pas encore assez d'historique. Blocage: dégrossir l'idée temporal_gap_val6m_test1m_tcn sans conclure sur un seul run. Direction choisie: protocole scout 4 runs/idée. Pourquoi maintenant: Scout temporal_gap_val6m_test1m_tcn: TCN très contrainte pour tester contexte temporel sans sur-capacité ni timeout. Niveau protocole: L3. Comparabilité directe: pas de changement data/features/cible/folds/augmentation/sélection (L0-L2). Succès attendu: amélioration du Test pessimiste médian ou baisse worst-month/gap. Échec: Val meilleure mais Test fragile ou run isolé non répétable. Suite prévue: après 4 runs, passer à l'idée suivante; après 2-3 jours, promouvoir les directions robustes

Hypothèse opérationnelle

Scout temporal_gap_val6m_test1m_tcn: TCN très contrainte pour tester contexte temporel sans sur-capacité ni timeout.

Conclusion

WF folds=12/12; Robust Val score=0.5060; Val DirAcc mean=0.5559; Test DirAcc mean=0.5740; Val/Test PNL proxy=15.088/2.81454.

Ouvrir graphique loss
Loss run_0003_tcn_huber_adamw Validation portfolio run_0003_tcn_huber_adamwTest portfolio run_0003_tcn_huber_adamwCapital % Validation run_0003_tcn_huber_adamwCapital % Test run_0003_tcn_huber_adamw

Diagnostic Val/Test

Un écart Test-Val négatif important signale une instabilité temporelle ou un sur-ajustement validation. Le modèle est sélectionné sur le robust Val score; le Test reste confirmation/reporting.

Dernières lignes log

[2026-07-06T08:28:26+00:00] Nouvelle session autonome
[2026-07-06T08:28:26+00:00] Chargement cache dataset: /home/aalex/dev/quant_trading/data/dataset_processed_6h.pkl
[2026-07-06T08:28:27+00:00] INTRO HYPOTHÈSES: Lecture mémoire: 2 runs archivés, meilleur run None avec score sélection=None. Research planner: Où en est-on: meilleur officiel n/a score sélection=nan; familles fortes: pas encore assez d'historique. Blocage: dégrossir l'idée temporal_gap_val6m_test1m_tcn sans conclure sur un seul run. Direction choisie: protocole scout 4 runs/idée. Pourquoi maintenant: Scout temporal_gap_val6m_test1m_tcn: TCN très contrainte pour tester contexte temporel sans sur-capacité ni timeout. Niveau protocole: L3. Comparabilité directe: pas de changement data/features/cible/folds/augmentation/sélection (L0-L2). Succès attendu: amélioration du Test pessimiste médian ou baisse worst-month/gap. Échec: Val meilleure mais Test fragile ou run isolé non répétable. Suite prévue: après 4 runs, passer à l'idée suivante; après 2-3 jours, promouvoir les directions robustes File d'hypothèses candidates: Scout temporal_gap_val6m_test1m_tcn: TCN très contrainte pour tester contexte temporel sans sur-capacité ni timeout. | Scout temporal_gap_val6m_test1m_tcn: MLP alternative pour vérifier répétabilité sous même idée.
[2026-07-06T08:28:27+00:00] Supervised X=(9673, 80, 37), features=37, folds=12; sign_flip_train=False; flipped_features=11
[2026-07-06T08:28:27+00:00] Hypothèse run_0003_tcn_huber_adamw: Scout temporal_gap_val6m_test1m_tcn: TCN très contrainte pour tester contexte temporel sans sur-capacité ni timeout.
[2026-07-06T08:31:57+00:00] Nouveau record validation_economic_portfolio_score: 26.9547; robust val=0.5060; mean test DA=0.5740; modèle sauvé /home/aalex/dev/quant_trading/backtests/protocols/one_shot_v4_gap_val6m_test1m_20260706/models/best_model.keras
[2026-07-06T08:31:57+00:00] WF folds=12/12; Robust Val score=0.5060; Val DirAcc mean=0.5559; Test DirAcc mean=0.5740; Val/Test PNL proxy=15.088/2.81454.