Run courant

Recherche DL Quant

Page dédiée au dernier run. Les historiques sont séparés dans une page dédiée pour garder la lecture claire.

Runs comparables4après purge
Best robust score13.8331run_0002_cnn1d_pnl_adamw
Val mean best0.5518non sélectionnant
Rendu7.4 mingénération page

Raisonnement

Introduction avant tests

Lecture mémoire: 0 runs archivés, meilleur run None avec score sélection=None. Research planner: Où en est-on: meilleur officiel n/a score sélection=nan; familles fortes: pas encore assez d'historique. Blocage: dégrossir l'idée temporal_gap_test1m_mini sans conclure sur un seul run. Direction choisie: protocole scout 4 runs/idée. Pourquoi maintenant: Scout temporal_gap_test1m_mini: MLP stable pour tester l'idée sans architecture complexe. Niveau protocole: L3. Comparabilité directe: pas de changement data/features/cible/folds/augmentation/sélection (L0-L2). Succès attendu: amélioration du Test pessimiste médian ou baisse worst-month/gap. Échec: Val meilleure mais Test fragile ou run isolé non répétable. Suite prévue: après 4 runs, passer à l'idée suivante; après 2-3 jours, promouvoir les directions robustes File d'hypothèses candidates: Scout temporal_gap_test1m_mini: MLP stable pour tester l'idée sans architecture complexe. | Scout temporal_gap_test1m_mini: CNN PNL légère pour tester si l'idée améliore la courbe économique. | Scout temporal_gap_test1m_mini: TCN très contrainte pour tester contexte temporel sans sur-capacité ni timeout.

Run courant / dernier test

run_0004_mlp_directional_adamw

mlp · directional · adamw
Val DirAcc mean0.5147sélection
Val DirAcc std0.0317stabilité folds
Robust Val score0.4830mean - std
Capital score Test-21.4904gain% - 1.5×DD%
Gain Test %3.75capital 100
Max DD Test %-16.83drawdown capital
Capital score Val8.1244seuil capital choisi sur Val
Capital seuil p0appliqué au Test capital
Calmar Test0.223gain% / DD%
Econ Val score-1.7390ancien score éco
Val raw score1.5090avant pénalités
No-trade seuil70percentile confidence
Worst month Val-1.06825pénalité transfert
Econ Test score-6.9528report only
Worst month Test-2.54412report only
Econ DD Test-5.00780drawdown réel
Val BT score0.6696legacy research
Val PNL proxy1.17697diagnostic
Test DirAcc mean0.5056confirmation
Test DirAcc std0.0792stabilité folds
Gap Test-Val-0.0090alerte si très négatif
Test PNL proxy0.13728sans frais
Test BT score0.2144report only
Max DD proxy-1.72923diagnostic
Sharpe proxy0.074diagnostic
Folds12/ 12
Params95297<100k

Résumé modèle

arch=mlp · loss=directional · opt=adamw · dense=40 · layers=1 · dropout=0.22 · l2=0.0001 · scaler=robust_winsor · features=regime · win/out=80/40 · params=95297

Stratégieprotocole scout 4 runs/idée
NiveauL3
Succès attenduamélioration du Test pessimiste médian ou baisse worst-month/gap
ÉchecVal meilleure mais Test fragile ou run isolé non répétable

Réflexion et direction prise

Où en est-on: meilleur officiel n/a score sélection=nan; familles fortes: pas encore assez d'historique. Blocage: dégrossir l'idée temporal_gap_test1m_mini sans conclure sur un seul run. Direction choisie: protocole scout 4 runs/idée. Pourquoi maintenant: Scout temporal_gap_test1m_mini: MLP alternative pour vérifier répétabilité sous même idée. Niveau protocole: L3. Comparabilité directe: pas de changement data/features/cible/folds/augmentation/sélection (L0-L2). Succès attendu: amélioration du Test pessimiste médian ou baisse worst-month/gap. Échec: Val meilleure mais Test fragile ou run isolé non répétable. Suite prévue: après 4 runs, passer à l'idée suivante; après 2-3 jours, promouvoir les directions robustes

Hypothèse opérationnelle

Scout temporal_gap_test1m_mini: MLP alternative pour vérifier répétabilité sous même idée.

Conclusion

WF folds=12/12; Robust Val score=0.4830; Val DirAcc mean=0.5147; Test DirAcc mean=0.5056; Val/Test PNL proxy=1.17697/0.137281.

Ouvrir graphique loss
Loss run_0004_mlp_directional_adamw Validation portfolio run_0004_mlp_directional_adamwTest portfolio run_0004_mlp_directional_adamwCapital % Validation run_0004_mlp_directional_adamwCapital % Test run_0004_mlp_directional_adamw

Best run à battre

run_0002_cnn1d_pnl_adamw

cnn1d · pnl · adamw
Val DirAcc mean0.5518sélection
Val DirAcc std0.1048stabilité folds
Robust Val score0.4471mean - std
Capital score Test31.0384gain% - 1.5×DD%
Gain Test %63.81capital 100
Max DD Test %-21.84drawdown capital
Capital score Val89.7072seuil capital choisi sur Val
Capital seuil p0appliqué au Test capital
Calmar Test2.921gain% / DD%
Econ Val score13.8331ancien score éco
Val raw score22.1005avant pénalités
No-trade seuil80percentile confidence
Worst month Val-1.41623pénalité transfert
Econ Test score8.4635report only
Worst month Test-0.71842report only
Econ DD Test-4.62484drawdown réel
Val BT score4.1623legacy research
Val PNL proxy7.04193diagnostic
Test DirAcc mean0.5072confirmation
Test DirAcc std0.2001stabilité folds
Gap Test-Val-0.0447alerte si très négatif
Test PNL proxy1.65950sans frais
Test BT score1.5978report only
Max DD proxy-3.12689diagnostic
Sharpe proxy1.435diagnostic
Folds12/ 12
Params3529<100k

Résumé modèle

arch=cnn1d · loss=pnl · opt=adamw · conv=16/8 · kernel=5 · dropout=0.28 · l2=0.0003 · scaler=robust_winsor · features=regime · win/out=80/40 · params=3529

Stratégieprotocole scout 4 runs/idée
NiveauL3
Succès attenduamélioration du Test pessimiste médian ou baisse worst-month/gap
ÉchecVal meilleure mais Test fragile ou run isolé non répétable

Réflexion et direction prise

Où en est-on: meilleur officiel n/a score sélection=nan; familles fortes: pas encore assez d'historique. Blocage: dégrossir l'idée temporal_gap_test1m_mini sans conclure sur un seul run. Direction choisie: protocole scout 4 runs/idée. Pourquoi maintenant: Scout temporal_gap_test1m_mini: CNN PNL légère pour tester si l'idée améliore la courbe économique. Niveau protocole: L3. Comparabilité directe: pas de changement data/features/cible/folds/augmentation/sélection (L0-L2). Succès attendu: amélioration du Test pessimiste médian ou baisse worst-month/gap. Échec: Val meilleure mais Test fragile ou run isolé non répétable. Suite prévue: après 4 runs, passer à l'idée suivante; après 2-3 jours, promouvoir les directions robustes

Hypothèse opérationnelle

Scout temporal_gap_test1m_mini: CNN PNL légère pour tester si l'idée améliore la courbe économique.

Conclusion

WF folds=12/12; Robust Val score=0.4471; Val DirAcc mean=0.5518; Test DirAcc mean=0.5072; Val/Test PNL proxy=7.04193/1.6595.

Ouvrir graphique loss
Loss run_0002_cnn1d_pnl_adamw Validation portfolio run_0002_cnn1d_pnl_adamwTest portfolio run_0002_cnn1d_pnl_adamwCapital % Validation run_0002_cnn1d_pnl_adamwCapital % Test run_0002_cnn1d_pnl_adamw

Diagnostic Val/Test

Un écart Test-Val négatif important signale une instabilité temporelle ou un sur-ajustement validation. Le modèle est sélectionné sur le robust Val score; le Test reste confirmation/reporting.

Dernières lignes log

[2026-07-05T23:42:22+00:00] Nouvelle session autonome
[2026-07-05T23:42:22+00:00] Chargement cache dataset: /home/aalex/dev/quant_trading/data/dataset_processed_6h.pkl
[2026-07-05T23:42:22+00:00] INTRO HYPOTHÈSES: Lecture mémoire: 0 runs archivés, meilleur run None avec score sélection=None. Research planner: Où en est-on: meilleur officiel n/a score sélection=nan; familles fortes: pas encore assez d'historique. Blocage: dégrossir l'idée temporal_gap_test1m_mini sans conclure sur un seul run. Direction choisie: protocole scout 4 runs/idée. Pourquoi maintenant: Scout temporal_gap_test1m_mini: MLP stable pour tester l'idée sans architecture complexe. Niveau protocole: L3. Comparabilité directe: pas de changement data/features/cible/folds/augmentation/sélection (L0-L2). Succès attendu: amélioration du Test pessimiste médian ou baisse worst-month/gap. Échec: Val meilleure mais Test fragile ou run isolé non répétable. Suite prévue: après 4 runs, passer à l'idée suivante; après 2-3 jours, promouvoir les directions robustes File d'hypothèses candidates: Scout temporal_gap_test1m_mini: MLP stable pour tester l'idée sans architecture complexe. | Scout temporal_gap_test1m_mini: CNN PNL légère pour tester si l'idée améliore la courbe économique. | Scout temporal_gap_test1m_mini: TCN très contrainte pour tester contexte temporel sans sur-capacité ni timeout.
[2026-07-05T23:42:22+00:00] Supervised X=(9673, 80, 37), features=37, folds=12; sign_flip_train=False; flipped_features=11
[2026-07-05T23:42:22+00:00] Hypothèse run_0001_mlp_directional_rmsprop: Scout temporal_gap_test1m_mini: MLP stable pour tester l'idée sans architecture complexe.
[2026-07-05T23:44:02+00:00] Nouveau record validation_economic_portfolio_score: -1.1036; robust val=0.4685; mean test DA=0.5079; modèle sauvé /home/aalex/dev/quant_trading/backtests/protocols/one_shot_v4_gap_val3m_test1m_mini/models/best_model.keras
[2026-07-05T23:44:02+00:00] WF folds=12/12; Robust Val score=0.4685; Val DirAcc mean=0.5251; Test DirAcc mean=0.5079; Val/Test PNL proxy=1.55791/-0.0375676.
[2026-07-05T23:44:02+00:00] Hypothèse run_0002_cnn1d_pnl_adamw: Scout temporal_gap_test1m_mini: CNN PNL légère pour tester si l'idée améliore la courbe économique.
[2026-07-05T23:45:31+00:00] Nouveau record validation_economic_portfolio_score: 13.8331; robust val=0.4471; mean test DA=0.5072; modèle sauvé /home/aalex/dev/quant_trading/backtests/protocols/one_shot_v4_gap_val3m_test1m_mini/models/best_model.keras
[2026-07-05T23:45:31+00:00] WF folds=12/12; Robust Val score=0.4471; Val DirAcc mean=0.5518; Test DirAcc mean=0.5072; Val/Test PNL proxy=7.04193/1.6595.
[2026-07-05T23:45:32+00:00] Hypothèse run_0003_tcn_huber_adamw: Scout temporal_gap_test1m_mini: TCN très contrainte pour tester contexte temporel sans sur-capacité ni timeout.
[2026-07-05T23:48:07+00:00] WF folds=12/12; Robust Val score=0.4790; Val DirAcc mean=0.5588; Test DirAcc mean=0.5523; Val/Test PNL proxy=6.04251/2.27341.
[2026-07-05T23:48:08+00:00] Hypothèse run_0004_mlp_directional_adamw: Scout temporal_gap_test1m_mini: MLP alternative pour vérifier répétabilité sous même idée.
[2026-07-05T23:49:46+00:00] WF folds=12/12; Robust Val score=0.4830; Val DirAcc mean=0.5147; Test DirAcc mean=0.5056; Val/Test PNL proxy=1.17697/0.137281.