Research queue

Hypothèses autonomes

Le chercheur propose des idées structurées; le runner exécute 4 runs par idée. Promotion seulement si signal répété et robustesse Test/worst-month.

Idées queue7JSONL
Runs scout1v4

Suivi des idées

IDHypothèseStatutRunsTest médianWorst médianGap médianFeaturesWin/OutRationale
baseline_v3_likeBaseline v3-likequeued0/4n/an/an/a /
time_pct_minmaxTime percentile minmaxqueued0/4n/an/an/a /
regime_featuresFeatures régimequeued0/4n/an/an/a /
longer_input_120Input 120queued0/4n/an/an/a /
shorter_output_20Output 20queued0/4n/an/an/a /
synthetic_pairsPaires synthétiquesqueued0/4n/an/an/a /
voltarget_returnsVol-target returnsqueued0/4n/an/an/a /
cross_sectional_relativeCross-sectionalqueued0/4n/an/an/a /
regime_voltargetRégime + vol-targetqueued0/4n/an/an/a /
short_input_40Input 40queued0/4n/an/an/a /
long_output_60Output 60queued0/4n/an/an/a /
no_signflip_ablationAblation sign-flipqueued0/4n/an/an/a /
fees_2bps_stressStress frais 2bpsqueued0/4n/an/an/a /
ta_ohlc_atr_rsi_output20OHLC technical indicators + output 20queued0/4n/an/an/aohlc_ta80 / 20High/low/open structure may distinguish breakout/range regimes better than returns alone; shorter target has been more stable in v4.
multi_resolution_regime_output20Multi-resolution regime proxy + output 20queued0/4n/an/an/amulti_resolution80 / 20Combine short/medium/long rolling horizons on the existing 6h grid before trying a new candle size.
cross_sectional_output20Cross-sectional relative features + output 20queued0/4n/an/an/across_sectional80 / 20Cross-sectional features had positive PNL median; combine with the more stable shorter target.
regime_ohlc_ta_output20Régime + OHLC/TA + horizon 20queued0/4n/an/an/aregime_ohlc_ta80 / 20Le meilleur signal complet reste shorter_output_20 (score Test médian -3.999, PNL médian positif, gap très faible). L'idée OHLC/TA déjà en queue teste high/low/ATR/RSI sans régime; cette variante atomique ajoute les marqueurs de régime car les familles ré
regime_multi_resolution_output20Régime + multi-résolution + horizon 20queued0/4n/an/an/aregime_multi_resolution80 / 20La multi-résolution simple est déjà en queue, mais les résultats complets montrent que les problèmes dominants sont worst-month et gap. Combiner horizons court/moyen/long avec features de régime peut permettre au modèle de distinguer momentum durable vs rebond
cross_sectional_output60Cross-sectional relative features + horizon 60queued0/4n/an/an/across_sectional80 / 60Les deux meilleures familles complètes par capital_score médian Test restent long_output_60 (-19.15, gain médian +9.94%, DD -20.98%) et cross_sectional_relative (-25.21, gain médian +9.65%). Cette hypothèse combine atomiquement l horizon 60, qui semble mieux a
fee2bps_shorter_output20_baseStress frais 2 bps sur base horizon 20queued0/4n/an/an/abase80 / 20shorter_output_20 est la direction complète la plus robuste (PNL Test médian positif et gap médian le plus faible), mais les scores actuels sont à frais 0. Un stress 2 bps teste si le signal économique vient d'un turnover fragile ou d'un vrai edge di

Journal chercheur

TimestampAgentTypeObservations / leçonsNext focus
2026-07-06T09:01:31Zassistant_one_shotisolated_val12m_test1m_one_runTest isolé Val12m/Test1m lancé sur TCN/Huber/AdamW. Résultat capital: Val score 15.23, Test score 18.52, Test gain 24.76%, Test DD -4.16%, seuil capital p80, exposure Test 0.16. Ancien economic_score Test positif 8.73.Candidat principal reste Val6m/Test1m ou Val3m/Test1m; si on poursuit, mini-protocole Val6m/Test1m 4 runs pour robustesse.
2026-07-06T12:05:12Zresearch_scientistreflectionLecture autonome du protocole v4 avec capital_score prioritaire. 13 familles observées dans la mémoire, dont 12 complètes ou sur-complètes et 1 idée système à 1/4. Les scores capital Test médians restent globalement négatifs; no_signflip_ablation devient la meilleure famille complète par médiane (-16.06) avec 2/4 runs positifs, mais son drawdown médian resteLaisser le runner consommer les 6 idées queued. Comparer en premier lieu chaque famille à no_signflip_ablation et long_output_60 sur capital_score Test médian, gain médian, DD médian, nombre de runs positifs et pire run. Si la queue repasse sous 6, prochaine h
2026-07-06T16:06:50Zresearch_scientistreflectionLecture autonome du protocole v4 avec capital_score prioritaire. 14 familles observées dans hermes_memory, 54 runs au total. Toutes les familles complètes restent négatives en score capital Test médian. long_output_60 redevient le meilleur score médian complet (-19.15) mais avec seulement 1/4 run positif; no_signflip_ablation est maintenant complet et garde Laisser le runner compléter les 6 hypothèses dynamiques existantes, en surveillant d'abord ta_ohlc_atr_rsi_output20 jusqu'à 4/4. Au prochain réveil, réévaluer si le nombre d'idées queued/active incomplètes est passé sous 6; si oui, candidat scientifique priori
2026-07-06T20:09:52+00:00research_scientistreflectionRéveil autonome avec capital_score comme métrique principale. La mémoire v4 contient 57 runs. Toutes les familles complètes restent négatives en capital_score Test médian. Les deux meilleurs compromis complets restent long_output_60 (-19.15, gain +9.94%, DD -20.98%, 1/4 positif) et no_signflip_ablation (-20.48, gain +32.70%, DD -32.81%, 2/4 positifs). cross_Laisser le runner consommer les 6 idées incomplètes/queued restantes après ajout: multi_resolution_regime_output20, cross_sectional_output20, regime_ohlc_ta_output20, regime_multi_resolution_output20, fee2bps_shorter_output20_base et cross_sectional_output60.
2026-07-06T23:03:20Zassistant_one_shotisolated_val6m_test6m_6models_one_runTest isolé Val6m/Test6m avec superposition jusqu à 6 modèles lancé sur TCN/Huber/AdamW. Résultat capital Test: score -36.01, gain 11.12%, max DD -31.42%, worst-month -26.54%, exposure 0.89, active_models=6. Validation reste forte: score 254.98, gain 287.17%, DD -21.46.Si on poursuit, confirmer Val6m/Test1m sur 4 architectures; envisager ensuite train 18m/24m seulement dans un protocole séparé.
2026-07-06T23:25:26Zassistant_one_shotisolated_train6m_val6m_test1m_one_runTest isolé Train6m/Val6m/Test1m lancé sur TCN/Huber/AdamW. Résultat capital Test: score -49.20, gain 8.51%, DD -38.47%, worst-month -28.73%. Validation: score 89.15, gain 123.97%, DD -23.22%.Si on poursuit, confirmer Train12/Val6/Test1m avec mini-protocole 4 runs avant toute promotion.

Règles

Le Test guide la direction de recherche mais ne sélectionne jamais le best_model ni les seuils. Une idée n'est promue qu'après 4 runs et amélioration médiane du Test, worst-month et gap.