Research queue

Hypothèses autonomes

Le chercheur propose des idées structurées; le runner exécute 4 runs par idée. Promotion seulement si signal répété et robustesse Test/worst-month.

Idées queue12JSONL
Runs scout84v4

Suivi des idées

IDHypothèseStatutRunsTest médianWorst médianGap médianFeaturesWin/OutRationale
baseline_v3_likeBaseline v3-likecomplete4/4-29.7793-6.32747-38.5064 /
time_pct_minmaxTime percentile minmaxcomplete4/4-11.1078-3.94901-18.5935 /
regime_featuresFeatures régimecomplete4/4-15.4457-3.54074-17.2876 /
longer_input_120Input 120complete4/4-39.2743-8.85574-38.3708 /
shorter_output_20Output 20complete4/4-8.7762-1.50437-1.3580 /
synthetic_pairsPaires synthétiquescomplete4/4-28.5205-6.31626-33.6816 /
voltarget_returnsVol-target returnscomplete4/4-19.3254-4.71668-23.2550 /
cross_sectional_relativeCross-sectionalcomplete4/4-13.4347-3.34918-16.4887 /
regime_voltargetRégime + vol-targetcomplete4/4-19.3254-4.71668-23.2550 /
short_input_40Input 40complete4/4-17.9288-4.43810-21.6640 /
long_output_60Output 60complete4/4-4.3860-3.46309-16.3481 /
no_signflip_ablationAblation sign-flipcomplete4/4-29.8400-11.70897-45.0498 /
fees_2bps_stressStress frais 2bpscomplete4/4-11.2657-3.54074-8.6940 /
ta_ohlc_atr_rsi_output20OHLC technical indicators + output 20complete4/4-21.4252-2.48270-19.9111ohlc_ta80 / 20High/low/open structure may distinguish breakout/range regimes better than returns alone; shorter target has been more stable in v4.
multi_resolution_regime_output20Multi-resolution regime proxy + output 20complete4/4-12.7914-1.21625-15.8276multi_resolution80 / 20Combine short/medium/long rolling horizons on the existing 6h grid before trying a new candle size.
cross_sectional_output20Cross-sectional relative features + output 20complete4/4-9.9778-2.08260-3.1944cross_sectional80 / 20Cross-sectional features had positive PNL median; combine with the more stable shorter target.
regime_ohlc_ta_output20Régime + OHLC/TA + horizon 20complete4/4-12.5099-1.35785-11.3707regime_ohlc_ta80 / 20Le meilleur signal complet reste shorter_output_20 (score Test médian -3.999, PNL médian positif, gap très faible). L'idée OHLC/TA déjà en queue teste high/low/ATR/RSI sans régime; cette variante atomique ajoute les marqueurs de régime car les familles ré
regime_multi_resolution_output20Régime + multi-résolution + horizon 20complete4/4-14.9553-2.77143-16.0851regime_multi_resolution80 / 20La multi-résolution simple est déjà en queue, mais les résultats complets montrent que les problèmes dominants sont worst-month et gap. Combiner horizons court/moyen/long avec features de régime peut permettre au modèle de distinguer momentum durable vs rebond
cross_sectional_output60Cross-sectional relative features + horizon 60promising4/4-4.1008-2.31037-12.9878cross_sectional80 / 60Les deux meilleures familles complètes par capital_score médian Test restent long_output_60 (-19.15, gain médian +9.94%, DD -20.98%) et cross_sectional_relative (-25.21, gain médian +9.65%). Cette hypothèse combine atomiquement l horizon 60, qui semble mieux a
no_signflip_multi_resolution_output20Multi-résolution output20 sans sign-flip traincomplete4/4-17.7877-3.85747-20.3893multi_resolution80 / 20La famille multi_resolution_regime_output20 est désormais le meilleur compromis complet par capital_score Test médian (-15.09) avec gain médian +21.87% et 2/4 runs positifs, mais un run catastrophique (-94.53) signale une fragilité de généralisation. L ablatio
fee2bps_shorter_output20_baseStress frais 2 bps sur base horizon 20complete4/4-7.2791-1.97065-1.6311base80 / 20shorter_output_20 est la direction complète la plus robuste (PNL Test médian positif et gap médian le plus faible), mais les scores actuels sont à frais 0. Un stress 2 bps teste si le signal économique vient d'un turnover fragile ou d'un vrai edge di
fee2bps_multi_resolution_output20Stress frais 2 bps sur multi-résolution output20queued0/4n/an/an/amulti_resolution80 / 20multi_resolution_regime_output20 est la meilleure famille complète au capital_score Test médian (-15.09) avec gain médian +21.87% et 2/4 runs positifs, mais son pire run (-94.53) et son ancien score économique médian faible signalent une fragilité. Cette hypot
regime_ohlc_ta_output60Régime + OHLC/TA + horizon 60queued0/4n/an/an/aregime_ohlc_ta80 / 60regime_ohlc_ta_output20 vient de se compléter avec un capital_score Test médian nettement meilleur que les autres variantes OHLC/TA et surtout un drawdown médian contenu (-17.20%) et un pire run modéré par rapport aux familles riches. Le gain médian reste faib
no_signflip_long_output60_regimeRégime horizon 60 sans sign-flip trainqueued0/4n/an/an/aregime80 / 60Les familles complètes les moins mauvaises au capital_score Test pointent vers deux mécanismes distincts: long_output_60 a le drawdown médian le plus contenu parmi les meilleurs candidats (-20.98%) et un pire run relativement modéré (-32.01), tandis que no_sig
regime_cross_sectional_output60Régime + cross-sectional relative features + horizon 60queued0/4n/an/an/aregime_cross_sectional80 / 60cross_sectional_output60 vient de se compléter comme deuxième meilleure famille au capital_score Test médian (-16.40), derrière multi_resolution_regime_output20 (-15.09) mais avec un gain médian plus faible (+5.15%) et une queue de risque encore trop lourde (p

Journal chercheur

TimestampAgentTypeObservations / leçonsNext focus
2026-07-07T12:18:56+00:00research_scientistreflectionRéveil autonome avec capital_score prioritaire. La mémoire v4 contient 71 runs et 18 familles. Toutes les familles complètes restent négatives en capital_score Test médian. Fait nouveau depuis le dernier journal: regime_ohlc_ta_output20 est maintenant complète et se place juste derrière le trio de tête avec un score médian -22.33, gain +3.53%, DD -17.20%, 1/Laisser le runner finir regime_multi_resolution_output20 puis consommer fee2bps_shorter_output20_base, cross_sectional_output60, no_signflip_multi_resolution_output20, fee2bps_multi_resolution_output20 et regime_ohlc_ta_output60. Au prochain réveil, si la queu
2026-07-07T16:20:46+00:00research_scientistreflectionRéveil autonome avec capital_score prioritaire. La mémoire v4 contient 75 runs et 19 familles observées. Toutes les familles complètes restent négatives en capital_score Test médian. La meilleure famille complète reste multi_resolution_regime_output20 (-15.09, gain +21.87%, DD -24.64%, 2/4 positifs) mais son pire run -94.53 empêche toute promotion robuste. lSurveiller d'abord cross_sectional_output60 jusqu'à 4/4: si le gain médian devient positif avec drawdown acceptable, comparer à long_output_60; sinon déprioriser la famille cross-sectionnelle à horizon long. Ensuite regarder si no_signflip_long_output60_regime
2026-07-07T20:23:30Zresearch_scientistreflectionRéveil autonome avec capital_score prioritaire. La mémoire v4 contient 78 runs et 20 familles observées. Toutes les familles complètes restent négatives en capital_score Test médian. La meilleure famille reste multi_resolution_regime_output20 (-15.09, gain +21.87%, DD -24.64%, 2/4 positifs) mais son pire run -94.53 empêche une promotion robuste. Nouveau faitLaisser le runner traiter les 6 idées incomplètes. Comparer en priorité no_signflip_multi_resolution_output20, fee2bps_multi_resolution_output20 et regime_cross_sectional_output60 contre multi_resolution_regime_output20 et cross_sectional_output60. Prochain aj
2026-07-08T03:57:10Zassistant_one_shotsynthetic_random_baskets_protocol_v1Mise en place d un protocole isolé one_shot_synthetic_random_baskets_v1_20260707. Étape 1 diagnostic: 256 paniers synthétiques avec inverses, 10 actifs, poids normalisés L1, vol médiane 0.0168 vs panier original 0.0185, corr médiane à original 0.0 avec p10/p90 ±0.972. Étape 2 baseline original-only Test score -28.84; augmentation Train-only synthétiques puisSi l utilisateur valide, refaire avec modèle proche du pipeline TCN/MLP existant ou mini-protocole seeds multiples sur Train-only augmentation.
2026-07-08T13:38:41+00:00research_scientist_script_fallbackreflectionFallback déterministe activé car backend Codex LLM gpt-5.x timeout. Runs complets=79; idées queued/active=12; idées incomplètes estimées=6.Surveiller le runner v4 et lancer un vrai protocole v5 synthetic seulement sur décision utilisateur.
2026-07-08T17:38:51+00:00research_scientist_script_fallbackreflectionFallback déterministe activé car backend Codex LLM gpt-5.x timeout. Runs complets=83; idées queued/active=12; idées incomplètes estimées=5.Surveiller le runner v4 et lancer un vrai protocole v5 synthetic seulement sur décision utilisateur.

Règles

Le Test guide la direction de recherche mais ne sélectionne jamais le best_model ni les seuils. Une idée n'est promue qu'après 4 runs et amélioration médiane du Test, worst-month et gap.