Research queue
Hypothèses autonomes
Le chercheur propose des idées structurées; le runner exécute 4 runs par idée. Promotion seulement si signal répété et robustesse Test/worst-month.
Idées queue12JSONL
Runs scout84v4
Suivi des idées
| ID | Hypothèse | Statut | Runs | Test médian | Worst médian | Gap médian | Features | Win/Out | Rationale |
|---|---|---|---|---|---|---|---|---|---|
| baseline_v3_like | Baseline v3-like | complete | 4/4 | -29.7793 | -6.32747 | -38.5064 | / | ||
| time_pct_minmax | Time percentile minmax | complete | 4/4 | -11.1078 | -3.94901 | -18.5935 | / | ||
| regime_features | Features régime | complete | 4/4 | -15.4457 | -3.54074 | -17.2876 | / | ||
| longer_input_120 | Input 120 | complete | 4/4 | -39.2743 | -8.85574 | -38.3708 | / | ||
| shorter_output_20 | Output 20 | complete | 4/4 | -8.7762 | -1.50437 | -1.3580 | / | ||
| synthetic_pairs | Paires synthétiques | complete | 4/4 | -28.5205 | -6.31626 | -33.6816 | / | ||
| voltarget_returns | Vol-target returns | complete | 4/4 | -19.3254 | -4.71668 | -23.2550 | / | ||
| cross_sectional_relative | Cross-sectional | complete | 4/4 | -13.4347 | -3.34918 | -16.4887 | / | ||
| regime_voltarget | Régime + vol-target | complete | 4/4 | -19.3254 | -4.71668 | -23.2550 | / | ||
| short_input_40 | Input 40 | complete | 4/4 | -17.9288 | -4.43810 | -21.6640 | / | ||
| long_output_60 | Output 60 | complete | 4/4 | -4.3860 | -3.46309 | -16.3481 | / | ||
| no_signflip_ablation | Ablation sign-flip | complete | 4/4 | -29.8400 | -11.70897 | -45.0498 | / | ||
| fees_2bps_stress | Stress frais 2bps | complete | 4/4 | -11.2657 | -3.54074 | -8.6940 | / | ||
| ta_ohlc_atr_rsi_output20 | OHLC technical indicators + output 20 | complete | 4/4 | -21.4252 | -2.48270 | -19.9111 | ohlc_ta | 80 / 20 | High/low/open structure may distinguish breakout/range regimes better than returns alone; shorter target has been more stable in v4. |
| multi_resolution_regime_output20 | Multi-resolution regime proxy + output 20 | complete | 4/4 | -12.7914 | -1.21625 | -15.8276 | multi_resolution | 80 / 20 | Combine short/medium/long rolling horizons on the existing 6h grid before trying a new candle size. |
| cross_sectional_output20 | Cross-sectional relative features + output 20 | complete | 4/4 | -9.9778 | -2.08260 | -3.1944 | cross_sectional | 80 / 20 | Cross-sectional features had positive PNL median; combine with the more stable shorter target. |
| regime_ohlc_ta_output20 | Régime + OHLC/TA + horizon 20 | complete | 4/4 | -12.5099 | -1.35785 | -11.3707 | regime_ohlc_ta | 80 / 20 | Le meilleur signal complet reste shorter_output_20 (score Test médian -3.999, PNL médian positif, gap très faible). L'idée OHLC/TA déjà en queue teste high/low/ATR/RSI sans régime; cette variante atomique ajoute les marqueurs de régime car les familles ré |
| regime_multi_resolution_output20 | Régime + multi-résolution + horizon 20 | complete | 4/4 | -14.9553 | -2.77143 | -16.0851 | regime_multi_resolution | 80 / 20 | La multi-résolution simple est déjà en queue, mais les résultats complets montrent que les problèmes dominants sont worst-month et gap. Combiner horizons court/moyen/long avec features de régime peut permettre au modèle de distinguer momentum durable vs rebond |
| cross_sectional_output60 | Cross-sectional relative features + horizon 60 | promising | 4/4 | -4.1008 | -2.31037 | -12.9878 | cross_sectional | 80 / 60 | Les deux meilleures familles complètes par capital_score médian Test restent long_output_60 (-19.15, gain médian +9.94%, DD -20.98%) et cross_sectional_relative (-25.21, gain médian +9.65%). Cette hypothèse combine atomiquement l horizon 60, qui semble mieux a |
| no_signflip_multi_resolution_output20 | Multi-résolution output20 sans sign-flip train | complete | 4/4 | -17.7877 | -3.85747 | -20.3893 | multi_resolution | 80 / 20 | La famille multi_resolution_regime_output20 est désormais le meilleur compromis complet par capital_score Test médian (-15.09) avec gain médian +21.87% et 2/4 runs positifs, mais un run catastrophique (-94.53) signale une fragilité de généralisation. L ablatio |
| fee2bps_shorter_output20_base | Stress frais 2 bps sur base horizon 20 | complete | 4/4 | -7.2791 | -1.97065 | -1.6311 | base | 80 / 20 | shorter_output_20 est la direction complète la plus robuste (PNL Test médian positif et gap médian le plus faible), mais les scores actuels sont à frais 0. Un stress 2 bps teste si le signal économique vient d'un turnover fragile ou d'un vrai edge di |
| fee2bps_multi_resolution_output20 | Stress frais 2 bps sur multi-résolution output20 | queued | 0/4 | n/a | n/a | n/a | multi_resolution | 80 / 20 | multi_resolution_regime_output20 est la meilleure famille complète au capital_score Test médian (-15.09) avec gain médian +21.87% et 2/4 runs positifs, mais son pire run (-94.53) et son ancien score économique médian faible signalent une fragilité. Cette hypot |
| regime_ohlc_ta_output60 | Régime + OHLC/TA + horizon 60 | queued | 0/4 | n/a | n/a | n/a | regime_ohlc_ta | 80 / 60 | regime_ohlc_ta_output20 vient de se compléter avec un capital_score Test médian nettement meilleur que les autres variantes OHLC/TA et surtout un drawdown médian contenu (-17.20%) et un pire run modéré par rapport aux familles riches. Le gain médian reste faib |
| no_signflip_long_output60_regime | Régime horizon 60 sans sign-flip train | queued | 0/4 | n/a | n/a | n/a | regime | 80 / 60 | Les familles complètes les moins mauvaises au capital_score Test pointent vers deux mécanismes distincts: long_output_60 a le drawdown médian le plus contenu parmi les meilleurs candidats (-20.98%) et un pire run relativement modéré (-32.01), tandis que no_sig |
| regime_cross_sectional_output60 | Régime + cross-sectional relative features + horizon 60 | queued | 0/4 | n/a | n/a | n/a | regime_cross_sectional | 80 / 60 | cross_sectional_output60 vient de se compléter comme deuxième meilleure famille au capital_score Test médian (-16.40), derrière multi_resolution_regime_output20 (-15.09) mais avec un gain médian plus faible (+5.15%) et une queue de risque encore trop lourde (p |
Journal chercheur
| Timestamp | Agent | Type | Observations / leçons | Next focus |
|---|---|---|---|---|
| 2026-07-07T12:18:56+00:00 | research_scientist | reflection | Réveil autonome avec capital_score prioritaire. La mémoire v4 contient 71 runs et 18 familles. Toutes les familles complètes restent négatives en capital_score Test médian. Fait nouveau depuis le dernier journal: regime_ohlc_ta_output20 est maintenant complète et se place juste derrière le trio de tête avec un score médian -22.33, gain +3.53%, DD -17.20%, 1/ | Laisser le runner finir regime_multi_resolution_output20 puis consommer fee2bps_shorter_output20_base, cross_sectional_output60, no_signflip_multi_resolution_output20, fee2bps_multi_resolution_output20 et regime_ohlc_ta_output60. Au prochain réveil, si la queu |
| 2026-07-07T16:20:46+00:00 | research_scientist | reflection | Réveil autonome avec capital_score prioritaire. La mémoire v4 contient 75 runs et 19 familles observées. Toutes les familles complètes restent négatives en capital_score Test médian. La meilleure famille complète reste multi_resolution_regime_output20 (-15.09, gain +21.87%, DD -24.64%, 2/4 positifs) mais son pire run -94.53 empêche toute promotion robuste. l | Surveiller d'abord cross_sectional_output60 jusqu'à 4/4: si le gain médian devient positif avec drawdown acceptable, comparer à long_output_60; sinon déprioriser la famille cross-sectionnelle à horizon long. Ensuite regarder si no_signflip_long_output60_regime |
| 2026-07-07T20:23:30Z | research_scientist | reflection | Réveil autonome avec capital_score prioritaire. La mémoire v4 contient 78 runs et 20 familles observées. Toutes les familles complètes restent négatives en capital_score Test médian. La meilleure famille reste multi_resolution_regime_output20 (-15.09, gain +21.87%, DD -24.64%, 2/4 positifs) mais son pire run -94.53 empêche une promotion robuste. Nouveau fait | Laisser le runner traiter les 6 idées incomplètes. Comparer en priorité no_signflip_multi_resolution_output20, fee2bps_multi_resolution_output20 et regime_cross_sectional_output60 contre multi_resolution_regime_output20 et cross_sectional_output60. Prochain aj |
| 2026-07-08T03:57:10Z | assistant_one_shot | synthetic_random_baskets_protocol_v1 | Mise en place d un protocole isolé one_shot_synthetic_random_baskets_v1_20260707. Étape 1 diagnostic: 256 paniers synthétiques avec inverses, 10 actifs, poids normalisés L1, vol médiane 0.0168 vs panier original 0.0185, corr médiane à original 0.0 avec p10/p90 ±0.972. Étape 2 baseline original-only Test score -28.84; augmentation Train-only synthétiques puis | Si l utilisateur valide, refaire avec modèle proche du pipeline TCN/MLP existant ou mini-protocole seeds multiples sur Train-only augmentation. |
| 2026-07-08T13:38:41+00:00 | research_scientist_script_fallback | reflection | Fallback déterministe activé car backend Codex LLM gpt-5.x timeout. Runs complets=79; idées queued/active=12; idées incomplètes estimées=6. | Surveiller le runner v4 et lancer un vrai protocole v5 synthetic seulement sur décision utilisateur. |
| 2026-07-08T17:38:51+00:00 | research_scientist_script_fallback | reflection | Fallback déterministe activé car backend Codex LLM gpt-5.x timeout. Runs complets=83; idées queued/active=12; idées incomplètes estimées=5. | Surveiller le runner v4 et lancer un vrai protocole v5 synthetic seulement sur décision utilisateur. |
Règles
Le Test guide la direction de recherche mais ne sélectionne jamais le best_model ni les seuils. Une idée n'est promue qu'après 4 runs et amélioration médiane du Test, worst-month et gap.