Methodik
Test-Setup (gilt für alle Untersuchungen)
Getestet wird das real verfügbare Instrument (IG CFD GER40) auf dem real verfügbaren Zeitraum — kein Anspruch auf Mehrjahres-Historie oder Futures-Semantik. Research-Backtests enden 21 Tage vor heute (Daten-Embargo): die jüngsten Wochen bleiben für die Forward-Validierung unberührt.
Methodik-Regeln
Trial Ledger (technisch erzwungen, seit 11.07.2026)
Jede Variante wird VOR der Ausführung im Trial Ledger registriert — auch Optimizer-Grids und Exit-Lab-Policies. Ohne Registrierung läuft kein Backtest (Enforcement im Runner, nicht per Konvention). Die Multiple-Testing-Debt pro Hypothesenfamilie ist öffentlich: je mehr Trials eine Familie verbraucht hat, desto strenger ist ein einzelner Treffer zu lesen.
Daten-Embargo + Forward-Validierung (erzwungen)
Research sieht die letzten 21 Tage nie — seit 11.07.2026 technisch erzwungen: die Backtest-Sandbox verweigert jedes Fenster, das in die Embargo-Zone reicht. Jeder abgeschlossene Monat wird als echtes Out-of-Sample gegen alle eingefrorenen Kandidaten getestet; Parameter werden nach dem Einfrieren nie angepasst.
Optimierung ohne Selbstbetrug
Optimiert wird nur bei Signal, mit beim Bau vorregistriertem Grid, In-Sample-Auswahl und genau einem Out-of-Sample-Test — der die unoptimierte Baseline schlagen muss. Der Report zeigt die volle Grid-Fläche plus Plateau-Check: ein isoliertes Optimum ohne tragende Nachbarn wird als Zufallsverdacht markiert (Stability Map).
Schwellen für Kennzahlen ohne Warnung
Mindestens 100 Trades und ein echtes Out-of-Sample-Segment. Darunter werden Ergebnisse nur mit ausdrücklichem Vorbehalt gezeigt.
Robustheits-Score (vorregistriert, v1.0 / 2026-06-12)
0-100 Punkte aus festen Komponenten: Stichprobe (25, voll ab n=100), Signifikanz (25, voll wenn die PF-CI-Untergrenze >= 1.4), Konzentration (15, voll wenn Top-3-Trades <= 30% des Gewinns), Kosten (15, voll wenn PF trotz +1 Pkt/Seite Slippage >= 1.3), Regimebreite (10), Forward-Monate (10). Die Formel wird nie an Ergebnisse angepasst — sonst optimiert man den Score statt den Edge. Der Score misst Belastbarkeit der Messung, nicht Edge-Höhe.
Run-Manifest + Canary-Replay
Jeder Build trägt ein Manifest: Engine-Fingerprint (Hash über die Kern-Engine-Dateien), Datenstand, Fenster, Kostenmodell und Trial-Referenz — zwei Ergebnisse mit unterschiedlichem Fingerprint sind nicht 1:1 vergleichbar. Wöchentlich prüft ein Canary-Replay, dass Backtest- und Live-Engine aus demselben Tickstrom identische Bars und Regime-Labels bauen — Backtest-Treue wird gemessen, nicht angenommen.
Placebo-Kontrolle (Negative Control)
Der beste Trial jedes Builds wird gegen 20 Zufalls-Replikationen mit identischer Trade-Geometrie getestet (Entry-Zeitpunkt ±60 Min verschoben, Richtung/Tag/Haltedauer erhalten). Liegt der Kandidat nicht deutlich über der Placebo-Verteilung, ist sein Timing-Beitrag von Zufall nicht unterscheidbar — das steht dann so im Dossier.
Exit-Forschung mit eingefrorenen Entries
Stop-/Exit-Systeme werden isoliert erforscht: das Entry-Set einer Strategie wird eingefroren, dann laufen vorregistrierte Exit-Policies über identische Tickpfade (inkl. Broker-Realität: Mindestabstände, Amendment-Kadenz). Globale Stop-Regeln sind bewusst auf das Broker-Minimum reduziert — maximale Freiheit für adaptive Exit-Systeme, der A/B durch die echte Engine entscheidet.
Statistik-Härtung (additiv zum Score)
Zusätzlich zum vorregistrierten Score v1.0: Block-Bootstrap-Konfidenzintervalle über Tages-Blöcke (erhalten Verlustserien — ehrlicher als Einzeltrade-Resampling), Power-Check (ist der gemessene Edge mit dieser Stichprobe überhaupt nachweisbar?) und Leave-one-month-out (hängt das Ergebnis an einem einzigen Monat?). Die Score-Formel selbst bleibt unverändert, damit alte Builds vergleichbar bleiben.
Verification-Levels
Die Forschungsautomatik erzeugt maximal Level 0-4. WARCHHOLD VERIFIED (5) verlangt eine vom Builder getrennte Prüfung und eine berechtigte Agenten- oder Menschenentscheidung. LIVE VERIFIED (6) setzt reale, versionsgebundene Bewährung voraus; ein Backtest kann diesen Level nie erzeugen.
Übernahme ins Handelssystem
Research-Kandidaten bleiben bis zur erfolgreichen Verifikation getrennt. Danach darf eine berechtigte E-11/E-12-Agenten- oder Menschenentscheidung einen exakt gebundenen Kandidaten freigeben. Der deterministische Controller darf daraus ausschließlich einen begrenzten IG-DEMO-Slot erzeugen; Echtgeld bleibt außerhalb dieser Automatik.
Verification-Framework
0 = Ungeprüft
1 = Reproduziert
2 = Backtest Verifiziert
3 = Robustheitsgeprüft
4 = Out-of-Sample Verifiziert
5 = WARCHHOLD VERIFIED
6 = LIVE VERIFIED
Agenten-Pipeline
Live-Überwachung läuft serverseitig (systemd); fehlgeschlagene Läufe — auch Speicher-Kills — lösen einen Telegram-Alarm aus.
| Agent | Aufgabe | Takt · Modus | Provider | Aktivierung | Letzter Lauf | Status |
|---|---|---|---|---|---|---|
| Literatur-Research-Agent | Durchsucht arXiv, SSRN, QuantConnect und etablierte Quant-Blogs nach neuen Intraday-Strategien für DAX; extrahiert Funde strukturiert ins Research-Log (max. 3 pro Tag, Dedupe gegen Bestand). | Täglich 00:05 (auch Wochenende/Feiertage) autonom | Claude/Anthropic · Opus · Claude-Kontingent | aktiv | 07-20 07:43 | ok |
| Klassik-Literatur-Research-Agent | Wie der Literatur-Agent, aber für die klassische/ältere akademische Finanzliteratur (seminale Journal-Artikel, NBER, frühe Anomalie- und Mikrostruktur-Forschung vor ~2000), die der arXiv/SSRN-Lauf nicht abdeckt. Extrahiert handelbare Intraday-Kandidaten kritisch (Tier-Regeln, baubar ja/nein), prüft besonders auf Decay/Arbitrage seit Publikation und Übertragbarkeit auf DAX-Intraday, und schreibt in denselben Research-Log → Auto-Build implementiert die besten Funde. | Täglich 12:00 (getrennt vom Literatur-Lauf 00:05) autonom | Claude/Anthropic · Opus · Claude-Kontingent | aktiv | 07-20 12:05 | ok |
| Empirie-Research-Agent | Forscht in den EIGENEN canonical DAX-Tickdaten statt in fremder Literatur: eine deterministische Phase rechnet vorregistrierte Statistik-Familien (Tageszeit-Drift, Gap-Verhalten, Vola-Clustering, Breakout-Persistenz u.a.) auf einem Discovery-Fenster; das LLM (Fable, Mythos-Klasse) destilliert daraus max. 2 falsifizierbare Hypothesen — mit hartem Multiple-Testing-Rahmen (Bonferroni-Kontext, alle Buckets offengelegt) und Mechanismus-Pflicht. Auto-Build testet erzwungen auf dem disjunkten Holdout-Fenster (test_start-Enforcement); die letzten 21 Tage bleiben für die Forward-Validierung gesperrt. Auch Bausteine (Stop-Systeme, Indikatoren, Filter) sind vollwertige Funde und werden als A/B-Overlay getestet. | Wöchentlich So 13:00 (Datenbasis wächst nur ~5 Handelstage/Woche) autonom | Claude/Anthropic · Fable/Opus-Fallback · Claude-Kontingent | aktiv | 07-19 13:03 | ok |
| Katalog-Research-Agent | Implementiert klassische Archetyp-Familien als interne Plugins, führt reproduzierbare Backtests aus und dokumentiert Ergebnisse inkl. vollständiger Trial-Zählung. | On-Demand (interaktive Session mit Review) interaktiv | Claude/Anthropic · interaktiv · Claude-Kontingent | aktiv | 06-10 13:00 | ok |
| Forward-Validator | Re-Test ALLER eingefrorenen Kandidaten (forward_candidates.json, wachsende Liste — auch Auto-Build- und Optimizer-Ergebnisse) auf dem jeweils abgeschlossenen Vormonat: echtes, unverbrennbares Out-of-Sample. Eingefrorene Parameter werden nie nachgetunt. | Monatlich, 1. Samstag 09:17 (Wochenend-Fenster) autonom | Deterministisch · kein LLM-Kontingent | aktiv | 07-04 09:17 | ok |
| Auto-Build-Agent | Implementiert bis zu 3 noch nicht gebaute Tier-1/2-Funde pro Lauf sequenziell als Plugins. Claude schreibt Code + Trial-Spec; der deterministische Runner führt die vorregistrierten A/B-/Backtests aus. Ergebnisse bleiben Entwurf, bis eine getrennte Rolle die exakte Version geprüft hat. | Täglich 00:35 (nach dem Literatur-Lauf) autonom | Claude/Anthropic · Opus · Claude-Kontingent | aktiv | 07-20 08:45 | ok |
| Canary-Replay (deterministisch) | Wöchentlicher Paritätstest: derselbe Tickstrom eines kompletten Handelstags läuft durch die Backtest-Engine UND den Live-Bar-Builder — verglichen werden Bars (OHLC exakt), Regime-Labels und die Indikator-Kette. Divergenz = Alarm ('Backtests sind nicht live-treu'). Kein LLM — reine Replay-Logik. Motivation: drei BT≠Live-Bugs in einer Woche (Juli 2026), alle in genau dieser Schicht. | Samstag 08:15 (vor dem Optimizer-Lauf) autonom | Deterministisch · kein LLM-Kontingent | aktiv | 07-18 08:15 | ok |
| Auto-Optimize (bedingt) | Optimiert NUR Kandidaten mit Signal: vorregistriertes Grid (beim Bau festgelegt), Auswahl nur In-Sample, ein einziger Out-of-Sample-Test gegen die Baseline. Bestätigte Parameter gehen eingefroren in die Forward-Validierung — Overfitting wird so strukturell verhindert. | Samstag 10:23 (nur bei vorliegenden Kandidaten) autonom | Deterministisch · kein LLM-Kontingent | aktiv | 07-18 10:23 | ok |
| SIP Shadow Curator | Kuriert read-only Beziehungen, Deduplizierungs- und Taxonomievorschläge für das neue System-Gehirn. Jeder Hinweis bleibt ein verfallender E0-Schattenbeitrag ohne W1–W5-, K3-, Strategie- oder Produktionswirkung. | On-Demand; noch kein autonomer Timer geplant | OpenAI Codex · ChatGPT/Codex-Kontingent | aktiv | — | ready on demand |
| SIP Conflict Auditor | Sucht read-only nach widersprüchlichen Verträgen, veralteten Annahmen und Provenienzkonflikten. Er dokumentiert beide Seiten, entscheidet den Konflikt aber nicht und kann weder VA/R-U noch K3 ersetzen. | On-Demand; noch kein autonomer Timer geplant | OpenAI Codex · ChatGPT/Codex-Kontingent | aktiv | 07-19 14:45 | ok |
| SIP Evidence Librarian | Prüft read-only Quellenbindungen, Referenzen, Frische, Ablauf und Abdeckung der Gehirn-Evidenz. Er repariert keine Evidenz und erteilt keine formale Abnahme. | On-Demand; noch kein autonomer Timer geplant | OpenAI Codex · ChatGPT/Codex-Kontingent | aktiv | 07-19 14:45 | ok |
| SIP Demo-Deployment Governor | Entscheidet nach E-11/E-12 read-only über einen vollständig qualifizierten Strategie-Treffer. Prüft exakte Version, getrennte Discovery-/Forward-Evidenz, Anti-Overfitting, unabhängige BT/Live-Parität und Demo-Grenzen. Kann nur zustimmen oder ablehnen; der Agent schreibt weder Trading-DB noch Broker. | Ereignisgesteuert; nur wenn ein governed promoted+canonical Kandidat vorliegt autonom | OpenAI Codex · ChatGPT/Codex-Kontingent | aktiv | — | bereit wartet auf qualifizierten kandidaten |
| SIP AP-Acceptance Governor | Entscheidet nach E-11 read-only über exakte AP-Pakete, deren Vertrag keine unabhängige Prüfung verlangt. Der erste zulässige Umfang ist AP-03/AP-04. Er darf unabhängige AP-Gates niemals ersetzen und schreibt weder Review-Ledger noch Produktionssysteme selbst. | Stündlich; nur bei neuem unverarbeitetem AP-03-/AP-04-Paket autonom | OpenAI Codex · ChatGPT/Codex-Kontingent | aktiv | 07-19 21:58 | ok ap03 ap04 angenommen |
| SIP Risk-Operations Governor | Entscheidet nach E-11 read-only über eng begrenzte Betriebsparameter. Der erste Auftrag setzt für AP-08 ausschließlich reale Beobachtungsdauer und Mindestdauer einer späteren unabhängigen Ausfallprobe. Er darf die Probe nicht starten, AP-08 nicht abnehmen, AP-10 nicht öffnen und weder Trading noch Produktion verändern. | Ereignisgesteuert; genau eine materielle AP-08-Parameterentscheidung autonom | OpenAI Codex · ChatGPT/Codex-Kontingent | aktiv | 07-19 22:36 | ok parameter gesetzt |
| SIP Function-Protection Governor | Entscheidet nach E-11 read-only über exakt gebundene W2/K2-Änderungen an geschützten Funktionen. Er darf nur streng fail-closed wirkende Änderungen annehmen und erweitert niemals LIVE-, Order-, Sizing-, Stop-, Dienst- oder Produktionsbefugnisse. | Ereignisgesteuert; bei einem neuen exakten Ring-4-Sicherheitskandidaten autonom | OpenAI Codex · ChatGPT/Codex-Kontingent | aktiv | 07-20 07:25 | e03 konflikt korrigiert w2 entscheidung offen |
| SIP Library-Maintenance Governor | Entscheidet nach E-11/K3 read-only über genau ein rollback-geschütztes Strategy-Library-Wartungsfenster. Er kann nur die exakte DEMO-Sequenz Stoppen, Flat-Recheck, Snapshot, Migration, Prüfung und Neustart derselben Dienste freigeben; ausführen darf sie ausschließlich der deterministische Executor. | Ereignisgesteuert; nur mit separatem Funktionsschutz-Review und frischen DB-/Broker-Flat-Belegen autonom | OpenAI Codex · ChatGPT/Codex-Kontingent | aktiv | — | bereit wartet auf exaktes wartungspaket |
| SIP Strategy Evidence Verifier | Prüft read-only eine exakte, eingefrorene Claude-Strategieversion samt getrennter Discovery-/Forward-Evidence, vollständigem Anti-Overfitting-Paket und versionsspezifischer BT/Live-Parität. Baut nichts, entscheidet kein Deployment und besitzt keine Tradingwirkung. | Ereignisgesteuert; nur nach eingefrorenem Claude-Kandidaten und vollständigem Evidenzpaket autonom | OpenAI Codex · ChatGPT/Codex-Kontingent | aktiv | — | bereit wartet auf eingefrorenen claude kandidaten |
| Demo-Slot Controller | Deterministischer Executor ohne LLM: validiert Agentenentscheidung, Library-Receipts, Source-Hashes, Canonical-Status und aktives IG-DEMO-Konto erneut und legt idempotent höchstens einen begrenzten Auto-Demo-Slot an. LIVE/Echtgeld wird doppelt fail-closed gesperrt. | Ereignisgesteuert nach einer gültigen Governor-Entscheidung autonom | Deterministisch · kein LLM-Kontingent | aktiv | 07-19 22:03 | ok idle policy not installed |
| VA-02/VA-03 Independent Verifier | Formale, organisatorisch vom Codex-Builder getrennte Instanz für Phase A und B. Codex hat die operative Vorarbeit abgeschlossen: strategieinterne Symbolbindung DAX/NIKKEI, vier performanceblind ereignisfähige VA-02-Fälle und ein VA-03-Träger mit Engine-Status OK. Claude ist gemäß Provider-Richtlinie ausgeschlossen und bleibt ausschließlich Strategie-Research und -Build vorbehalten. | Kein Timer aktiv; Transport v7 wartet auf die Zuweisung eines unabhängigen Nicht-Claude-Prüfers blockiert | Noch nicht zugewiesen · unabhängiger Nicht-Claude-Prüfer erforderlich | aktiv | 07-19 16:10 | blockiert provider nicht zugewiesen |
| VA-02/VA-03 Phase-A Selector | Formale, performanceblinde Auswahl- und Preregister-Rolle für einen frischen VA-02/VA-03-Freeze. Codex hat Transport und Kandidatenträger vorbereitet, darf diese eigene Vorarbeit aber nicht als unabhängig abzeichnen. Claude ist für diese Rolle ausgeschlossen. | Kein Timer aktiv; wartet auf einen unabhängigen Nicht-Claude-Prüfer blockiert | Noch nicht zugewiesen · unabhängiger Nicht-Claude-Prüfer erforderlich | aktiv | — | blockiert provider nicht zugewiesen |
| VA-02/VA-03 R-U-Reconciler | Frische, vom Phase-B-Produzenten getrennte Einmalinstanz für zwölf Reconciliationgruppen und mindestens drei eigene Angriffe. Der historische Claude-Lauf erzeugte substanzielle Prüfarbeitsartefakte, verfehlte aber Safe-Output- und Reportvertrag; formal ist kein R-U etabliert. Künftige R-U-Läufe dürfen gemäß Provider-Richtlinie nicht über Claude laufen. | Einmalig abgeschlossen am 19.07.2026; keine Retry-Freigabe blockiert | Noch nicht zugewiesen · unabhängiger Nicht-Claude-Prüfer erforderlich | aktiv | 07-19 15:07 | terminal provider unassigned |
Rollen der Autonomie: Claude recherchiert und baut Strategie-, Indikator-, Regime- und Stop-Hypothesen. Deterministische Runner testen sie. Getrennte Codex-Agenten dürfen innerhalb E-11/E-12 prüfen und entscheiden; nur der Controller darf anschließend einen begrenzten IG-DEMO-Slot schreiben. Generierter Strategiecode läuft ohne Shell-Zugriff, mit Import-Allowlist und ohne Netzwerk.