Warchhold Research

Methodik

Test-Setup (gilt für alle Untersuchungen)

Daten
IG CFD GER40 Ticks, 2026-03-17 bis 2026-06-09, 63 Handelstage, 10.0 Mio Ticks
Engine
Warchhold canonical_v2 (Tick-Replay, reale Bid/Ask-Spreads)
Kosten
Spread real aus Ticks + 0.5 Pt Slippage pro Seite, keine Kommission
Session
Entry ab 09:00, Session-Ende 17:30, Hold bis max. 20:00 (Europe/Berlin)

Getestet wird das real verfügbare Instrument (IG CFD GER40) auf dem real verfügbaren Zeitraum — kein Anspruch auf Mehrjahres-Historie oder Futures-Semantik. Research-Backtests enden 21 Tage vor heute (Daten-Embargo): die jüngsten Wochen bleiben für die Forward-Validierung unberührt.

Methodik-Regeln

Trial Ledger (technisch erzwungen, seit 11.07.2026)

Jede Variante wird VOR der Ausführung im Trial Ledger registriert — auch Optimizer-Grids und Exit-Lab-Policies. Ohne Registrierung läuft kein Backtest (Enforcement im Runner, nicht per Konvention). Die Multiple-Testing-Debt pro Hypothesenfamilie ist öffentlich: je mehr Trials eine Familie verbraucht hat, desto strenger ist ein einzelner Treffer zu lesen.

Daten-Embargo + Forward-Validierung (erzwungen)

Research sieht die letzten 21 Tage nie — seit 11.07.2026 technisch erzwungen: die Backtest-Sandbox verweigert jedes Fenster, das in die Embargo-Zone reicht. Jeder abgeschlossene Monat wird als echtes Out-of-Sample gegen alle eingefrorenen Kandidaten getestet; Parameter werden nach dem Einfrieren nie angepasst.

Optimierung ohne Selbstbetrug

Optimiert wird nur bei Signal, mit beim Bau vorregistriertem Grid, In-Sample-Auswahl und genau einem Out-of-Sample-Test — der die unoptimierte Baseline schlagen muss. Der Report zeigt die volle Grid-Fläche plus Plateau-Check: ein isoliertes Optimum ohne tragende Nachbarn wird als Zufallsverdacht markiert (Stability Map).

Schwellen für Kennzahlen ohne Warnung

Mindestens 100 Trades und ein echtes Out-of-Sample-Segment. Darunter werden Ergebnisse nur mit ausdrücklichem Vorbehalt gezeigt.

Robustheits-Score (vorregistriert, v1.0 / 2026-06-12)

0-100 Punkte aus festen Komponenten: Stichprobe (25, voll ab n=100), Signifikanz (25, voll wenn die PF-CI-Untergrenze >= 1.4), Konzentration (15, voll wenn Top-3-Trades <= 30% des Gewinns), Kosten (15, voll wenn PF trotz +1 Pkt/Seite Slippage >= 1.3), Regimebreite (10), Forward-Monate (10). Die Formel wird nie an Ergebnisse angepasst — sonst optimiert man den Score statt den Edge. Der Score misst Belastbarkeit der Messung, nicht Edge-Höhe.

Run-Manifest + Canary-Replay

Jeder Build trägt ein Manifest: Engine-Fingerprint (Hash über die Kern-Engine-Dateien), Datenstand, Fenster, Kostenmodell und Trial-Referenz — zwei Ergebnisse mit unterschiedlichem Fingerprint sind nicht 1:1 vergleichbar. Wöchentlich prüft ein Canary-Replay, dass Backtest- und Live-Engine aus demselben Tickstrom identische Bars und Regime-Labels bauen — Backtest-Treue wird gemessen, nicht angenommen.

Placebo-Kontrolle (Negative Control)

Der beste Trial jedes Builds wird gegen 20 Zufalls-Replikationen mit identischer Trade-Geometrie getestet (Entry-Zeitpunkt ±60 Min verschoben, Richtung/Tag/Haltedauer erhalten). Liegt der Kandidat nicht deutlich über der Placebo-Verteilung, ist sein Timing-Beitrag von Zufall nicht unterscheidbar — das steht dann so im Dossier.

Exit-Forschung mit eingefrorenen Entries

Stop-/Exit-Systeme werden isoliert erforscht: das Entry-Set einer Strategie wird eingefroren, dann laufen vorregistrierte Exit-Policies über identische Tickpfade (inkl. Broker-Realität: Mindestabstände, Amendment-Kadenz). Globale Stop-Regeln sind bewusst auf das Broker-Minimum reduziert — maximale Freiheit für adaptive Exit-Systeme, der A/B durch die echte Engine entscheidet.

Statistik-Härtung (additiv zum Score)

Zusätzlich zum vorregistrierten Score v1.0: Block-Bootstrap-Konfidenzintervalle über Tages-Blöcke (erhalten Verlustserien — ehrlicher als Einzeltrade-Resampling), Power-Check (ist der gemessene Edge mit dieser Stichprobe überhaupt nachweisbar?) und Leave-one-month-out (hängt das Ergebnis an einem einzigen Monat?). Die Score-Formel selbst bleibt unverändert, damit alte Builds vergleichbar bleiben.

Verification-Levels

Die Forschungsautomatik erzeugt maximal Level 0-4. WARCHHOLD VERIFIED (5) verlangt eine vom Builder getrennte Prüfung und eine berechtigte Agenten- oder Menschenentscheidung. LIVE VERIFIED (6) setzt reale, versionsgebundene Bewährung voraus; ein Backtest kann diesen Level nie erzeugen.

Übernahme ins Handelssystem

Research-Kandidaten bleiben bis zur erfolgreichen Verifikation getrennt. Danach darf eine berechtigte E-11/E-12-Agenten- oder Menschenentscheidung einen exakt gebundenen Kandidaten freigeben. Der deterministische Controller darf daraus ausschließlich einen begrenzten IG-DEMO-Slot erzeugen; Echtgeld bleibt außerhalb dieser Automatik.

Verification-Framework

Ungeprüft

0 = Ungeprüft

Reproduziert

1 = Reproduziert

Backtest

2 = Backtest Verifiziert

Robustheit

3 = Robustheitsgeprüft

OOS

4 = Out-of-Sample Verifiziert

WARCHHOLD VERIFIED

5 = WARCHHOLD VERIFIED

LIVE VERIFIED

6 = LIVE VERIFIED

Agenten-Pipeline

Live-Überwachung läuft serverseitig (systemd); fehlgeschlagene Läufe — auch Speicher-Kills — lösen einen Telegram-Alarm aus.

AgentAufgabeTakt · ModusProviderAktivierungLetzter LaufStatus
Literatur-Research-AgentDurchsucht arXiv, SSRN, QuantConnect und etablierte Quant-Blogs nach neuen Intraday-Strategien für DAX; extrahiert Funde strukturiert ins Research-Log (max. 3 pro Tag, Dedupe gegen Bestand).Täglich 00:05 (auch Wochenende/Feiertage)
autonom
Claude/Anthropic · Opus · Claude-Kontingentaktiv07-20 07:43ok
Klassik-Literatur-Research-AgentWie der Literatur-Agent, aber für die klassische/ältere akademische Finanzliteratur (seminale Journal-Artikel, NBER, frühe Anomalie- und Mikrostruktur-Forschung vor ~2000), die der arXiv/SSRN-Lauf nicht abdeckt. Extrahiert handelbare Intraday-Kandidaten kritisch (Tier-Regeln, baubar ja/nein), prüft besonders auf Decay/Arbitrage seit Publikation und Übertragbarkeit auf DAX-Intraday, und schreibt in denselben Research-Log → Auto-Build implementiert die besten Funde.Täglich 12:00 (getrennt vom Literatur-Lauf 00:05)
autonom
Claude/Anthropic · Opus · Claude-Kontingentaktiv07-20 12:05ok
Empirie-Research-AgentForscht in den EIGENEN canonical DAX-Tickdaten statt in fremder Literatur: eine deterministische Phase rechnet vorregistrierte Statistik-Familien (Tageszeit-Drift, Gap-Verhalten, Vola-Clustering, Breakout-Persistenz u.a.) auf einem Discovery-Fenster; das LLM (Fable, Mythos-Klasse) destilliert daraus max. 2 falsifizierbare Hypothesen — mit hartem Multiple-Testing-Rahmen (Bonferroni-Kontext, alle Buckets offengelegt) und Mechanismus-Pflicht. Auto-Build testet erzwungen auf dem disjunkten Holdout-Fenster (test_start-Enforcement); die letzten 21 Tage bleiben für die Forward-Validierung gesperrt. Auch Bausteine (Stop-Systeme, Indikatoren, Filter) sind vollwertige Funde und werden als A/B-Overlay getestet.Wöchentlich So 13:00 (Datenbasis wächst nur ~5 Handelstage/Woche)
autonom
Claude/Anthropic · Fable/Opus-Fallback · Claude-Kontingentaktiv07-19 13:03ok
Katalog-Research-AgentImplementiert klassische Archetyp-Familien als interne Plugins, führt reproduzierbare Backtests aus und dokumentiert Ergebnisse inkl. vollständiger Trial-Zählung.On-Demand (interaktive Session mit Review)
interaktiv
Claude/Anthropic · interaktiv · Claude-Kontingentaktiv06-10 13:00ok
Forward-ValidatorRe-Test ALLER eingefrorenen Kandidaten (forward_candidates.json, wachsende Liste — auch Auto-Build- und Optimizer-Ergebnisse) auf dem jeweils abgeschlossenen Vormonat: echtes, unverbrennbares Out-of-Sample. Eingefrorene Parameter werden nie nachgetunt.Monatlich, 1. Samstag 09:17 (Wochenend-Fenster)
autonom
Deterministisch · kein LLM-Kontingentaktiv07-04 09:17ok
Auto-Build-AgentImplementiert bis zu 3 noch nicht gebaute Tier-1/2-Funde pro Lauf sequenziell als Plugins. Claude schreibt Code + Trial-Spec; der deterministische Runner führt die vorregistrierten A/B-/Backtests aus. Ergebnisse bleiben Entwurf, bis eine getrennte Rolle die exakte Version geprüft hat.Täglich 00:35 (nach dem Literatur-Lauf)
autonom
Claude/Anthropic · Opus · Claude-Kontingentaktiv07-20 08:45ok
Canary-Replay (deterministisch)Wöchentlicher Paritätstest: derselbe Tickstrom eines kompletten Handelstags läuft durch die Backtest-Engine UND den Live-Bar-Builder — verglichen werden Bars (OHLC exakt), Regime-Labels und die Indikator-Kette. Divergenz = Alarm ('Backtests sind nicht live-treu'). Kein LLM — reine Replay-Logik. Motivation: drei BT≠Live-Bugs in einer Woche (Juli 2026), alle in genau dieser Schicht.Samstag 08:15 (vor dem Optimizer-Lauf)
autonom
Deterministisch · kein LLM-Kontingentaktiv07-18 08:15ok
Auto-Optimize (bedingt)Optimiert NUR Kandidaten mit Signal: vorregistriertes Grid (beim Bau festgelegt), Auswahl nur In-Sample, ein einziger Out-of-Sample-Test gegen die Baseline. Bestätigte Parameter gehen eingefroren in die Forward-Validierung — Overfitting wird so strukturell verhindert.Samstag 10:23 (nur bei vorliegenden Kandidaten)
autonom
Deterministisch · kein LLM-Kontingentaktiv07-18 10:23ok
SIP Shadow CuratorKuriert read-only Beziehungen, Deduplizierungs- und Taxonomievorschläge für das neue System-Gehirn. Jeder Hinweis bleibt ein verfallender E0-Schattenbeitrag ohne W1–W5-, K3-, Strategie- oder Produktionswirkung.On-Demand; noch kein autonomer Timer
geplant
OpenAI Codex · ChatGPT/Codex-Kontingentaktivready on demand
SIP Conflict AuditorSucht read-only nach widersprüchlichen Verträgen, veralteten Annahmen und Provenienzkonflikten. Er dokumentiert beide Seiten, entscheidet den Konflikt aber nicht und kann weder VA/R-U noch K3 ersetzen.On-Demand; noch kein autonomer Timer
geplant
OpenAI Codex · ChatGPT/Codex-Kontingentaktiv07-19 14:45ok
SIP Evidence LibrarianPrüft read-only Quellenbindungen, Referenzen, Frische, Ablauf und Abdeckung der Gehirn-Evidenz. Er repariert keine Evidenz und erteilt keine formale Abnahme.On-Demand; noch kein autonomer Timer
geplant
OpenAI Codex · ChatGPT/Codex-Kontingentaktiv07-19 14:45ok
SIP Demo-Deployment GovernorEntscheidet nach E-11/E-12 read-only über einen vollständig qualifizierten Strategie-Treffer. Prüft exakte Version, getrennte Discovery-/Forward-Evidenz, Anti-Overfitting, unabhängige BT/Live-Parität und Demo-Grenzen. Kann nur zustimmen oder ablehnen; der Agent schreibt weder Trading-DB noch Broker.Ereignisgesteuert; nur wenn ein governed promoted+canonical Kandidat vorliegt
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktivbereit wartet auf qualifizierten kandidaten
SIP AP-Acceptance GovernorEntscheidet nach E-11 read-only über exakte AP-Pakete, deren Vertrag keine unabhängige Prüfung verlangt. Der erste zulässige Umfang ist AP-03/AP-04. Er darf unabhängige AP-Gates niemals ersetzen und schreibt weder Review-Ledger noch Produktionssysteme selbst.Stündlich; nur bei neuem unverarbeitetem AP-03-/AP-04-Paket
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktiv07-19 21:58ok ap03 ap04 angenommen
SIP Risk-Operations GovernorEntscheidet nach E-11 read-only über eng begrenzte Betriebsparameter. Der erste Auftrag setzt für AP-08 ausschließlich reale Beobachtungsdauer und Mindestdauer einer späteren unabhängigen Ausfallprobe. Er darf die Probe nicht starten, AP-08 nicht abnehmen, AP-10 nicht öffnen und weder Trading noch Produktion verändern.Ereignisgesteuert; genau eine materielle AP-08-Parameterentscheidung
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktiv07-19 22:36ok parameter gesetzt
SIP Function-Protection GovernorEntscheidet nach E-11 read-only über exakt gebundene W2/K2-Änderungen an geschützten Funktionen. Er darf nur streng fail-closed wirkende Änderungen annehmen und erweitert niemals LIVE-, Order-, Sizing-, Stop-, Dienst- oder Produktionsbefugnisse.Ereignisgesteuert; bei einem neuen exakten Ring-4-Sicherheitskandidaten
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktiv07-20 07:25e03 konflikt korrigiert w2 entscheidung offen
SIP Library-Maintenance GovernorEntscheidet nach E-11/K3 read-only über genau ein rollback-geschütztes Strategy-Library-Wartungsfenster. Er kann nur die exakte DEMO-Sequenz Stoppen, Flat-Recheck, Snapshot, Migration, Prüfung und Neustart derselben Dienste freigeben; ausführen darf sie ausschließlich der deterministische Executor.Ereignisgesteuert; nur mit separatem Funktionsschutz-Review und frischen DB-/Broker-Flat-Belegen
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktivbereit wartet auf exaktes wartungspaket
SIP Strategy Evidence VerifierPrüft read-only eine exakte, eingefrorene Claude-Strategieversion samt getrennter Discovery-/Forward-Evidence, vollständigem Anti-Overfitting-Paket und versionsspezifischer BT/Live-Parität. Baut nichts, entscheidet kein Deployment und besitzt keine Tradingwirkung.Ereignisgesteuert; nur nach eingefrorenem Claude-Kandidaten und vollständigem Evidenzpaket
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktivbereit wartet auf eingefrorenen claude kandidaten
Demo-Slot ControllerDeterministischer Executor ohne LLM: validiert Agentenentscheidung, Library-Receipts, Source-Hashes, Canonical-Status und aktives IG-DEMO-Konto erneut und legt idempotent höchstens einen begrenzten Auto-Demo-Slot an. LIVE/Echtgeld wird doppelt fail-closed gesperrt.Ereignisgesteuert nach einer gültigen Governor-Entscheidung
autonom
Deterministisch · kein LLM-Kontingentaktiv07-19 22:03ok idle policy not installed
VA-02/VA-03 Independent VerifierFormale, organisatorisch vom Codex-Builder getrennte Instanz für Phase A und B. Codex hat die operative Vorarbeit abgeschlossen: strategieinterne Symbolbindung DAX/NIKKEI, vier performanceblind ereignisfähige VA-02-Fälle und ein VA-03-Träger mit Engine-Status OK. Claude ist gemäß Provider-Richtlinie ausgeschlossen und bleibt ausschließlich Strategie-Research und -Build vorbehalten.Kein Timer aktiv; Transport v7 wartet auf die Zuweisung eines unabhängigen Nicht-Claude-Prüfers
blockiert
Noch nicht zugewiesen · unabhängiger Nicht-Claude-Prüfer erforderlichaktiv07-19 16:10blockiert provider nicht zugewiesen
VA-02/VA-03 Phase-A SelectorFormale, performanceblinde Auswahl- und Preregister-Rolle für einen frischen VA-02/VA-03-Freeze. Codex hat Transport und Kandidatenträger vorbereitet, darf diese eigene Vorarbeit aber nicht als unabhängig abzeichnen. Claude ist für diese Rolle ausgeschlossen.Kein Timer aktiv; wartet auf einen unabhängigen Nicht-Claude-Prüfer
blockiert
Noch nicht zugewiesen · unabhängiger Nicht-Claude-Prüfer erforderlichaktivblockiert provider nicht zugewiesen
VA-02/VA-03 R-U-ReconcilerFrische, vom Phase-B-Produzenten getrennte Einmalinstanz für zwölf Reconciliationgruppen und mindestens drei eigene Angriffe. Der historische Claude-Lauf erzeugte substanzielle Prüfarbeitsartefakte, verfehlte aber Safe-Output- und Reportvertrag; formal ist kein R-U etabliert. Künftige R-U-Läufe dürfen gemäß Provider-Richtlinie nicht über Claude laufen.Einmalig abgeschlossen am 19.07.2026; keine Retry-Freigabe
blockiert
Noch nicht zugewiesen · unabhängiger Nicht-Claude-Prüfer erforderlichaktiv07-19 15:07terminal provider unassigned

Rollen der Autonomie: Claude recherchiert und baut Strategie-, Indikator-, Regime- und Stop-Hypothesen. Deterministische Runner testen sie. Getrennte Codex-Agenten dürfen innerhalb E-11/E-12 prüfen und entscheiden; nur der Controller darf anschließend einen begrenzten IG-DEMO-Slot schreiben. Generierter Strategiecode läuft ohne Shell-Zugriff, mit Import-Allowlist und ohne Netzwerk.

Alle Inhalte dienen ausschließlich Bildungs-, Forschungs- und Informationszwecken. Sie stellen keine Anlageberatung, Finanzberatung oder Handelsempfehlung dar. Trading und Investieren sind mit erheblichen Risiken verbunden. Vergangene Performance ist kein verlässlicher Indikator für zukünftige Ergebnisse. Jeder Nutzer handelt eigenverantwortlich.