Warchhold Research

Methodik

Test-Setup (gilt für alle Untersuchungen)

Daten
IG CFD GER40 Ticks, 2026-03-17 bis 2026-06-09, 63 Handelstage, 10.0 Mio Ticks
Engine
Warchhold canonical_v2 (Tick-Replay, reale Bid/Ask-Spreads)
Kosten
Spread real aus Ticks + 0.5 Pt Slippage pro Seite, keine Kommission
Session
Entry ab 09:00, Session-Ende 17:30, Hold bis max. 20:00 (Europe/Berlin)

Getestet wird das real verfügbare Instrument (IG CFD GER40) auf dem real verfügbaren Zeitraum — kein Anspruch auf Mehrjahres-Historie oder Futures-Semantik. Research-Backtests enden 21 Tage vor heute (Daten-Embargo): die jüngsten Wochen bleiben für die Forward-Validierung unberührt.

Methodik-Regeln

Trial Ledger (technisch erzwungen, seit 11.07.2026)

Jede Variante wird VOR der Ausführung im Trial Ledger registriert — auch Optimizer-Grids und Exit-Lab-Policies. Ohne Registrierung läuft kein Backtest (Enforcement im Runner, nicht per Konvention). Die Multiple-Testing-Debt pro Hypothesenfamilie ist öffentlich: je mehr Trials eine Familie verbraucht hat, desto strenger ist ein einzelner Treffer zu lesen.

Daten-Embargo + Forward-Validierung (erzwungen)

Research sieht die letzten 21 Tage nie — seit 11.07.2026 technisch erzwungen: die Backtest-Sandbox verweigert jedes Fenster, das in die Embargo-Zone reicht. Jeder abgeschlossene Monat wird als echtes Out-of-Sample gegen alle eingefrorenen Kandidaten getestet; Parameter werden nach dem Einfrieren nie angepasst.

Optimierung ohne Selbstbetrug

Optimiert wird nur bei Signal, mit beim Bau vorregistriertem Grid, In-Sample-Auswahl und genau einem Out-of-Sample-Test — der die unoptimierte Baseline schlagen muss. Der Report zeigt die volle Grid-Fläche plus Plateau-Check: ein isoliertes Optimum ohne tragende Nachbarn wird als Zufallsverdacht markiert (Stability Map).

Schwellen für Kennzahlen ohne Warnung

Mindestens 100 Trades und ein echtes Out-of-Sample-Segment. Darunter werden Ergebnisse nur mit ausdrücklichem Vorbehalt gezeigt.

Robustheits-Score (vorregistriert, v1.0 / 2026-06-12)

0-100 Punkte aus festen Komponenten: Stichprobe (25, voll ab n=100), Signifikanz (25, voll wenn die PF-CI-Untergrenze >= 1.4), Konzentration (15, voll wenn Top-3-Trades <= 30% des Gewinns), Kosten (15, voll wenn PF trotz +1 Pkt/Seite Slippage >= 1.3), Regimebreite (10), Forward-Monate (10). Die Formel wird nie an Ergebnisse angepasst — sonst optimiert man den Score statt den Edge. Der Score misst Belastbarkeit der Messung, nicht Edge-Höhe.

Run-Manifest + Canary-Replay

Jeder Build trägt ein Manifest: Engine-Fingerprint (Hash über die Kern-Engine-Dateien), Datenstand, Fenster, Kostenmodell und Trial-Referenz — zwei Ergebnisse mit unterschiedlichem Fingerprint sind nicht 1:1 vergleichbar. Wöchentlich prüft ein Canary-Replay, dass Backtest- und Live-Engine aus demselben Tickstrom identische Bars und Regime-Labels bauen — Backtest-Treue wird gemessen, nicht angenommen.

Placebo-Kontrolle (Negative Control)

Der beste Trial jedes Builds wird gegen 20 Zufalls-Replikationen mit identischer Trade-Geometrie getestet (Entry-Zeitpunkt ±60 Min verschoben, Richtung/Tag/Haltedauer erhalten). Liegt der Kandidat nicht deutlich über der Placebo-Verteilung, ist sein Timing-Beitrag von Zufall nicht unterscheidbar — das steht dann so im Dossier.

Exit-Forschung mit eingefrorenen Entries

Stop-/Exit-Systeme werden isoliert erforscht: das Entry-Set einer Strategie wird eingefroren, dann laufen vorregistrierte Exit-Policies über identische Tickpfade (inkl. Broker-Realität: Mindestabstände, Amendment-Kadenz). Globale Stop-Regeln sind bewusst auf das Broker-Minimum reduziert — maximale Freiheit für adaptive Exit-Systeme, der A/B durch die echte Engine entscheidet.

Statistik-Härtung (additiv zum Score)

Zusätzlich zum vorregistrierten Score v1.0: Block-Bootstrap-Konfidenzintervalle über Tages-Blöcke (erhalten Verlustserien — ehrlicher als Einzeltrade-Resampling), Power-Check (ist der gemessene Edge mit dieser Stichprobe überhaupt nachweisbar?) und Leave-one-month-out (hängt das Ergebnis an einem einzigen Monat?). Die Score-Formel selbst bleibt unverändert, damit alte Builds vergleichbar bleiben.

Verification-Levels

Die Forschungsautomatik erzeugt maximal Level 0-4. WARCHHOLD VERIFIED (5) verlangt eine vom Builder getrennte Prüfung und eine berechtigte Agenten- oder Menschenentscheidung. LIVE VERIFIED (6) setzt reale, versionsgebundene Bewährung voraus; ein Backtest kann diesen Level nie erzeugen.

Übernahme ins Handelssystem

Research-Kandidaten bleiben bis zur erfolgreichen Verifikation getrennt. Danach darf eine berechtigte E-11/E-12-Agenten- oder Menschenentscheidung einen exakt gebundenen Kandidaten freigeben. Der deterministische Controller darf daraus ausschließlich einen begrenzten IG-DEMO-Slot erzeugen; Echtgeld bleibt außerhalb dieser Automatik.

Verification-Framework

Ungeprüft

0 = Ungeprüft

Reproduziert

1 = Reproduziert

Backtest

2 = Backtest Verifiziert

Robustheit

3 = Robustheitsgeprüft

OOS

4 = Out-of-Sample Verifiziert

WARCHHOLD VERIFIED

5 = WARCHHOLD VERIFIED

LIVE VERIFIED

6 = LIVE VERIFIED

Agenten-Pipeline

Live-Überwachung läuft serverseitig (systemd); fehlgeschlagene Läufe — auch Speicher-Kills — lösen einen Telegram-Alarm aus.

AgentAufgabeTakt · ModusProviderAktivierungLetzter LaufStatus
Literatur-Research-AgentDurchsucht arXiv, SSRN, QuantConnect und etablierte Quant-Blogs nach neuen Intraday-Strategien für DAX; extrahiert Funde strukturiert ins Research-Log (max. 3 pro Tag, Dedupe gegen Bestand).Täglich 00:05 (auch Wochenende/Feiertage)
autonom
Claude/Anthropic · Opus · Claude-Kontingentaktiv08-27 00:11ok
Klassik-Literatur-Research-AgentWie der Literatur-Agent, aber für die klassische/ältere akademische Finanzliteratur (seminale Journal-Artikel, NBER, frühe Anomalie- und Mikrostruktur-Forschung vor ~2000), die der arXiv/SSRN-Lauf nicht abdeckt. Extrahiert handelbare Intraday-Kandidaten kritisch (Tier-Regeln, baubar ja/nein), prüft besonders auf Decay/Arbitrage seit Publikation und Übertragbarkeit auf DAX-Intraday, und schreibt in denselben Research-Log → Auto-Build implementiert die besten Funde.Täglich 12:00 (getrennt vom Literatur-Lauf 00:05)
autonom
Claude/Anthropic · Opus · Claude-Kontingentaktiv08-26 12:06ok
Empirie-Research-AgentForscht in den EIGENEN canonical DAX-Tickdaten statt in fremder Literatur: eine deterministische Phase rechnet vorregistrierte Statistik-Familien (Tageszeit-Drift, Gap-Verhalten, Vola-Clustering, Breakout-Persistenz u.a.) auf einem Discovery-Fenster; das LLM (Fable, Mythos-Klasse) destilliert daraus max. 2 falsifizierbare Hypothesen — mit hartem Multiple-Testing-Rahmen (Bonferroni-Kontext, alle Buckets offengelegt) und Mechanismus-Pflicht. Auto-Build testet erzwungen auf dem disjunkten Holdout-Fenster (test_start-Enforcement); die letzten 21 Tage bleiben für die Forward-Validierung gesperrt. Auch Bausteine (Stop-Systeme, Indikatoren, Filter) sind vollwertige Funde und werden als A/B-Overlay getestet.Wöchentlich So 13:00 (Datenbasis wächst nur ~5 Handelstage/Woche)
autonom
Claude/Anthropic · Fable/Opus-Fallback · Claude-Kontingentaktiv08-23 20:13ok
Katalog-Research-AgentImplementiert klassische Archetyp-Familien als interne Plugins, führt reproduzierbare Backtests aus und dokumentiert Ergebnisse inkl. vollständiger Trial-Zählung.On-Demand (interaktive Session mit Review)
interaktiv
Claude/Anthropic · interaktiv · Claude-Kontingentaktiv06-10 13:00ok
Forward-ValidatorRe-Test ALLER eingefrorenen Kandidaten (forward_candidates.json, wachsende Liste — auch Auto-Build- und Optimizer-Ergebnisse) auf dem jeweils abgeschlossenen Vormonat: echtes, unverbrennbares Out-of-Sample. Eingefrorene Parameter werden nie nachgetunt.Monatlich, 1. Samstag 09:17 (Wochenend-Fenster)
autonom
Deterministisch · kein LLM-Kontingentaktiv08-27 09:53ok
Auto-Build-AgentImplementiert bis zu 3 noch nicht gebaute Tier-1/2-Funde pro Lauf sequenziell als Plugins. Claude schreibt Code + Trial-Spec; der deterministische Runner führt die vorregistrierten A/B-/Backtests aus. Ergebnisse bleiben Entwurf, bis eine getrennte Rolle die exakte Version geprüft hat.Täglich 00:35 (nach dem Literatur-Lauf)
autonom
Claude/Anthropic · Opus · Claude-Kontingentaktiv08-27 01:26ok
Canary-Replay (deterministisch)Wöchentlicher Paritätstest: derselbe Tickstrom eines kompletten Handelstags läuft durch die Backtest-Engine UND den Live-Bar-Builder — verglichen werden Bars (OHLC exakt), Regime-Labels und die Indikator-Kette. Divergenz = Alarm ('Backtests sind nicht live-treu'). Kein LLM — reine Replay-Logik. Motivation: drei BT≠Live-Bugs in einer Woche (Juli 2026), alle in genau dieser Schicht.Samstag 08:15 (vor dem Optimizer-Lauf)
autonom
Deterministisch · kein LLM-Kontingentaktiv08-27 06:39ok
Auto-Optimize (bedingt)Optimiert NUR Kandidaten mit Signal: vorregistriertes Grid (beim Bau festgelegt), Auswahl nur In-Sample, ein einziger Out-of-Sample-Test gegen die Baseline. Bestätigte Parameter gehen eingefroren in die Forward-Validierung — Overfitting wird so strukturell verhindert.Samstag 10:23 (nur bei vorliegenden Kandidaten)
autonom
Deterministisch · kein LLM-Kontingentaktiv08-23 21:38ok
SIP Shadow CuratorKuriert read-only Beziehungen, Deduplizierungs- und Taxonomievorschläge für das neue System-Gehirn. Jeder Hinweis bleibt ein verfallender E0-Schattenbeitrag ohne W1–W5-, K3-, Strategie- oder Produktionswirkung.On-Demand; noch kein autonomer Timer
geplant
OpenAI Codex · ChatGPT/Codex-Kontingentaktivready on demand
SIP Conflict AuditorSucht read-only nach widersprüchlichen Verträgen, veralteten Annahmen und Provenienzkonflikten. Er dokumentiert beide Seiten, entscheidet den Konflikt aber nicht und kann weder VA/R-U noch K3 ersetzen.On-Demand; noch kein autonomer Timer
geplant
OpenAI Codex · ChatGPT/Codex-Kontingentaktiv07-19 14:45ok
SIP Evidence LibrarianPrüft read-only Quellenbindungen, Referenzen, Frische, Ablauf und Abdeckung der Gehirn-Evidenz. Er repariert keine Evidenz und erteilt keine formale Abnahme.On-Demand; noch kein autonomer Timer
geplant
OpenAI Codex · ChatGPT/Codex-Kontingentaktiv07-19 14:45ok
SIP Demo-Deployment GovernorEntscheidet nach E-11/E-12 read-only über einen vollständig qualifizierten Strategie-Treffer. Prüft exakte Version, getrennte Discovery-/Forward-Evidenz, Anti-Overfitting, unabhängige BT/Live-Parität und Demo-Grenzen. Kann nur zustimmen oder ablehnen; der Agent schreibt weder Trading-DB noch Broker.Ereignisgesteuert; nur wenn ein governed promoted+canonical Kandidat vorliegt
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktivbereit wartet auf qualifizierten kandidaten
SIP AP-Acceptance GovernorEntscheidet nach E-11 read-only über exakte AP-Pakete, deren Vertrag keine unabhängige Prüfung verlangt. Der erste zulässige Umfang ist AP-03/AP-04. Er darf unabhängige AP-Gates niemals ersetzen und schreibt weder Review-Ledger noch Produktionssysteme selbst.Stündlich; nur bei neuem unverarbeitetem AP-03-/AP-04-Paket
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktiv07-19 21:58ok ap03 ap04 angenommen
SIP Risk-Operations GovernorEntscheidet nach E-11 read-only über eng begrenzte Betriebsparameter. Der erste Auftrag setzt für AP-08 ausschließlich reale Beobachtungsdauer und Mindestdauer einer späteren unabhängigen Ausfallprobe. Er darf die Probe nicht starten, AP-08 nicht abnehmen, AP-10 nicht öffnen und weder Trading noch Produktion verändern.Ereignisgesteuert; genau eine materielle AP-08-Parameterentscheidung
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktiv07-19 22:36ok parameter gesetzt
SIP Function-Protection GovernorEntscheidet nach E-11 read-only über exakt gebundene W2/K2-Änderungen an geschützten Funktionen. Er darf nur streng fail-closed wirkende Änderungen annehmen und erweitert niemals LIVE-, Order-, Sizing-, Stop-, Dienst- oder Produktionsbefugnisse.Ereignisgesteuert; bei einem neuen exakten Ring-4-Sicherheitskandidaten
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktiv07-20 07:25e03 konflikt korrigiert w2 entscheidung offen
SIP Library-Maintenance GovernorEntscheidet nach E-11/K3 read-only über genau ein rollback-geschütztes Strategy-Library-Wartungsfenster. Er kann nur die exakte DEMO-Sequenz Stoppen, Flat-Recheck, Snapshot, Migration, Prüfung und Neustart derselben Dienste freigeben; ausführen darf sie ausschließlich der deterministische Executor.Ereignisgesteuert; nur mit separatem Funktionsschutz-Review und frischen DB-/Broker-Flat-Belegen
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktivbereit wartet auf exaktes wartungspaket
SIP Strategy Evidence VerifierPrüft read-only eine exakte, eingefrorene Claude-Strategieversion samt getrennter Discovery-/Forward-Evidence, vollständigem Anti-Overfitting-Paket und versionsspezifischer BT/Live-Parität. Baut nichts, entscheidet kein Deployment und besitzt keine Tradingwirkung.Ereignisgesteuert; nur nach eingefrorenem Claude-Kandidaten und vollständigem Evidenzpaket
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktivbereit wartet auf eingefrorenen claude kandidaten
Demo-Slot ControllerDeterministischer Executor ohne LLM: validiert Agentenentscheidung, Library-Receipts, Source-Hashes, Canonical-Status und aktives IG-DEMO-Konto erneut und legt idempotent höchstens einen begrenzten Auto-Demo-Slot an. LIVE/Echtgeld wird doppelt fail-closed gesperrt.Ereignisgesteuert nach einer gültigen Governor-Entscheidung
autonom
Deterministisch · kein LLM-Kontingentaktiv07-19 22:03ok idle policy not installed
VA-02/VA-03 Independent VerifierRollengetrennte read-only Codex-Instanz für Phase A und B. Sie verwendet eine eigene Sitzung und Akteuridentität und prüft nur eingefrorene Inputs. Claude bleibt ausschließlich Strategie-Research und -Build vorbehalten.Ereignisgesteuert; nächster Lauf mit dem eingefrorenen AP-11-Transport
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktiv07-19 16:10bereit fuer getrennte read only codex sitzung
VA-02/VA-03 Phase-A SelectorPerformanceblinde Auswahl- und Preregister-Rolle für einen frischen VA-02/VA-03-Freeze. Sie arbeitet in einer eigenen read-only Codex-Sitzung und darf keine Builder-Ergebnisse sehen oder verändern.Ereignisgesteuert; Transport v7 ist vorbereitet
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktivbereit fuer getrennte read only codex sitzung
VA-02/VA-03 R-U-ReconcilerVom Phase-B-Produzenten getrennte read-only Codex-Einmalinstanz für zwölf Reconciliationgruppen und mindestens drei eigene Angriffe. Der historische ungültige Claude-Lauf wird nicht wiederholt; ein neuer Gegenstand entsteht erst nach gültiger Phase B.Ereignisgesteuert nach gültiger Phase B
autonom
OpenAI Codex · ChatGPT/Codex-Kontingentaktiv07-19 15:07bereit nach gueltiger phase b

Drei getrennte Kontingente

Claude-Abo · 5 Agenten

Die einzigen zeitgesteuerten KI-Agenten (00:05, 00:35, 12:00, So 13:00). 0,7–1,2 Mio Tokens pro Lauf. Teilen sich den Wochentopf mit interaktiven Bau-Sessions — nur hier können Läufe am Kontingent scheitern.

ChatGPT/Codex · 12 Agenten

Kein Timer — alle ereignisgesteuert: Sie schlafen, bis ein Prüf- oder Governance-Vorgang anliegt. Belasten das Claude-Kontingent nicht und sind nie die Ursache ausgefallener Nachtläufe.

Ohne KI · 4 Agenten

Optimizer, Canary, Forward-Validator und Demo-Slot-Controller sind reines Python. Sie kosten kein Kontingent und laufen unabhängig von jeder Anbieter-Grenze.

Warum ein Nachtlauf ausfallen kann: Das Claude-Abo kennt ein rollierendes 5-Stunden-Fenster (füllt sich von selbst) und ein Wochenlimit (Reset einmal wöchentlich). Dazu kommt ein periodisch ablaufender Anmelde-Token, der eine manuelle Neu-Anmeldung braucht. In allen drei Fällen verschiebt der Agent seinen Lauf geordnet und meldet das per Telegram — ein stiller Ausfall tritt nicht ein. Der Nachfass-Lauf um 02:35 deckt das 5-Stunden-Fenster ab, nicht das Wochenlimit (Reset erst 07:00).

Rollen der Autonomie: Claude recherchiert und baut Strategie-, Indikator-, Regime- und Stop-Hypothesen. Deterministische Runner testen sie. Getrennte Codex-Agenten dürfen innerhalb E-11/E-12 prüfen und entscheiden; nur der Controller darf anschließend einen begrenzten IG-DEMO-Slot schreiben. Generierter Strategiecode läuft ohne Shell-Zugriff, mit Import-Allowlist und ohne Netzwerk.

Alle Inhalte dienen ausschließlich Bildungs-, Forschungs- und Informationszwecken. Sie stellen keine Anlageberatung, Finanzberatung oder Handelsempfehlung dar. Trading und Investieren sind mit erheblichen Risiken verbunden. Vergangene Performance ist kein verlässlicher Indikator für zukünftige Ergebnisse. Jeder Nutzer handelt eigenverantwortlich.