Warchhold Research

Kernziel 03 · kontrollierte Verbesserung

Was wird verbessert – und woran erkennen wir echten Nutzen?

Das Cockpit verbindet die drei Programmziele mit Arbeitspaketen, Messgrößen und Freigabetoren. Es zeigt fehlende Baselines ausdrücklich als offen, statt Fortschritt aus Dokumentmenge, Agentenzahl oder Backtestgewinn abzuleiten.

3 / 17
formal bestandene APs
4
gebaut, Abnahme offen
1
blockiert
5
Vertrag gebaut, Gate zu
0
noch nicht begonnen
3 / 17
formal angenommen

Delegierte Agenten- und Menschenentscheidungen werden getrennt dokumentiert: Admin: AP-Abnahmen und Reviews. Ohne exakt gebundenes Abnahme-Envelope bleibt „Annehmen“ gesperrt.

Programmauftrag

Drei Ziele mit überprüfbarem Ergebnis

ZIEL 01

Belastbare Edges entwickeln

Strategien, Indikatoren, Regime-Logik und Stop-/Exit-Systeme werden als getrennte, falsifizierbare Bausteine erforscht.

Ergebnis: Nur Kandidaten mit offengelegtem Suchraum, Kosten, Holdout, Robustheit und Forward-Nachweis erreichen ein Freigabetor.

Zugeordnete Pakete: AP-04, AP-05, AP-10, AP-11, AP-13

Arbeitsbereich öffnen
ZIEL 02

Research nachvollziehbar betreiben

Jede Hypothese, jeder Versuch, jedes negative Ergebnis, jeder Fehler und jede Entscheidung bleibt auffindbar.

Ergebnis: Menschen können jederzeit verstehen, was geschah, warum es geschah, wer verantwortlich ist und welcher Nachweis fehlt.

Zugeordnete Pakete: AP-00 bis AP-09, AP-12

Arbeitsbereich öffnen
ZIEL 03

Kontrolliert dauerhaft verbessern

Das Gehirn erzeugt Verbesserungsvorschläge für Research, Engineering und Betrieb, darf Schutzregeln aber nicht selbst umgehen.

Ergebnis: Verbesserungen werden versioniert, unabhängig geprüft, freigegeben und anschließend gegen Nutzen, Risiko und Kosten gemessen.

Zugeordnete Pakete: AP-10, AP-12 bis AP-16

Arbeitsbereich öffnen

Vier Reifestufen statt eines unklaren „fertig“

Erst diese Trennung macht verständlich, warum viel Code vorhanden sein kann, obwohl ein Messpilot oder produktiver Einsatz noch nicht zulässig ist.

1

Gebaut

Code oder Dokument liegt vor. Das beweist noch keine fachliche Richtigkeit.

2

Technisch geprüft

Automatisierte Tests und definierte Exit-Kriterien sind für die exakten Bytes grün.

3

Im Pilot gemessen

Der reale Nutzen ist über den vorgesehenen Zeitraum gegen eine Baseline beobachtet.

4

Freigegeben

Unabhängige Prüfung und eine berechtigte Agenten- oder Menschenentscheidung erlauben den begrenzten Einsatz; Auto-Deployment ausschließlich auf IG DEMO.

Beschlossene Betriebslogik

Wer forscht, wer entscheidet, wer führt aus?

Agentenentscheidungen sind erlaubt, aber nur innerhalb ihrer freigegebenen Hülle. Providerrolle, Entscheidung und technische Ausführung bleiben getrennt, damit kein Modell seine eigenen Ergebnisse ungeprüft in einen Slot schreibt.

Claude · Strategiewerkstatt

Kontingent: Claude session usage

Literatur- und Empirie-Research, Strategiefindung und Strategieaufbau. Keine AP-, Governance- oder DEMO-Deployment-Entscheidung.

Codex · System-Gehirn

Kontingent: ChatGPT/Codex usage

Kuration, Evidenzprüfung sowie AP- und DEMO-Entscheidungen innerhalb E-11/E-12. Vorgeschriebene unabhängige Prüfung bleibt unersetzbar.

Deterministische Executor

Kontingent: none

Tests, Attestationen und exakt genehmigte Writes. Sie treffen keine fachliche Entscheidung und verbrauchen kein LLM-Kontingent.

Unabhängige Assurance

Kontingent: openai_codex_chatgpt

VA-/R-U-Gates laufen über getrennte read-only Codex-Sitzungen und Actor-Identitäten mit deterministischen Hard-Gates. Das ist Rollen- und Sitzungstrennung, keine behauptete Providerdiversität.

Automatischer DEMO-Weg: Claude-Kandidat → deterministische Evidenz → Codex-Prüfer → Codex-E-11/E-12-Entscheidung → No-LLM-Executor → aktiver IG-DEMO-Slot. Echtgeld bleibt verboten. Aktuell wartet der Executor noch auf die einmalige Aktivierung der Strategie-Bibliotheksrichtlinie in der Trading-Datenbank.

Steuerungsboard

AP-00 bis AP-16

„Prüfbereit“ wird nur noch für technisch vollständige Pakete mit offener formaler Prüfung verwendet. Laufende Remediation oder Assurance erscheint als „in Umsetzung“. Stand des Abschlussaudits: v1.5.0 · 2026-08-01 08:30.

APLieferungPhaseAbhängigkeitEhrlicher StandFormales ReviewExitBereits belegtFehlt nochNächste konkrete Aktion
AP-00Baseline, Entscheidungen und FallauswahlP0prüfbereit
kein Review
Annahme gesperrt
PR-001 fachlich vorbereitet; kein offener Scopekonflikt.Builder-Dossier v3 · Baseline-Dokumentrollengetrennter VA-02-/Paritätsnachweis · delegierte Agenten-AbschlussentscheidungDen eingefrorenen Baseline-/Paritätsumfang in einer separaten read-only Codex-Sitzung prüfen und anschließend agentisch entscheiden.
AP-01Zielarchitektur und Trust-ZonenP0AP-00prüfbereit
kein Review
Annahme gesperrt
Architekturreview gegen Read-only, M-087 und Ring 4 bestanden.Architekturdokument · operatives Architektur-Overlay · Builder-Dossier v3rollengetrenntes Architekturreview · delegierte Agenten-AbschlussentscheidungBasisarchitektur und operatives Overlay bytegenau in einer getrennten read-only Codex-Sitzung prüfen.
AP-02Quelleninventar und Nur-Lese-AdapterP0AP-01in Umsetzung
kein Review
Annahme gesperrt
PR-002 bestanden; Quelllücken sichtbar statt still übersprungen.Quelleninventar 1.3 und datensparsamer Nur-Lese-Laufzeitadapter · laufende Nur-Lese-Belege · historische Claude-W2/K2-Annahme wegen Rollen- und Evidenzkonflikt append-only unwirksam · Numerische E-03-Schwelle mit acht Orakeln rollengetrennt geprüft und als Klassifikationspolicy angenommenfrischer Quellen- und Cursor-Freeze für Inventar 1.3 · rollengetrenntes Missing/Changed/Permission- und Exact-Byte-Review · getrennter Schutz- und AP-02-Entscheid · Abhängigkeit AP-01Inventar 1.3 frisch einfrieren, getrennt prüfen und danach agentisch entscheiden; keine Nutzerbestätigung erforderlich.
AP-03Pilotstore, Identität und HistorieP0AP-01 / AP-02bestanden
angenommen
Agentenentscheidung · 2026-07-19 21:55
PR-003 und P-001–P-014 bestanden.19 exakt gebundene grüne Oracles · Codex-E-11-Review · append-only Acceptance-Envelopenichts – formal angenommenPilotstore weiter beobachten; neue Abweichungen append-only dokumentieren.
AP-04Index, Negativwissen und KonflikteP0AP-03bestanden
angenommen
Agentenentscheidung · 2026-07-19 21:58
P-015–P-018 bestanden; erste C2-/C4-Messwege erzeugen Daten.12 exakt gebundene grüne Oracles · C2/C4-Indexierungsoracles · Codex-E-11-Review · append-only Acceptance-Envelopenichts – formal angenommenC2/C4 über reale Pilotzeit messen; technische Abnahme nicht als Nutzenbeweis ausgeben.
AP-05Edge-Evidenzpaket und End-to-End-FälleP0AP-02 / AP-03 / AP-04prüfbereit
kein Review
Annahme gesperrt
PR-008, P-019 und P-200 bestanden; fehlende Felder besitzen Owner und Folgeentscheidung.Edge-Evidenzrenderer · Builder-Dossier v3 · End-to-End-Fallstrukturformaler P-200-Abschluss · unabhängige R-S-/R-U-Paritäts- und RobustheitsevidenzHistorischen P-200-Fall schließen und eingefrorene Edge-Evidenz unabhängig reproduzieren lassen.
AP-06Schattenbeiträge und AgentenregelnP0AP-03prüfbereit
kein Review
Annahme gesperrt
PR-004 und P-020–P-023 bestanden.E0-Schattenkanal · Agentenverträge · Builder-Dossier v3unabhängiges B-Review · autorisierte AbschlussentscheidungPR-004 und P-020–P-023 durch eine unabhängige Rolle prüfen lassen.
AP-07Ring 4 und EntscheidungsschutzP0AP-01 / AP-03in Umsetzung
kein Review
Annahme gesperrt
PR-005 und P-100–P-110/P-114 bestanden.Numerische E-03-Schwelle mit acht Orakeln angenommen · Genesis 1.5 bindet alle fünf aktuellen Schutzdateien bytegenau · Zwei Änderungen im 720-h-Fenster korrekt als K3 statt gesplittetem K2 klassifiziert · DEMO- und Ring-4-Suiten grünrollengetrennte Exact-Byte- und Negativpfadprüfung des K3-Kandidaten · 24-Stunden-Karenz bis 25.07.2026 08:57:30 CEST · getrennter K3-Agentenentscheid und begrenzte Restart-Autorisierung · formale AP-07-Abnahme · Abhängigkeit AP-01K3-Prüfung jetzt ausführen; Entscheidung und DEMO-Neustart frühestens nach vollständig verstrichener Karenz.
AP-08Observability und EntkopplungP0AP-02 / AP-03 / AP-07bestanden
angenommen
Agentenentscheidung · 2026-08-01 08:10
PR-006/PR-007 und P-111/P-202 bestanden.296,134261 reale gesunde Beobachtungsstunden und 1.147 geeignete Receipts · 7.201,307 Sekunden autorisierte isolierte Ausfallphase mit 24 Beobachtungen · Trading- und Research-Ursprungszustände einschließlich Main-PIDs unverändert · gesunder Pilot-Wiederanlauf und fortgeschriebenes Receiptledger · E-11-Risk-Operations-Entscheid accept über 23 exakte Bindungennichts – formal angenommenAP-08 weiter beobachten; die Annahme startet weder AP-10 noch Produktion.
AP-09Automatisierte Abnahme und Pilot-ReadinessP0AP-02 / AP-03 / AP-04 / AP-05 / AP-06 / AP-07 / AP-08 / AP-11blockiert
kein Review
Annahme gesperrt
Vollständiger Preflight grün; Messpilotfreigabe dokumentiert.AP-09-Closure v1.1 bindet 49 Zusatzabhängigkeiten · Library-Migration besitzt Rollback- und Flat-Gates · direkter Aktivierungs-CLI ist gesperrt · deterministischer Wartungsexecutor verlangt eine gültige Ring-4-Restart-AutorisierungAP-02 sowie AP-05 bis AP-07 formal geschlossen · AP-11 rollengetrennt abgeschlossen · gültiger Library-K3-Entscheid und installierte Policy · gültig akzeptierte Folge-Genesis · neues natives AP-09-Manifest mit finalem BytebestandAP-11 und die verbleibenden P0-Gates schließen; AP-10 nicht starten.
AP-10Messpilot über vier bis acht WochenPAP-09in Umsetzung
kein Review
Annahme gesperrt
P-201, alle übrigen P-Fälle und Go/Change/Stop-Entscheidung.Messkatalog · Kollektor im Preflight-Modus · Startgate fail-closed · 0 angerechnete MesswochenAP-09-Freigabe · AP-11 unabhängig abgeschlossen · exakte Startautorisierung · mindestens vier reale Messwochen · P-201 und Go/Change/StopPreflight gesund halten; Messzeit nicht vor AP-09 zählen.
AP-11Unabhängige Verifikation VA-01–03P/PBeingefrorene Inputs / frische E-03-/Topologieevidenz / unabhängige Exact-Package-Rollenin Umsetzung
kein Review
Annahme gesperrt
Exakt gebundener Kandidat ist versiegelt, neue 86.400-Sekunden-Frist vollständig verstrichen, Post-Wait-W2/K2-Entscheidung und AP-11-Acceptance-Envelope liegen vorv1.9 bindet 31 Dateien; öffentlicher Validator grün · 123 kombinierte Governance-Tests bestanden · Evidence- und Conflict-Rollenbefunde vollständig dokumentiert · keine Root-, Trading-, Broker-, Slot- oder LIVE-Mutation · Webstand v1.0.0 aktuellfrischer v2.0-Preseal-Kandidat · unabhängiger Exact-Package-Audit · PRESEAL_OK und Seal · volle neue 86.400-Sekunden-Frist · Post-Wait-W2/K2-Entscheidung · formales Acceptance Envelopev2.0 getrennt bauen und die zehn im v1.9-Vertrag genannten Gates schließen; aus v1.9 weder PREPARE noch Seal ausführen
AP-12Pilotentscheidung und PB-BacklogPAP-10 / AP-11vorbereitet
kein Review
Annahme gesperrt
Dokumentierte Entscheidung mit Evidenz und Ownern.geschlossener ZukunftsphasenvertragAP-10 abgeschlossen · AP-11 abgeschlossen · reale Go/Change/Stop-EntscheidungVertrag geschlossen halten und nach AP-10/11 reale Evidenz binden.
AP-13ProduktbaselinePBPilot-Govorbereitet
kein Review
Annahme gesperrt
Alle PB-Anforderungen und PB-Abnahmen bestanden.PB-Inventar- und PromotionvertragPilot-Go · vollständiges PB-Inventar · PB-Abnahmen · kontrollierte reale W1-PromotionErst nach Pilot-Go die Produktbaseline und erste kontrollierte Promotion ausführen.
AP-14Kontextprodukt und AgentenskalierungA1PBvorbereitet
kein Review
Annahme gesperrt
Zwei Agentenrollen arbeiten mit nachweisbarem SIP-Kontext ohne Pflichtkernverstoß.Kontextprofil-Entwurf · Pflichtkern-AssemblerPB · Owner-abgenommene Pflichtkerne · reales Auditfenster mit zwei RollenNach PB sechs Pflichtkerne abnehmen und zwei Rollen real auditieren.
AP-15Kontrollierte EvolutionA2A1vorbereitet
kein Review
Annahme gesperrt
Ein Destillat und je ein angenommener und abgelehnter Engineer-Vorschlag durchlaufen AT-14a–c.Destillat- und Engineer-GrenzvertragA1 · realer Destillatpfad · angenommener AT-14-Vorschlag · abgelehnter AT-14-VorschlagNach A1 die drei realen AT-14-Pfade auditierbar durchführen.
AP-16Zielausbau und GesamtabnahmeZA2vorbereitet
kein Review
Annahme gesperrt
Kein unerfülltes Ziel ohne dokumentierte Scope-Entscheidung.Intake- und VollständigkeitsvertragA2 · individuelle AT-12-Aufnahmen · alle acht GesamtabnahmedimensionenNach A2 jede Anwendung einzeln aufnehmen und alle Gesamtdimensionen real belegen.

Echtgeld-Governance · getrennt vom AP-Programm

WP-LIVE-01 bis WP-LIVE-09

Webstand aktuell
v1.0.0 · erzeugt 2026-08-24 11:04 · fällig spätestens 2026-08-31 11:04

Diese Pakete dokumentieren Kandidatenvorschläge aus DEMO, die alleinige menschliche Echtgeldentscheidung, Schutzgates, Zwei-Runner-Topologie und Credential-Closure. Agenten dürfen würdige DEMO-Kandidaten vorschlagen und den Betreiber benachrichtigen; was tatsächlich in Echtgeld gelangt, entscheidet ausschließlich der Betreiber. Die Projektion muss mindestens alle sieben Tage erneuert werden und wird danach sichtbar als stale markiert.

PaketLieferungEhrlicher StandBereits belegtFehlt nochNächste konkrete Aktion
WP-LIVE-01DEMO-Kandidateneignung und Vorschlags-Outboxin Umsetzung
nicht formal angenommen
Origin-v2-Vertrag und adversariale Tests vorhanden; aktuell null geeignete Kandidaten.Producer-/Consumer-Migration, reale v2-Ledger und externer Chain-Head-Anchor.Content-addressed Schema-/Producerarchive bauen und origin-native v2-Ereignisse erzeugen.
WP-LIVE-02Betreiberbenachrichtigung und Zustellbelegin Umsetzung
nicht formal angenommen
Benachrichtigungs- und Proposal-Kern getestet; keine aktuelle Zustellung erzeugt.Freigegebener Transport, Betreiber-Receipt-Kanal und externer Ledger-Anchor.Transportvertrag ohne Credential-Offenlegung und mit exaktem Delivery-Receipt binden.
WP-LIVE-03Exakter menschlicher Echtgeld-Aufnahmeentscheidvorbereitet
nicht formal angenommen
Operator-Decision-Schema v2 und Validator vorhanden.Keine v2-Entscheidung und keine exakte Operator-Session-Attestation vorhanden.Erst nach einem würdigen DEMO-Kandidaten einen konkreten menschlichen Entscheid erfassen.
WP-LIVE-04Broker-Schutzstop und begrenzte Positionsgrößevorbereitet
nicht formal angenommen
Isolierter Schutzkandidat und Negativtests vorhanden.Nicht in Runner oder Brokeradapter integriert; keine Broker-Null-Call-Evidenz.Exakten Integrationspfad als wirkungslosen Ring-4-Kandidaten bauen und unabhängig prüfen.
WP-LIVE-05Fail-closed Konto- und Portfolioverlustgatevorbereitet
nicht formal angenommen
Isoliertes Verlustgate und Tests vorhanden.Kontenweite Verlustquelle, persistenter Zustand und Runtimeintegration fehlen.Minimierte kontenweite Risikoprojektion und Recovery-Vertrag implementieren.
WP-LIVE-06Kontenweites Cross-Process-Singletonvorbereitet
nicht formal angenommen
Isolierter Singleton-/Positionsgate-Kandidat ist getestet.Exakter Runtime-Lockpfad, Berechtigungen und Multi-Prozess-Probe fehlen.Fail-closed Lock-/Recovery-Design gegen beide Runner und alle Positionen prüfen.
WP-LIVE-07Ring-4/AP-08-Nachfolger für Zwei-Runner-Topologieblockiert
nicht formal angenommen
Projektionsanforderungen vollständig; AP-08-Risikoreceipt lautet CHANGE_REQUIRED.Collector, geschützter Pseudonymisierungsschlüssel, frischer Snapshot und integrierte Schutzgates fehlen.Collector und Key bereitstellen, danach frischen Snapshot und neue AP-08-Entscheidung erzeugen.
WP-LIVE-08Parallelbetrieb, Betreibersouveränität und Evidenzkettein Umsetzung
nicht formal angenommen
WP v1.4, Inventory v1.8, Ring-4 v1.6, PE-170 und PREPARE v1 dokumentiert.Formatschema/-validator, PREPARE-Nachfolger, Seal, externer Anchor, E-03 und E-11 fehlen.PREPARE-Nachfolger mit Zeitkorrektur und eigenständiger Formatvalidierung bauen.
WP-LIVE-09Notification-Credential rotieren und Secret-Store migrierenblockiert
nicht formal angenommen
Incident ist ohne Secretwert dokumentiert.Widerruf, Rotation, Secret-Store-Migration und redigierter Zustelltest sind Betreiberaktionen.Betreiber rotiert das Credential und liefert anschließend ausschließlich redigierten Closeout-Beleg.

AP-12 bis AP-16

Technisch vorbereitet, bewusst noch geschlossen

Die späteren Verträge sind implementiert und negativ getestet. Eine Phase öffnet trotzdem erst, wenn jeder hier aufgeführte Realnachweis exakt vorliegt. Fehlend bedeutet geschlossen – niemals automatisch bestanden.

AP-12Startgate geschlossen

Pilotentscheidung und PB-Backlog

Spätere Lieferung: signed Go/Change/Stop decision, benefit-effort balance and prioritized PB backlog

Zum Öffnen fehlen reale Nachweise

  • AP-09 formal abgenommen
  • mindestens vier reale AP-10-Messwochen
  • Quelle, Qualitätsprüfung und Realwert je Pilot-KPI
  • relevante unabhängige AP-11-Verifikation abgeschlossen
  • kein offener kritischer Semantik-/Autoritätskonflikt
  • benannter Scope-Owner

Abnahmebezug: SRS 12.2; AP-12

AP-13Startgate geschlossen

Produktbaseline und erste Promotion

Spätere Lieferung: product baseline and first controlled real W1 promotion

Zum Öffnen fehlen reale Nachweise

  • signierte AP-12-Go-Entscheidung
  • gesamte Phase-P-Abnahme bestanden
  • VA-01 bis VA-03 ohne kritischen Befund
  • vollständiges M-103-Bestandsinventar
  • alle PB-Anforderungen verifiziert
  • alle PB-Abnahmeszenarien bestanden
  • benannter PB-Owner

Abnahmebezug: SRS 12.3; M-103; AP-13

AP-14Startgate geschlossen

Kontextprodukt und Agentenskalierung

Spätere Lieferung: two role-specific context profiles used without mandatory-core violation

Zum Öffnen fehlen reale Nachweise

  • AP-13-Produktabnahme bestanden
  • erste reale W1-Promotion vollständig
  • Aufgaben-Pflichtkerne versioniert und getestet
  • benannter A1-Owner

Abnahmebezug: SRS 8; AT-04; AP-14

AP-15Startgate geschlossen

Kontrollierte Evolution

Spätere Lieferung: AT-14a-c evidence, one completed distillate path and accepted plus rejected engineer proposals

Zum Öffnen fehlen reale Nachweise

  • Zwei-Rollen-Kontextaudit bestanden
  • Kontrollmengenregister vollständig
  • Destillat-Rezeptregister aktiv
  • benannter A2-Owner

Abnahmebezug: M-097-M-099; AT-14a-c; AP-15

AP-16Startgate geschlossen

Zielausbau und Gesamtabnahme

Spätere Lieferung: individually accepted intake contracts and complete SRS 13.3 mandate reconciliation

Zum Öffnen fehlen reale Nachweise

  • AT-14a bis AT-14c bestanden
  • Ring-4-Umgehungstest für A2 wiederholt
  • benannter Z-Owner

Abnahmebezug: S-025; AT-12; SRS 13.3; AP-16

Messkatalog

Was genau wird gemessen?

Die Messung beantwortet drei Fragen: Hilft das Gehirn bei besseren Entscheidungen? Lernt die Edge-Forschung schneller und ehrlicher? Spart das Ergebnis nachweisbar Aufwand oder verbessert es nach Freigabe den risikoadjustierten Produktionsnutzen?

Aktueller Messstand: Der Kollektor läuft, aber ausschließlich im Modus „vor Messstart“: 0 Messwochen, Startgate geschlossen und keine Produktionswirkung. Reale AP-10-Baselines bleiben offen, bis AP-09 und die unabhängigen Gates bestanden sind. Fehlende Nenner erscheinen als „noch nicht messbar“ und niemals als künstliche Null.
130
Dossiers beobachtet, kein Erfolgs-KPI
3580/3587
gesunde / alle Servicebelege
$517.57
Provider-API-Äquivalent, kumuliert
22
offene Probleme/Aktionen

Systemnutzen

C1technisch erhebbar

Nachvollziehbarkeit

Ist jede Aussage bis zu Quelle, Version, Versuch und Entscheidung zurückverfolgbar?

Messung:
Anteil vollständig auflösbarer Pflichtreferenzen in Stichprobe und End-to-End-Fällen.
Quelle:
Pilotstore, Provenienz- und Edge-Evidenzpakete
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Es fehlt eine reale, unabhängig gezogene AP-10-Stichprobe; Objektzählung wäre kein Ersatz.
C2technisch erhebbar

Negativergebnis-Abdeckung

Werden widerlegte und inkonklusive Versuche genauso wiedergefunden wie positive?

Messung:
Gefundene erwartete Negativbefunde geteilt durch alle gesetzten Kontrollbefunde.
Quelle:
Wissensindex und Kontrollmenge
Vor Messstart beobachtet: noch kein belastbarer Wert · Zähler/Nenner 0/0
Status: observable_insufficient
Grenze: Vor AP-10 nur technische Beobachtung, keine Baseline.
C3Pilotmessung offen

Auslassungsrate

Welche bekannten Pflichtinformationen fehlen im gelieferten Kontext?

Messung:
Nicht ausgelieferte gesetzte Pflichtkerne je Aufgabenprofil und Lauf.
Quelle:
Kontextprofile und Auslassungsaudit
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Ohne AP-14-Kontextprofile und reale kontrollierte Fälle nicht seriös messbar.
C4Pilotmessung offen

Entscheidungswirkung

Hat vorhandenes Wissen eine unnötige Wiederholung, einen Fehler oder eine falsche Freigabe verhindert?

Messung:
Dokumentierte Entscheidungen mit belegtem Wissenseinfluss, getrennt nach Nutzenart.
Quelle:
Entscheidungs- und Aktionsregister
Vor Messstart beobachtet: noch kein belastbarer Wert · Zähler/Nenner 0/0
Status: observable_insufficient
Grenze: Unter zehn Fällen nicht veröffentlichbar; bloßes Anzeigen zählt nicht.
C5technisch erhebbar

Reproduzierbarkeit

Lässt sich ein behaupteter Befund aus den gebundenen Inputs erneut erzeugen?

Messung:
Erfolgreiche unabhängige Reproduktionen geteilt durch alle fälligen Reproduktionen.
Quelle:
Run-Manifeste, Captures und unabhängige Prüfberichte
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Builder-Tests und Selbstwiederholungen sind keine unabhängige Reproduktion.
C12technisch erhebbar

Falsche Zusammenführungen

Wurden unterschiedliche Erkenntnisse fälschlich als Dublette behandelt?

Messung:
Bestätigte False-Merges pro geprüfter Deduplizierungsstichprobe.
Quelle:
Dubletten-Audit und Korrekturregister
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Fehlende Incidents dürfen nicht als Nullrate ausgegeben werden.
C14technisch erhebbar

Quellsystem-Autonomie

Bleiben Ursprungssysteme bei SIP-Ausfall vollständig arbeitsfähig?

Messung:
Bestandene Ausfallproben ohne Produktions- oder Researchblockade.
Quelle:
Kill-Switch- und Entkopplungstests
Vor Messstart beobachtet: 3580 healthy_receipts · Zähler/Nenner 3580/3587
Status: technical_observation_not_baseline
Grenze: Kurzer Drill und laufende Timerbelege sind noch kein nachhaltiger AP-10-Nachweis.
C15technisch erhebbar

Risiko-Unterklassifizierung

Wurde eine schutzrelevante Änderung zu niedrig eingestuft?

Messung:
Nach Audit höher klassifizierte Fälle geteilt durch W0/K1-Stichprobe.
Quelle:
Ring-4-Klassifizierungs- und Karenzaudit
Vor Messstart beobachtet: noch kein belastbarer Wert · Zähler/Nenner 0/0
Status: observable_insufficient
Grenze: Keine reale Quartalsstichprobe; Null Beobachtungen sind keine Nullrate.

Edge-Lernen

EL-01Pilotmessung offen

Zeit bis zur Falsifikation

Wie schnell wird eine nicht tragfähige Hypothese sauber beendet?

Messung:
Median von Vorregistrierung bis belastbarem Stop-/Change-Urteil.
Quelle:
Trial Ledger und Entscheidungsregister
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Dossierdatum allein besitzt nicht die nötige Entscheidungszeit und Qualitätssicherung.
EL-02technisch erhebbar

Vollständigkeit der Trialfamilie

Sind auch schlechte, abgebrochene und fehlgeschlagene Varianten sichtbar?

Messung:
Gebuchte und abgeschlossene Trials plus erklärte Ausfälle gegen vorregistrierten Suchraum.
Quelle:
Trial Ledger, Run-Manifeste und Fehlerregister
Vor Messstart beobachtet: 68.5 % · Zähler/Nenner 89/130
Status: partial_contract_observation
Grenze: Die unabhängige Ausführungsliste fehlt; angezeigt wird nur Dossier↔Ledger-Bindung.
EL-03technisch erhebbar

Holdout-Integrität

Blieben ungesehene Daten bis zur festgelegten Prüfung wirklich ungesehen?

Messung:
Verstöße, Grenzberührungen und bestandene Embargo-Prüfungen je Kandidat.
Quelle:
Research-Governance und Datenzugriffsprotokoll
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Abwesenheit eines protokollierten Funds darf nicht als null Berührungen gelten.
EL-04technisch erhebbar

Evidenzvollständigkeit

Wie viel des vorgeschriebenen Edge-Evidenzpakets ist belegt?

Messung:
Belegte Pflichtfelder geteilt durch alle anwendbaren Pflichtfelder; fehlende Felder einzeln ausweisen.
Quelle:
Edge-Evidenzrenderer und Validator
Vor Messstart beobachtet: noch kein belastbarer Wert · Zähler/Nenner —/0
Status: observable_insufficient
Grenze: Ohne reale Pakete kein aussagekräftiger Nenner.
EL-05Pilotmessung offen

Wirkung von Negativwissen

Verhindert vorhandenes Negativwissen redundante Versuche oder schärft es neue Hypothesen?

Messung:
Belegte Wiederverwendungen nach verhindert, verändert oder bewusst erneut geprüft.
Quelle:
Kontext- und Entscheidungsregister
Vor Messstart beobachtet: noch kein belastbarer Wert · Zähler/Nenner —/0
Status: observable_insufficient
Grenze: C4 kennt Wirkung, aber die Negativbefund-Untermenge benötigt eine eigene reale Markierung.
EL-06Pilotmessung offen

Forward-Kalibrierung

Wie gut sagen Researchurteil und Unsicherheit die echte Vorwärtsbewährung voraus?

Messung:
Vorhergesagte gegen beobachtete Ergebnis-/Risikoklassen je eingefrorenem Kandidat und Monat.
Quelle:
Forward-Ledger
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Es existieren Forward-Zeilen, aber keine gebundenen Vorhersagebänder; historische Replays zählen nicht.

Wirtschaftlichkeit

W1Pilotmessung offen

Vermiedener Researchaufwand

Wie viel Arbeit wurde durch Wiederverwendung oder frühe Falsifikation gespart?

Messung:
Belegte vermiedene Lauf-, Review- und Implementierungszeit; keine pauschale Schätzung.
Quelle:
Aktionsregister, Laufzeiten und Reviewprotokolle
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Eine Schätzung ohne konkreten verhinderten Vorgang wird nicht gezählt.
W2Pilotmessung offen

Researchkosten je Entscheidung

Was kostet ein belastbares Stop-/Change-/Go-Urteil?

Messung:
Rechen-, Provider- und menschlicher Aufwand je abgeschlossener Entscheidung.
Quelle:
Agentenverlauf, Laufkosten und Zeitbuchung
Vor Messstart beobachtet: $517.57 API-Äquivalent
Status: operational_cost_observation
Grenze: Providerkosten und Laufzeit sind beobachtbar; menschliche Zeit und abgeschlossene Entscheidungsnenner fehlen noch.
W3Pilotmessung offen

Risikoadjustierter Produktionsnutzen

Verbessert eine freigegebene Änderung das Ergebnis nach Kosten und Risiko?

Messung:
Nur nach Promotion: inkrementelle Forward-/Live-Wirkung gegen eingefrorene Baseline inklusive Drawdown und Kosten.
Quelle:
Trading-App, Promotion- und Forward-Ledger
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_applicable_before_promotion
Grenze: Vor Promotion absichtlich nicht messbar; Research-PnL darf nicht als Produktionsgewinn ausgegeben werden.

Wie „Geld verdienen“ sauber gemessen wird

Researchgewinn und realer Tradingnutzen sind verschiedene Ebenen. Der erste spart Fehlversuche und Reviewzeit. Der zweite darf erst nach einer kontrollierten Promotion gegen eine eingefrorene Produktionsbaseline gemessen werden.

Kosten sparen

Vermiedene Duplikate, frühere Falsifikation, weniger Fehlersuche und geringerer Provider-/Computeaufwand.

Risiko senken

Verhinderte Fehlfreigaben, kleinere Drawdowns, weniger Drift und schneller erkannte BT/Live-Abweichungen.

Ergebnis verbessern

Nur inkrementelle Forward-/Live-Wirkung nach Kosten gegen die vorab festgelegte Baseline.

Die Zielgröße ist risikoadjustierter, reproduzierbarer Netto-Nutzen. Anzahl Agenten, Dokumente, Trials oder gefundene „Edges“ sind keine primären Erfolgskennzahlen.