Warchhold Research

Kernziel 03 · kontrollierte Verbesserung

Was wird verbessert – und woran erkennen wir echten Nutzen?

Das Cockpit verbindet die drei Programmziele mit Arbeitspaketen, Messgrößen und Freigabetoren. Es zeigt fehlende Baselines ausdrücklich als offen, statt Fortschritt aus Dokumentmenge, Agentenzahl oder Backtestgewinn abzuleiten.

2 / 17
formal bestandene APs
4
gebaut, Abnahme offen
2
blockiert
5
Vertrag gebaut, Gate zu
0
noch nicht begonnen
2 / 17
formal angenommen

Delegierte Agenten- und Menschenentscheidungen werden getrennt dokumentiert: Admin: AP-Abnahmen und Reviews. Ohne exakt gebundenes Abnahme-Envelope bleibt „Annehmen“ gesperrt.

Programmauftrag

Drei Ziele mit überprüfbarem Ergebnis

ZIEL 01

Belastbare Edges entwickeln

Strategien, Indikatoren, Regime-Logik und Stop-/Exit-Systeme werden als getrennte, falsifizierbare Bausteine erforscht.

Ergebnis: Nur Kandidaten mit offengelegtem Suchraum, Kosten, Holdout, Robustheit und Forward-Nachweis erreichen ein Freigabetor.

Zugeordnete Pakete: AP-04, AP-05, AP-10, AP-11, AP-13

Arbeitsbereich öffnen
ZIEL 02

Research nachvollziehbar betreiben

Jede Hypothese, jeder Versuch, jedes negative Ergebnis, jeder Fehler und jede Entscheidung bleibt auffindbar.

Ergebnis: Menschen können jederzeit verstehen, was geschah, warum es geschah, wer verantwortlich ist und welcher Nachweis fehlt.

Zugeordnete Pakete: AP-00 bis AP-09, AP-12

Arbeitsbereich öffnen
ZIEL 03

Kontrolliert dauerhaft verbessern

Das Gehirn erzeugt Verbesserungsvorschläge für Research, Engineering und Betrieb, darf Schutzregeln aber nicht selbst umgehen.

Ergebnis: Verbesserungen werden versioniert, unabhängig geprüft, freigegeben und anschließend gegen Nutzen, Risiko und Kosten gemessen.

Zugeordnete Pakete: AP-10, AP-12 bis AP-16

Arbeitsbereich öffnen

Vier Reifestufen statt eines unklaren „fertig“

Erst diese Trennung macht verständlich, warum viel Code vorhanden sein kann, obwohl ein Messpilot oder produktiver Einsatz noch nicht zulässig ist.

1

Gebaut

Code oder Dokument liegt vor. Das beweist noch keine fachliche Richtigkeit.

2

Technisch geprüft

Automatisierte Tests und definierte Exit-Kriterien sind für die exakten Bytes grün.

3

Im Pilot gemessen

Der reale Nutzen ist über den vorgesehenen Zeitraum gegen eine Baseline beobachtet.

4

Freigegeben

Unabhängige Prüfung und eine berechtigte Agenten- oder Menschenentscheidung erlauben den begrenzten Einsatz; Auto-Deployment ausschließlich auf IG DEMO.

Beschlossene Betriebslogik

Wer forscht, wer entscheidet, wer führt aus?

Agentenentscheidungen sind erlaubt, aber nur innerhalb ihrer freigegebenen Hülle. Providerrolle, Entscheidung und technische Ausführung bleiben getrennt, damit kein Modell seine eigenen Ergebnisse ungeprüft in einen Slot schreibt.

Claude · Strategiewerkstatt

Kontingent: Claude session usage

Literatur- und Empirie-Research, Strategiefindung und Strategieaufbau. Keine AP-, Governance- oder DEMO-Deployment-Entscheidung.

Codex · System-Gehirn

Kontingent: ChatGPT/Codex usage

Kuration, Evidenzprüfung sowie AP- und DEMO-Entscheidungen innerhalb E-11/E-12. Vorgeschriebene unabhängige Prüfung bleibt unersetzbar.

Deterministische Executor

Kontingent: none

Tests, Attestationen und exakt genehmigte Writes. Sie treffen keine fachliche Entscheidung und verbrauchen kein LLM-Kontingent.

Unabhängige Assurance

Kontingent: noch nicht zugewiesen

VA-/R-U-Gates, bei denen organisatorische Unabhängigkeit Pflicht ist. Claude wird dafür nicht mehr verwendet.

Automatischer DEMO-Weg: Claude-Kandidat → deterministische Evidenz → Codex-Prüfer → Codex-E-11/E-12-Entscheidung → No-LLM-Executor → aktiver IG-DEMO-Slot. Echtgeld bleibt verboten. Aktuell wartet der Executor noch auf die einmalige Aktivierung der Strategie-Bibliotheksrichtlinie in der Trading-Datenbank.

Steuerungsboard

AP-00 bis AP-16

„Prüfbereit“ bedeutet: Lieferung und technische Tests sind vorhanden, die formale Abnahme des Exit-Kriteriums ist aber noch offen. Stand des Abschlussaudits: 2026-07-20 08:13.

APLieferungPhaseAbhängigkeitEhrlicher StandFormales ReviewExitBereits belegtFehlt nochNächste konkrete Aktion
AP-00Baseline, Entscheidungen und FallauswahlP0prüfbereit
kein Review
Annahme gesperrt
PR-001 fachlich vorbereitet; kein offener Scopekonflikt.Builder-Dossier v3 · Baseline-Dokumentunabhängiger VA-02-/Paritätsnachweis · autorisierte AbschlussentscheidungUnabhängigen Nicht-Claude-Prüfer binden und den eingefrorenen Baseline-/Paritätsumfang prüfen lassen.
AP-01Zielarchitektur und Trust-ZonenP0AP-00prüfbereit
kein Review
Annahme gesperrt
Architekturreview gegen Read-only, M-087 und Ring 4 bestanden.Architekturdokument · operatives Architektur-Overlay · Builder-Dossier v3unabhängiges Architekturreview · autorisierte AbschlussentscheidungBasisarchitektur und operatives Overlay bytegenau durch eine getrennte unabhängige Rolle prüfen.
AP-02Quelleninventar und Nur-Lese-AdapterP0AP-01in Umsetzung
kein Review
Annahme gesperrt
PR-002 bestanden; Quelllücken sichtbar statt still übersprungen.Quelleninventar 1.3 und datensparsamer Nur-Lese-Laufzeitadapter · laufende Nur-Lese-Belege · historische Claude-W2/K2-Annahme wegen Rollen- und Evidenzkonflikt append-only unwirksamfrischer Quellen- und Cursor-Freeze für Inventar 1.3 · unabhängiges Missing/Changed/Permission- und Exact-Byte-Review · unabhängig belegte numerische E-03-Wirkungsschwelle · getrennter K2-Entscheid · formale AP-02-Abnahme · Abhängigkeit AP-01Inventar 1.3 mit E-03-Schwelle bytegenau unabhängig prüfen; keinen weiteren Claude- oder identischen Governor-Lauf starten.
AP-03Pilotstore, Identität und HistorieP0AP-01 / AP-02bestanden
angenommen
Agentenentscheidung · 2026-07-19 21:55
PR-003 und P-001–P-014 bestanden.19 exakt gebundene grüne Oracles · Codex-E-11-Review · append-only Acceptance-Envelopenichts – formal angenommenPilotstore weiter beobachten; neue Abweichungen append-only dokumentieren.
AP-04Index, Negativwissen und KonflikteP0AP-03bestanden
angenommen
Agentenentscheidung · 2026-07-19 21:58
P-015–P-018 bestanden; erste C2-/C4-Messwege erzeugen Daten.12 exakt gebundene grüne Oracles · C2/C4-Indexierungsoracles · Codex-E-11-Review · append-only Acceptance-Envelopenichts – formal angenommenC2/C4 über reale Pilotzeit messen; technische Abnahme nicht als Nutzenbeweis ausgeben.
AP-05Edge-Evidenzpaket und End-to-End-FälleP0AP-02 / AP-03 / AP-04prüfbereit
kein Review
Annahme gesperrt
PR-008, P-019 und P-200 bestanden; fehlende Felder besitzen Owner und Folgeentscheidung.Edge-Evidenzrenderer · Builder-Dossier v3 · End-to-End-Fallstrukturformaler P-200-Abschluss · unabhängige R-S-/R-U-Paritäts- und RobustheitsevidenzHistorischen P-200-Fall schließen und eingefrorene Edge-Evidenz unabhängig reproduzieren lassen.
AP-06Schattenbeiträge und AgentenregelnP0AP-03prüfbereit
kein Review
Annahme gesperrt
PR-004 und P-020–P-023 bestanden.E0-Schattenkanal · Agentenverträge · Builder-Dossier v3unabhängiges B-Review · autorisierte AbschlussentscheidungPR-004 und P-020–P-023 durch eine unabhängige Rolle prüfen lassen.
AP-07Ring 4 und EntscheidungsschutzP0AP-01 / AP-03in Umsetzung
kein Review
Annahme gesperrt
PR-005 und P-100–P-110/P-114 bestanden.Genesis 1.4 und demo_only-Runner bytegenau getestet · erste Funktionsschutzablehnung führte zu direkten Load-/Hot-Reload-Tests · spätere W2-Annahme wegen E-03 und fehlender 24-h-Karenz append-only für unwirksam erklärt · Restart-Executor sperrt ohne gültige Ring-4-Autorisierungunabhängig belegte numerische E-03-Wirkungsschwelle oder strenger unabhängiger K3-Pfad · gültige Chronologie und neuer exakter W2-Entscheid · K2-Quelleninventarentscheidung für Inventar 1.3 · unabhängiges Exact-Byte-Review des vollständigen AP-07-Pakets · formale AP-07-Abnahme · Abhängigkeit AP-01Numerischen E-03-Schwellenkandidaten versiegeln und unabhängig prüfen lassen; Genesis 1.4 bis dahin nicht laden.
AP-08Observability und EntkopplungP0AP-02 / AP-03 / AP-07in Umsetzung
kein Review
Annahme gesperrt
PR-006/PR-007 und P-111/P-202 bestanden.15-Minuten-Beobachter läuft ohne Wiederholung · 38 geeignete Receipts, 0 ungesunde Receipts und 9,530616 reale Stunden im gebundenen Snapshot · getrennte E-11-Agentenentscheidung: 168 h Beobachtung und 2 h Mindest-Ausfallprobe168 reale gesunde Beobachtungsstunden vollständig verstrichen · konkret autorisierte unabhängige zweistündige Ausfallprobe · unabhängiger Ausfallbericht · formales AP-08-Review · Abhängigkeiten AP-02 und AP-07Reale Zeit automatisch weiterlaufen lassen; keine Parameter- oder Laufwiederholung.
AP-09Automatisierte Abnahme und Pilot-ReadinessP0AP-02 / AP-03 / AP-04 / AP-05 / AP-06 / AP-07 / AP-08 / AP-11blockiert
kein Review
Annahme gesperrt
Vollständiger Preflight grün; Messpilotfreigabe dokumentiert.AP-09-Closure v1.1 bindet 49 Zusatzabhängigkeiten · Library-Migration besitzt Rollback- und Flat-Gates · direkter Aktivierungs-CLI ist gesperrt · deterministischer Wartungsexecutor verlangt eine gültige Ring-4-Restart-AutorisierungAP-02 bis AP-08 formal geschlossen · frische unabhängige AP-11-Verifikation · gültiger Library-K3-Entscheid und installierte Policy · gültig akzeptierte Folge-Genesis nach E-03 · neues natives AP-09-Manifest mit finalem BytebestandE-03/AP-07 und AP-11 schließen; vorher weder Wartungsrestart noch neuen AP-09-Freeze ausführen.
AP-10Messpilot über vier bis acht WochenPAP-09in Umsetzung
kein Review
Annahme gesperrt
P-201, alle übrigen P-Fälle und Go/Change/Stop-Entscheidung.Messkatalog · Kollektor im Preflight-Modus · Startgate fail-closed · 0 angerechnete MesswochenAP-09-Freigabe · AP-11 unabhängig abgeschlossen · exakte Startautorisierung · mindestens vier reale Messwochen · P-201 und Go/Change/StopPreflight gesund halten; Messzeit nicht vor AP-09 zählen.
AP-11Unabhängige Verifikation VA-01–VA-03P/PBeingefrorene Inputsblockiert
kein Review
Annahme gesperrt
Keine offenen kritischen Befunde für die jeweils beanspruchte Aussage.SELF-ATTEST-Manifest v1.4 friert aktuelle Governance- und Library-Bytes ein · historische Claude-Annahme wird abgewiesen · stale Run-9-Genesis-Aussage ist als historisch reconciliert · alle drei Claim-Familien bleiben blockiertorganisatorisch unabhängiger externer Nicht-Claude-Prüfer · frischer read-only Freeze beim Prüfer · gültige VA-01-, VA-02- und VA-03-Berichte · unabhängiger R-U-Pass ohne kritische BefundeExternen, am Build und an den Orakeln unbeteiligten Prüfer an Manifest v1.4 binden.
AP-12Pilotentscheidung und PB-BacklogPAP-10 / AP-11vorbereitet
kein Review
Annahme gesperrt
Dokumentierte Entscheidung mit Evidenz und Ownern.geschlossener ZukunftsphasenvertragAP-10 abgeschlossen · AP-11 abgeschlossen · reale Go/Change/Stop-EntscheidungVertrag geschlossen halten und nach AP-10/11 reale Evidenz binden.
AP-13ProduktbaselinePBPilot-Govorbereitet
kein Review
Annahme gesperrt
Alle PB-Anforderungen und PB-Abnahmen bestanden.PB-Inventar- und PromotionvertragPilot-Go · vollständiges PB-Inventar · PB-Abnahmen · kontrollierte reale W1-PromotionErst nach Pilot-Go die Produktbaseline und erste kontrollierte Promotion ausführen.
AP-14Kontextprodukt und AgentenskalierungA1PBvorbereitet
kein Review
Annahme gesperrt
Zwei Agentenrollen arbeiten mit nachweisbarem SIP-Kontext ohne Pflichtkernverstoß.Kontextprofil-Entwurf · Pflichtkern-AssemblerPB · Owner-abgenommene Pflichtkerne · reales Auditfenster mit zwei RollenNach PB sechs Pflichtkerne abnehmen und zwei Rollen real auditieren.
AP-15Kontrollierte EvolutionA2A1vorbereitet
kein Review
Annahme gesperrt
Ein Destillat und je ein angenommener und abgelehnter Engineer-Vorschlag durchlaufen AT-14a–c.Destillat- und Engineer-GrenzvertragA1 · realer Destillatpfad · angenommener AT-14-Vorschlag · abgelehnter AT-14-VorschlagNach A1 die drei realen AT-14-Pfade auditierbar durchführen.
AP-16Zielausbau und GesamtabnahmeZA2vorbereitet
kein Review
Annahme gesperrt
Kein unerfülltes Ziel ohne dokumentierte Scope-Entscheidung.Intake- und VollständigkeitsvertragA2 · individuelle AT-12-Aufnahmen · alle acht GesamtabnahmedimensionenNach A2 jede Anwendung einzeln aufnehmen und alle Gesamtdimensionen real belegen.

AP-12 bis AP-16

Technisch vorbereitet, bewusst noch geschlossen

Die späteren Verträge sind implementiert und negativ getestet. Eine Phase öffnet trotzdem erst, wenn jeder hier aufgeführte Realnachweis exakt vorliegt. Fehlend bedeutet geschlossen – niemals automatisch bestanden.

AP-12Startgate geschlossen

Pilotentscheidung und PB-Backlog

Spätere Lieferung: signed Go/Change/Stop decision, benefit-effort balance and prioritized PB backlog

Zum Öffnen fehlen reale Nachweise

  • AP-09 formal abgenommen
  • mindestens vier reale AP-10-Messwochen
  • Quelle, Qualitätsprüfung und Realwert je Pilot-KPI
  • relevante unabhängige AP-11-Verifikation abgeschlossen
  • kein offener kritischer Semantik-/Autoritätskonflikt
  • benannter Scope-Owner

Abnahmebezug: SRS 12.2; AP-12

AP-13Startgate geschlossen

Produktbaseline und erste Promotion

Spätere Lieferung: product baseline and first controlled real W1 promotion

Zum Öffnen fehlen reale Nachweise

  • signierte AP-12-Go-Entscheidung
  • gesamte Phase-P-Abnahme bestanden
  • VA-01 bis VA-03 ohne kritischen Befund
  • vollständiges M-103-Bestandsinventar
  • alle PB-Anforderungen verifiziert
  • alle PB-Abnahmeszenarien bestanden
  • benannter PB-Owner

Abnahmebezug: SRS 12.3; M-103; AP-13

AP-14Startgate geschlossen

Kontextprodukt und Agentenskalierung

Spätere Lieferung: two role-specific context profiles used without mandatory-core violation

Zum Öffnen fehlen reale Nachweise

  • AP-13-Produktabnahme bestanden
  • erste reale W1-Promotion vollständig
  • Aufgaben-Pflichtkerne versioniert und getestet
  • benannter A1-Owner

Abnahmebezug: SRS 8; AT-04; AP-14

AP-15Startgate geschlossen

Kontrollierte Evolution

Spätere Lieferung: AT-14a-c evidence, one completed distillate path and accepted plus rejected engineer proposals

Zum Öffnen fehlen reale Nachweise

  • Zwei-Rollen-Kontextaudit bestanden
  • Kontrollmengenregister vollständig
  • Destillat-Rezeptregister aktiv
  • benannter A2-Owner

Abnahmebezug: M-097-M-099; AT-14a-c; AP-15

AP-16Startgate geschlossen

Zielausbau und Gesamtabnahme

Spätere Lieferung: individually accepted intake contracts and complete SRS 13.3 mandate reconciliation

Zum Öffnen fehlen reale Nachweise

  • AT-14a bis AT-14c bestanden
  • Ring-4-Umgehungstest für A2 wiederholt
  • benannter Z-Owner

Abnahmebezug: S-025; AT-12; SRS 13.3; AP-16

Messkatalog

Was genau wird gemessen?

Die Messung beantwortet drei Fragen: Hilft das Gehirn bei besseren Entscheidungen? Lernt die Edge-Forschung schneller und ehrlicher? Spart das Ergebnis nachweisbar Aufwand oder verbessert es nach Freigabe den risikoadjustierten Produktionsnutzen?

Aktueller Messstand: Der Kollektor läuft, aber ausschließlich im Modus „vor Messstart“: 0 Messwochen, Startgate geschlossen und keine Produktionswirkung. Reale AP-10-Baselines bleiben offen, bis AP-09 und die unabhängigen Gates bestanden sind. Fehlende Nenner erscheinen als „noch nicht messbar“ und niemals als künstliche Null.
66
Dossiers beobachtet, kein Erfolgs-KPI
55/62
gesunde / alle Servicebelege
$248.49
Provider-API-Äquivalent, kumuliert
13
offene Probleme/Aktionen

Systemnutzen

C1technisch erhebbar

Nachvollziehbarkeit

Ist jede Aussage bis zu Quelle, Version, Versuch und Entscheidung zurückverfolgbar?

Messung:
Anteil vollständig auflösbarer Pflichtreferenzen in Stichprobe und End-to-End-Fällen.
Quelle:
Pilotstore, Provenienz- und Edge-Evidenzpakete
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Es fehlt eine reale, unabhängig gezogene AP-10-Stichprobe; Objektzählung wäre kein Ersatz.
C2technisch erhebbar

Negativergebnis-Abdeckung

Werden widerlegte und inkonklusive Versuche genauso wiedergefunden wie positive?

Messung:
Gefundene erwartete Negativbefunde geteilt durch alle gesetzten Kontrollbefunde.
Quelle:
Wissensindex und Kontrollmenge
Vor Messstart beobachtet: noch kein belastbarer Wert · Zähler/Nenner 0/0
Status: observable_insufficient
Grenze: Vor AP-10 nur technische Beobachtung, keine Baseline.
C3Pilotmessung offen

Auslassungsrate

Welche bekannten Pflichtinformationen fehlen im gelieferten Kontext?

Messung:
Nicht ausgelieferte gesetzte Pflichtkerne je Aufgabenprofil und Lauf.
Quelle:
Kontextprofile und Auslassungsaudit
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Ohne AP-14-Kontextprofile und reale kontrollierte Fälle nicht seriös messbar.
C4Pilotmessung offen

Entscheidungswirkung

Hat vorhandenes Wissen eine unnötige Wiederholung, einen Fehler oder eine falsche Freigabe verhindert?

Messung:
Dokumentierte Entscheidungen mit belegtem Wissenseinfluss, getrennt nach Nutzenart.
Quelle:
Entscheidungs- und Aktionsregister
Vor Messstart beobachtet: noch kein belastbarer Wert · Zähler/Nenner 0/0
Status: observable_insufficient
Grenze: Unter zehn Fällen nicht veröffentlichbar; bloßes Anzeigen zählt nicht.
C5technisch erhebbar

Reproduzierbarkeit

Lässt sich ein behaupteter Befund aus den gebundenen Inputs erneut erzeugen?

Messung:
Erfolgreiche unabhängige Reproduktionen geteilt durch alle fälligen Reproduktionen.
Quelle:
Run-Manifeste, Captures und unabhängige Prüfberichte
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Builder-Tests und Selbstwiederholungen sind keine unabhängige Reproduktion.
C12technisch erhebbar

Falsche Zusammenführungen

Wurden unterschiedliche Erkenntnisse fälschlich als Dublette behandelt?

Messung:
Bestätigte False-Merges pro geprüfter Deduplizierungsstichprobe.
Quelle:
Dubletten-Audit und Korrekturregister
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Fehlende Incidents dürfen nicht als Nullrate ausgegeben werden.
C14technisch erhebbar

Quellsystem-Autonomie

Bleiben Ursprungssysteme bei SIP-Ausfall vollständig arbeitsfähig?

Messung:
Bestandene Ausfallproben ohne Produktions- oder Researchblockade.
Quelle:
Kill-Switch- und Entkopplungstests
Vor Messstart beobachtet: 55 healthy_receipts · Zähler/Nenner 55/62
Status: technical_observation_not_baseline
Grenze: Kurzer Drill und laufende Timerbelege sind noch kein nachhaltiger AP-10-Nachweis.
C15technisch erhebbar

Risiko-Unterklassifizierung

Wurde eine schutzrelevante Änderung zu niedrig eingestuft?

Messung:
Nach Audit höher klassifizierte Fälle geteilt durch W0/K1-Stichprobe.
Quelle:
Ring-4-Klassifizierungs- und Karenzaudit
Vor Messstart beobachtet: noch kein belastbarer Wert · Zähler/Nenner 0/0
Status: observable_insufficient
Grenze: Keine reale Quartalsstichprobe; Null Beobachtungen sind keine Nullrate.

Edge-Lernen

EL-01Pilotmessung offen

Zeit bis zur Falsifikation

Wie schnell wird eine nicht tragfähige Hypothese sauber beendet?

Messung:
Median von Vorregistrierung bis belastbarem Stop-/Change-Urteil.
Quelle:
Trial Ledger und Entscheidungsregister
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Dossierdatum allein besitzt nicht die nötige Entscheidungszeit und Qualitätssicherung.
EL-02technisch erhebbar

Vollständigkeit der Trialfamilie

Sind auch schlechte, abgebrochene und fehlgeschlagene Varianten sichtbar?

Messung:
Gebuchte und abgeschlossene Trials plus erklärte Ausfälle gegen vorregistrierten Suchraum.
Quelle:
Trial Ledger, Run-Manifeste und Fehlerregister
Vor Messstart beobachtet: 37.9 % · Zähler/Nenner 25/66
Status: partial_contract_observation
Grenze: Die unabhängige Ausführungsliste fehlt; angezeigt wird nur Dossier↔Ledger-Bindung.
EL-03technisch erhebbar

Holdout-Integrität

Blieben ungesehene Daten bis zur festgelegten Prüfung wirklich ungesehen?

Messung:
Verstöße, Grenzberührungen und bestandene Embargo-Prüfungen je Kandidat.
Quelle:
Research-Governance und Datenzugriffsprotokoll
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Abwesenheit eines protokollierten Funds darf nicht als null Berührungen gelten.
EL-04technisch erhebbar

Evidenzvollständigkeit

Wie viel des vorgeschriebenen Edge-Evidenzpakets ist belegt?

Messung:
Belegte Pflichtfelder geteilt durch alle anwendbaren Pflichtfelder; fehlende Felder einzeln ausweisen.
Quelle:
Edge-Evidenzrenderer und Validator
Vor Messstart beobachtet: noch kein belastbarer Wert · Zähler/Nenner —/0
Status: observable_insufficient
Grenze: Ohne reale Pakete kein aussagekräftiger Nenner.
EL-05Pilotmessung offen

Wirkung von Negativwissen

Verhindert vorhandenes Negativwissen redundante Versuche oder schärft es neue Hypothesen?

Messung:
Belegte Wiederverwendungen nach verhindert, verändert oder bewusst erneut geprüft.
Quelle:
Kontext- und Entscheidungsregister
Vor Messstart beobachtet: noch kein belastbarer Wert · Zähler/Nenner —/0
Status: observable_insufficient
Grenze: C4 kennt Wirkung, aber die Negativbefund-Untermenge benötigt eine eigene reale Markierung.
EL-06Pilotmessung offen

Forward-Kalibrierung

Wie gut sagen Researchurteil und Unsicherheit die echte Vorwärtsbewährung voraus?

Messung:
Vorhergesagte gegen beobachtete Ergebnis-/Risikoklassen je eingefrorenem Kandidat und Monat.
Quelle:
Forward-Ledger
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Es existieren Forward-Zeilen, aber keine gebundenen Vorhersagebänder; historische Replays zählen nicht.

Wirtschaftlichkeit

W1Pilotmessung offen

Vermiedener Researchaufwand

Wie viel Arbeit wurde durch Wiederverwendung oder frühe Falsifikation gespart?

Messung:
Belegte vermiedene Lauf-, Review- und Implementierungszeit; keine pauschale Schätzung.
Quelle:
Aktionsregister, Laufzeiten und Reviewprotokolle
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_collectable_yet
Grenze: Eine Schätzung ohne konkreten verhinderten Vorgang wird nicht gezählt.
W2Pilotmessung offen

Researchkosten je Entscheidung

Was kostet ein belastbares Stop-/Change-/Go-Urteil?

Messung:
Rechen-, Provider- und menschlicher Aufwand je abgeschlossener Entscheidung.
Quelle:
Agentenverlauf, Laufkosten und Zeitbuchung
Vor Messstart beobachtet: $248.49 API-Äquivalent
Status: operational_cost_observation
Grenze: Providerkosten und Laufzeit sind beobachtbar; menschliche Zeit und abgeschlossene Entscheidungsnenner fehlen noch.
W3Pilotmessung offen

Risikoadjustierter Produktionsnutzen

Verbessert eine freigegebene Änderung das Ergebnis nach Kosten und Risiko?

Messung:
Nur nach Promotion: inkrementelle Forward-/Live-Wirkung gegen eingefrorene Baseline inklusive Drawdown und Kosten.
Quelle:
Trading-App, Promotion- und Forward-Ledger
Vor Messstart beobachtet: noch kein belastbarer Wert
Status: not_applicable_before_promotion
Grenze: Vor Promotion absichtlich nicht messbar; Research-PnL darf nicht als Produktionsgewinn ausgegeben werden.

Wie „Geld verdienen“ sauber gemessen wird

Researchgewinn und realer Tradingnutzen sind verschiedene Ebenen. Der erste spart Fehlversuche und Reviewzeit. Der zweite darf erst nach einer kontrollierten Promotion gegen eine eingefrorene Produktionsbaseline gemessen werden.

Kosten sparen

Vermiedene Duplikate, frühere Falsifikation, weniger Fehlersuche und geringerer Provider-/Computeaufwand.

Risiko senken

Verhinderte Fehlfreigaben, kleinere Drawdowns, weniger Drift und schneller erkannte BT/Live-Abweichungen.

Ergebnis verbessern

Nur inkrementelle Forward-/Live-Wirkung nach Kosten gegen die vorab festgelegte Baseline.

Die Zielgröße ist risikoadjustierter, reproduzierbarer Netto-Nutzen. Anzahl Agenten, Dokumente, Trials oder gefundene „Edges“ sind keine primären Erfolgskennzahlen.