Ω-USIF-Bench · R0.4

Comparer avant de conclure.

USIF-Bench transforme des dossiers officiels en contrastes endpoint-locaux. Il sépare défaillance, near-miss et contrôle négatif, rend les dimensions non appariées visibles et bloque les claims prédictifs tant que le corpus est sous-puissant.

Fact

2 endpoints structurellement comparables

aircraft_collision · occupant_injury

Blocked

0 endpoint prêt pour tournoi

Chaque endpoint possède encore seulement 1 failure + 1 contrast dans R0.4.

Unknown

Supériorité prédictive

Aucune accuracy Tristan, aucun gain HGFM/CVCD, aucune causalité générale n'est revendiquée.

Contrastes R0.4

EndpointFailureContrastStatut
aircraft_collisionNorthwest 1482/299, Detroit 1990Southwest 708 / FedEx 1432, Austin 2023structural
occupant_injurySouthwest 1380, 2018United 328, 2021structural

Les liens pointent vers le NTSB. Un contrôle négatif est négatif uniquement pour l'endpoint déclaré et la fenêtre documentée; il ne signifie pas « organisation innocente ».

Readiness receipt

STRUCTURAL_CONTRAST = PASS BASELINE_TOURNAMENT_READY = FALSE PREDICTIVE_SUPERIORITY_CLAIMED = FALSE SCORES_PUBLISHED = FALSE PERSON_LEVEL_PREDICTION = FORBIDDEN Required next gate per endpoint: failures >= 2 contrasts >= 2 frozen splits >= 2
Fact

Ce que le benchmark sait

Les endpoints et résultats décrits dans les sources officielles citées; les rôles failure/near-miss/control; les dimensions explicitement appariées ou non.

Inference

Ce qu'il teste ensuite

Si des représentations simples ou Tristan discriminent les outcomes au-delà de baselines document/timeline et attribute-table.

Unknown

Ce qui reste inconnu

Généralisation hors échantillon, causalité des mécanismes, calibration de l'entropie institutionnelle et transfert inter-secteurs.

Ce qui falsifierait l'intérêt de la couche Tristan : si les features d'entropie, HGFM ou CVCD ne battent pas des baselines simples sur des holdouts gelés, elles doivent être réduites, redéfinies ou supprimées.

Sources & reproductibilité

Le code canonique du benchmark est public dans TTM-TFUGA-AI7-TRISTAN2. La page est une projection de ce corpus, pas une source primaire.

USIF ne classe pas les entreprises ou personnes par « culpabilité ». Le benchmark est centré sur des processus, endpoints, contrôles et mécanismes documentés.