Prépublication v1.1 · Zenodo · 04/10/2026
MICCAI · BraTS 2023 GLI

Blob loss pré-enregistrée sur BraTS 2023 : elle détecte plus, elle score moins

Test en aveugle d'une perte par instance (Kofler, IPMI 2023) entraînée seule — sa propre prédiction de précision est réfutée dans ses deux clauses, et elle ne paie que comme veto de consensus

BraTS 2023 GLI · nnU-Net v2 · MedNeXt-B · 7 runs × 300 epochs · 5 folds · capsule officielle lesion-wise

Guillaume Cassez · Stanislas Larnier · Recherche indépendante 2026

Résumé

Les pertes par instance sont annoncées comme le remède à la sous-segmentation des petites lésions : elles scorent chaque lésion séparément, si bien qu'une petite instance manquée coûte aussi cher qu'une grande. Nous avons pré-enregistré un test de l'une d'elles — la blob loss (Kofler et al., IPMI 2023) — sur les gliomes adultes BraTS-2023, AVANT de lire le moindre chiffre lesion-wise, en prédisant d'après la cohorte sclérose en plaques du papier source qu'elle déplacerait une baseline MedNeXt-B / nnU-Net vers la PRÉCISION : aucune lésion vraie manquée en plus (Dice = 0), et moins de faux positifs lesion-wise.

Les deux clauses sont réfutées, en sens opposés. Sur 1 195 cas tenus de côté, poolés sur cinq folds disjoints et scorés par la capsule officielle BraTS-2023, le bras blob manque 129 lésions vraies contre 190 pour la baseline (significatif dans 3/3 régions après Holm) et produit 2 029 faux positifs lesion-wise contre 1 418 (3/3 régions) : il achète du rappel et paie en précision — l'exact inverse de la prédiction.

Le post-traitement officiel absorbe ensuite 93,2 % de l'écart Dice brut et 96,2 % de l'écart HD95 brut, laissant un Dice lesion-wise de −0,00376 (IC 95 % [−0,00648 ; −0,00103], Holm p = 8.0e-14) — 1,25 fois le plus petit effet d'intérêt pré-spécifié (0,003), négatif sur 5 folds sur 5. Des trois termes auxiliaires mesurés sur ce backbone, blob est le seul dont l'intervalle exclut zéro, et il l'exclut derrière : la régression de distance signée donne −0,00060 (Holm p = 1) et la loss boundary −0,00116 (p = 0,9547), toutes deux indiscernables de la baseline.

Contexte

Cinquième papier du programme BraTS — après la carte de distance (papier 1), la loss boundary de Kervadec (papier 2) et le mélange d'experts contre consensus (papier 3) — et le seul dont la prédiction directionnelle a été écrite en aveugle, le 2026-08-06, avant toute lecture de chiffre. Le document de pré-enregistrement est embarqué dans l'archive (docs/blob_loss_preregistrement.md) : le lecteur peut comparer la prédiction au résultat, pas à son récit a posteriori.

La leçon est structurelle plutôt qu'anecdotique : le signe d'une perte par instance est une propriété de la distribution de tailles d'instances du jeu de données, pas une propriété de la perte. Ce qui aide sur une cohorte de petites lésions peut coûter sur une autre où les lésions sont grandes — et seule la mesure pré-enregistrée le dit avant que le résultat ne soit connu.

Méthodes

La blob loss est entraînée SEULE, à son poids publié (β = 0,5, poids de distance signée = 0,0), sur MedNeXt-B via nnU-Net v2, 300 epochs — le même protocole que les autres papiers du programme. Sept runs : les cinq folds au seed 42, plus deux seeds supplémentaires sur le fold 0. Chaque valeur citée est relue du debug.json propre au run, jamais recopiée.

Le scoring utilise la capsule officielle BraTS-2023 lesion-wise sur 1 195 cas tenus de côté, poolés sur cinq folds disjoints. Le critère primaire est le Dice lesion-wise après post-traitement officiel, avec un plus petit effet d'intérêt pré-spécifié (0,003) et correction de Holm sur les trois régions.

Résultats

Le bras blob manque 129 lésions vraies contre 190 pour la baseline (significatif dans 3/3 régions après Holm) — mais produit 2 029 faux positifs lesion-wise contre 1 418 (3/3 régions). Il achète du rappel et paie en précision : l'exact inverse de la prédiction pré-enregistrée.

Après post-traitement officiel, il reste −0,00376 de Dice lesion-wise (IC 95 % [−0,00648 ; −0,00103], Holm p = 8.0e-14), soit 1,25 fois l'effet d'intérêt, négatif sur 5 folds sur 5. Comparé aux deux autres auxiliaires du programme — régression SDT −0,00060 (Holm p = 1), boundary −0,00116 (p = 0,9547) — blob est le seul dont l'intervalle de confiance exclut zéro, et il l'exclut du mauvais côté.

Son seul delta positif est comme corroborateur : le veto ordonné cc_B_G se classe 1er sur 12 à +0,001137 — sous l'effet d'intérêt, non significatif après Holm (p = 0,156) — et l'inversion de l'ordre (cc_G_B) le fait chuter au rang 11 (−0,002306). Un veto n'est pas symétrique : qui corrobore doit être le plus fiable des deux.

Discussion

Le résultat n'est pas « la loss échoue » : c'est qu'une prédiction directionnelle écrite en aveugle a été contredite par la mesure, dans ses deux clauses et en sens opposés. Un primaire négatif rapporté comme tel, avec son pré-enregistrement embarqué, vaut mieux qu'un choix a posteriori de la métrique qui arrange.

La lecture cross-dataset complète le tableau : sur Cityscapes (papier sœur, softmax exclusif), le même terme est un spécialiste dominé seul — percentile moyen 41,9, pire rang 13/13 — mais il sert de troisième expert au mélange MoE-V3 gagnant sur BraTS, où il contribue +0,00566 Dice, premier de 29 bras (DOI 10.5281/zenodo.22903668). Deux jeux de données, deux régimes de probabilité : le terme paie comme expert initialisé d'un mélange, pas seul.