Blob loss pré-enregistrée sur BraTS 2023 : elle détecte plus, elle score moins
Test en aveugle d'une perte par instance (Kofler, IPMI 2023) entraînée seule — sa propre prédiction de précision est réfutée dans ses deux clauses, et elle ne paie que comme veto de consensus
BraTS 2023 GLI · nnU-Net v2 · MedNeXt-B · 7 runs × 300 epochs · 5 folds · capsule officielle lesion-wise
Guillaume Cassez · Stanislas Larnier · Recherche indépendante 2026
Résumé
Les pertes par instance sont annoncées comme le remède à la sous-segmentation des petites lésions : elles scorent chaque lésion séparément, si bien qu'une petite instance manquée coûte aussi cher qu'une grande. Nous avons pré-enregistré un test de l'une d'elles — la blob loss (Kofler et al., IPMI 2023) — sur les gliomes adultes BraTS-2023, AVANT de lire le moindre chiffre lesion-wise, en prédisant d'après la cohorte sclérose en plaques du papier source qu'elle déplacerait une baseline MedNeXt-B / nnU-Net vers la PRÉCISION : aucune lésion vraie manquée en plus (Dice = 0), et moins de faux positifs lesion-wise.
Les deux clauses sont réfutées, en sens opposés. Sur 1 195 cas tenus de côté, poolés sur cinq folds disjoints et scorés par la capsule officielle BraTS-2023, le bras blob manque 129 lésions vraies contre 190 pour la baseline (significatif dans 3/3 régions après Holm) et produit 2 029 faux positifs lesion-wise contre 1 418 (3/3 régions) : il achète du rappel et paie en précision — l'exact inverse de la prédiction.
Le post-traitement officiel absorbe ensuite 93,2 % de l'écart Dice brut et 96,2 % de l'écart HD95 brut, laissant un Dice lesion-wise de −0,00376 (IC 95 % [−0,00648 ; −0,00103], Holm p = 8.0e-14) — 1,25 fois le plus petit effet d'intérêt pré-spécifié (0,003), négatif sur 5 folds sur 5. Des trois termes auxiliaires mesurés sur ce backbone, blob est le seul dont l'intervalle exclut zéro, et il l'exclut derrière : la régression de distance signée donne −0,00060 (Holm p = 1) et la loss boundary −0,00116 (p = 0,9547), toutes deux indiscernables de la baseline.
Contexte
Cinquième papier du programme BraTS — après la carte de distance (papier 1), la loss boundary de Kervadec (papier 2) et le mélange d'experts contre consensus (papier 3) — et le seul dont la prédiction directionnelle a été écrite en aveugle, le 2026-08-06, avant toute lecture de chiffre. Le document de pré-enregistrement est embarqué dans l'archive (docs/blob_loss_preregistrement.md) : le lecteur peut comparer la prédiction au résultat, pas à son récit a posteriori.
La leçon est structurelle plutôt qu'anecdotique : le signe d'une perte par instance est une propriété de la distribution de tailles d'instances du jeu de données, pas une propriété de la perte. Ce qui aide sur une cohorte de petites lésions peut coûter sur une autre où les lésions sont grandes — et seule la mesure pré-enregistrée le dit avant que le résultat ne soit connu.
Méthodes
La blob loss est entraînée SEULE, à son poids publié (β = 0,5, poids de distance signée = 0,0), sur MedNeXt-B via nnU-Net v2, 300 epochs — le même protocole que les autres papiers du programme. Sept runs : les cinq folds au seed 42, plus deux seeds supplémentaires sur le fold 0. Chaque valeur citée est relue du debug.json propre au run, jamais recopiée.
Le scoring utilise la capsule officielle BraTS-2023 lesion-wise sur 1 195 cas tenus de côté, poolés sur cinq folds disjoints. Le critère primaire est le Dice lesion-wise après post-traitement officiel, avec un plus petit effet d'intérêt pré-spécifié (0,003) et correction de Holm sur les trois régions.
Résultats
Le bras blob manque 129 lésions vraies contre 190 pour la baseline (significatif dans 3/3 régions après Holm) — mais produit 2 029 faux positifs lesion-wise contre 1 418 (3/3 régions). Il achète du rappel et paie en précision : l'exact inverse de la prédiction pré-enregistrée.
Après post-traitement officiel, il reste −0,00376 de Dice lesion-wise (IC 95 % [−0,00648 ; −0,00103], Holm p = 8.0e-14), soit 1,25 fois l'effet d'intérêt, négatif sur 5 folds sur 5. Comparé aux deux autres auxiliaires du programme — régression SDT −0,00060 (Holm p = 1), boundary −0,00116 (p = 0,9547) — blob est le seul dont l'intervalle de confiance exclut zéro, et il l'exclut du mauvais côté.
Son seul delta positif est comme corroborateur : le veto ordonné cc_B_G se classe 1er sur 12 à +0,001137 — sous l'effet d'intérêt, non significatif après Holm (p = 0,156) — et l'inversion de l'ordre (cc_G_B) le fait chuter au rang 11 (−0,002306). Un veto n'est pas symétrique : qui corrobore doit être le plus fiable des deux.
Discussion
Le résultat n'est pas « la loss échoue » : c'est qu'une prédiction directionnelle écrite en aveugle a été contredite par la mesure, dans ses deux clauses et en sens opposés. Un primaire négatif rapporté comme tel, avec son pré-enregistrement embarqué, vaut mieux qu'un choix a posteriori de la métrique qui arrange.
La lecture cross-dataset complète le tableau : sur Cityscapes (papier sœur, softmax exclusif), le même terme est un spécialiste dominé seul — percentile moyen 41,9, pire rang 13/13 — mais il sert de troisième expert au mélange MoE-V3 gagnant sur BraTS, où il contribue +0,00566 Dice, premier de 29 bras (DOI 10.5281/zenodo.22903668). Deux jeux de données, deux régimes de probabilité : le terme paie comme expert initialisé d'un mélange, pas seul.
Travaux associés
Le premier papier de la série : artefact topologique de la loss SDT et filtre CC-consensus.
La loss boundary à poids fixe : l'ancre de précision de l'axe rappel–précision.
Le mélange d'experts initialisé depuis les spécialistes — le bras où la blob loss sert d'expert 3.
L'étude sœur : le même terme porté en segmentation urbaine pleine résolution — primaire nul, objets fins contre intégrité piétonne.
Explorer les segmentations en volume interactif.
Manuscrit v1.1 publié le 04/10/2026, accès ouvert · DOI 10.5281/zenodo.23091253 (résout vers la dernière version) · PDF EN et FR, code, tables, figures et pré-enregistrement.
Bundle de reproductibilité : manuscrits EN+FR, code, JSON de résultats exacts, figures, tables et provenance — miroir vivant de l'archive Zenodo.