Prépublication v1.2.1 · Zenodo · 05/10/2026
Cityscapes · 19 classes

Le poids égal par instance ne paie pas seul : la blob loss sur Cityscapes pleine résolution

Primaire pré-enregistré nul — ce que le terme achète est un compromis mesuré : couverture des objets fins contre intégrité des piétons, et une fragmentation des masques ×1,52

Cityscapes 1024×2048 · ConvNeXt-V2-B + UPerNet · 19 classes · softmax exclusif · bras G (CE+Dice+0,5·blob) vs B apparié · 160 epochs · 3 seeds partagés

Guillaume Cassez · Stanislas Larnier · Recherche indépendante 2026

Résumé

Nous rapportons une évaluation contrôlée pré-enregistrée de la blob loss de Kofler et al. (IPMI 2023) — un terme auxiliaire qui donne à chaque instance vraie le même poids quel que soit son nombre de pixels — portée à la segmentation sémantique multi-classes exclusive à la résolution native Cityscapes (1024×2048, 19 classes, régime softmax). Le bras G (CE + Dice + 0,5·blob) est comparé à sa référence appariée exacte B (CE + Dice) : même architecture ConvNeXt-V2-Base + UPerNet, même recette de 160 epochs, même distribution d'augmentation, trois seeds partagés (42, 123, 456) — seule la loss change.

Le critère primaire pré-enregistré est NUL : mIoU officiel au niveau du jeu sur le holdout partagé de 500 images, Δ(G−B) = +0,170 pt, IC 95 % [−0,233 ; +0,551], p bilatéral = 0,4032 (bootstrap d'images apparié, B = 10 000). Le poids égal par instance n'améliore pas le mIoU global dans ce régime.

Ce que le terme fait réellement est un compromis mesuré. Il achète la couverture pixel des objets fins — traffic light +0,98, pole +0,58, bicycle +0,57 IoU contre B (Holm-significatifs dans la famille 19 classes), truck +3,78 (IC excluant zéro), Boundary F1 (3 px) +0,63 — et il paie en intégrité des instances piétonnes : rappel piéton strict −4,34, strate petites instances (T1) −5,65, instances de groupes de foule −5,74, précision pixel piéton −2,70 (tous contre B apparié, Holm = 0), et une fragmentation générale des masques : les composantes connexes passent de 615,1 à 933,9 par image (×1,52), en hausse dans 16 classes sur 19 contre le bras apparié B.

Contexte

Les pertes par instance donnent le même poids à une instance de 50 pixels et à une de 50 000 : elles sont conçues pour que les petits objets ne soient pas noyés dans la moyenne pixel. Leur promesse en segmentation urbaine pleine résolution n'avait jamais été testée sous pré-enregistrement. C'est le quatrième papier du programme Cityscapes — après la carte de distance (papier 1), la loss boundary (papier 2) et le mélange d'experts MoE-V3-CS (papier 3), dont le bras G est l'un des quatre experts initialisateurs.

La nouvelle décomposition par classe des composantes connexes révise l'hypothèse mécaniste de travail du programme : le terme n'élague pas les petites composantes — il crée des trous (composantes en hausse dans 16/19 classes contre B apparié, et masques de personnes multipliés par 2,2 contre le bras contrôle). Le papier rapporte ce que montrent les tables, y compris quand cela contredit l'hypothèse de départ.

Méthodes

Portage exact de l'algèbre de Kofler (eq. 1) au régime softmax exclusif, avec des paquetages d'instances précalculés : +1–2 % de temps par epoch, contre +870 s/epoch pour le chemin naïf. La parité naïf ↔ précalculé est verrouillée par des tests unitaires, et le piège d'alignement du retournement horizontal est documenté.

Critère primaire pré-enregistré : mIoU officiel au niveau du jeu (cityscapesScripts) sur le holdout partagé de 500 images, bootstrap d'images apparié B = 10 000, trois seeds partagés. Critère de polyvalence pré-enregistré du programme : 36 endpoints × 13 bras, dommage maximal et percentile moyen.

Résultats

Sur le critère de polyvalence, G est un spécialiste dominé : percentile moyen 41,9, pire rang 13/13, dommage maximal −6,76 pt, 13 pertes significatives pour 4 gains significatifs. Le même verdict tient sur un second jeu de données et un second régime de probabilité : sur BraTS 2023 (sigmoid par région, MedNeXt, recette nnU-Net, CV 5 folds, n = 1 196), le bras blob seul score −0,00376 Dice contre la baseline (DOI 10.5281/zenodo.23091253).

Mais le même terme, comme troisième expert du mélange MoE-V3 gagnant, y contribue +0,00566 Dice — premier de 29 bras (DOI 10.5281/zenodo.22903668). Sur le plateau Cityscapes, MoE-V3-CS pointe dans le même sens : ΔmIoU +0,45 pt [+0,11 ; +0,82], p = 0,0066 contre son contrôle apparié en recette, dommage maximal −0,53 pt, rappel des petites instances T1 +0,80, feux de circulation non dégradés — le profil d'un bras qui met à profit la spécialité objets fins de G sans porter son dommage.

Discussion

La leçon tient sur deux jeux de données et deux régimes de probabilité : le terme à poids égal par instance paie comme expert initialisé d'un mélange, alors que seul il est nul ou nuisible. Le compromis complet — IoU par classe, sept familles de métriques métier sur les instances piétonnes, décomposition par classe des composantes connexes — est rapporté tel que mesuré.

Auteurs : depuis la v1.2.0 (2026-10-04), Stanislas Larnier est second auteur (questions de recherche, conseil méthodologique, relectures), aligné sur les quatre papiers BraTS du programme. Les dépôts Zenodo antérieurs à cette date portent Guillaume Cassez seul — un record publié est immuable, et le manuscrit comme le CHANGELOG le disent explicitement.