Consensus d'experts sans entraînement contre MoE patch-wise appris
Trois experts BraTS, leurs vetos et leurs votes, face à un gate appris dans le réseau — jugés sur les métriques officielles BraTS-2023
BraTS 2023 GLI · nnU-Net v2 · MedNeXt-B · 3 experts × 5 folds (n = 1 196) · métriques officielles lesion-wise, régime clean
Guillaume Cassez (ORCID 0009-0007-0987-3931) · Stanislas Larnier (IdHAL stanislas-larnier) · Recherche indépendante 2026
Résumé
Trois experts complémentaires — Baseline (CE+Dice), DistMap (carte de distance signée en tâche auxiliaire) et Kervadec (loss boundary) — sont entraînés sur BraTS 2023 GLI en validation croisée 5 folds (1 196 patients, MedNeXt-B via nnU-Net v2, 300 epochs). Ce travail compare deux familles de combinaisons sous les métriques officielles du challenge (Dice et HD95 lesion-wise, nettoyage de composantes 1000/250/500, moyenne des trois régions par patient) : des opérateurs déterministes SANS entraînement — vetos de composantes connexes à deux et trois experts, votes majoritaires — et un mélange d'experts patch-wise (MoE V2) dont le gate est appris DANS le réseau pendant l'entraînement.
Le consensus K∩B (Kervadec filtré par le veto de Baseline) termine en tête du tableau des bras : Dice 0,8877 et HD95 18,86 mm au fold 0, avec deux intervalles de confiance excluant zéro. Le vote majoritaire à trois experts porte le seul gain qui survive à la correction de Holm sur la famille exploratoire : +0,0022 Dice, p_Holm = 9,0×10⁻⁸.
Le MoE patch-wise, lui, ne sort pas du bruit de graine : son gate tranche réellement (entropie 0,960, aucun expert mort sur 8), il bat son propre baseline au fold 1 (+0,0027 Dice, HD95 −1,51 mm, p = 0,034), mais pas le meilleur expert du même fold (+0,0008 Dice face à DistMap), et son étendue sur trois graines (0,0034 Dice) vaut 1,86× l'écart entre deux runs identiques du baseline. Un consensus sans entraînement livre le seul gain qui survive aux corrections de multiplicité ; un gate appris n'y parvient pas.
Contexte
Les papiers 1 et 2 ont établi que les deux losses auxiliaires — carte de distance et loss boundary — ne battent pas la baseline seules sur les métriques officielles, mais qu'elles se placent aux deux bouts de l'axe rappel/précision : DistMap rappelle plus, Kervadec précise plus. Cette complémentarité pose la question de la combinaison : comment assembler trois experts qui se trompent différemment ?
Deux réponses s'affrontent. La première, déterministe et sans entraînement : des vetos de composantes connexes (une composante d'un expert n'est conservée que si un autre expert la corrobore) et des votes voxel à voxel. La seconde, apprise : un mélange d'experts patch-wise dont le gate décide, région par région, quel expert écouter. Ce papier les mesure avec le même instrument — la capsule officielle des métriques BraTS-2023 — et la même correction de multiplicité.
Méthodes
Experts : Baseline (CE+Dice), DistMap (λ = 0,1), Kervadec (λ = 0,05) — socle commun MedNeXt-B via nnU-Net v2, 300 epochs, entraînés sur les 5 folds (n = 1 196 au total) et sur 3 graines du fold 0. MoE patch-wise V2 : gate dans le réseau, 300 epochs, 3 graines au fold 0 (42, 1337, 2024) et fold 1 complet (n = 239, population disjointe).
Opérateurs sans entraînement : vetos de composantes connexes à deux experts (K∩B, B∩K, D∩K, K∩D) et à trois experts, votes union/majorité/unanimité — appliqués sur les prédictions de validation, puis nettoyage de composantes du régime officiel « clean ». Métrique : Dice et HD95 lesion-wise officiels, moyenne des trois régions (WT, TC, ET) par patient, tests appariés avec correction de Holm.
Résultats
Au fold 0 (240 cas), le consensus K∩B domine le tableau : Dice 0,8877, HD95 18,86 mm, les deux intervalles de confiance excluant zéro. Le vote majoritaire porte le seul gain survivant à la correction de Holm sur toute la famille exploratoire (+0,0022 Dice, p_Holm = 9,0×10⁻⁸) — un opérateur qui n'a rien appris.
Le MoE V2 gagne 58 cas sur 240 (24,2 %) contre tous les bras déterministes au fold 0, mais en perd 63 (26,2 %) ; au fold 1 il bat son propre baseline (+0,0027 Dice, HD95 −1,51 mm, p = 0,034) sans battre l'expert DistMap du même fold (+0,0008 Dice, HD95 +0,68 mm). Sa dispersion sur trois graines (étendue 0,0034 Dice) vaut 1,86× l'écart entre deux runs du baseline à graine identique : le gain potentiel du gate est plus petit que la résolution de l'instrument.
Le verdict n'est pas que le MoE est mauvais — son gate tranche, les 8 experts vivent, l'entropie est à 0,960. Le verdict est que, sur ce dataset et cet instrument, l'entraînement du gate n'achète rien que le vote ou le veto ne livrent déjà, et que le seul résultat robuste est celui d'un opérateur sans paramètre.
Cas sélectionnés au viewer
Douze patients illustrent ces résultats dans le viewer 3D, choisis par classement automatique sur les métriques officielles (chaque lien ouvre le viewer sur le patient et le modèle du cas). Chaque cas porte le pourcentage de la population qu'il représente.
Le gate assemble mieux que tous les opérateurs sans entraînement — 58/240 cas (24,2 %) au fold 0.
Le gate s'effondre à 0,80 quand chaque expert seul tient ≈ 0,96 — 63/240 cas (26,2 %).
Le vote à 3 experts bat tout le monde, MoE compris — l'opérateur du gain robuste (+0,0022, Holm).
Le veto de composantes passe devant ses deux experts — 3/1196 cas, l'exception qui survit.
Le veto retire à DistMap (0,98) une composante légitime : chute à 0,82.
Kervadec à 0,96 contre MoE à 0,80 — 178/239 cas (74,5 %) du fold 1.
Travaux associés
L'expert DistMap : loss auxiliaire par carte de distance signée et filtre CC-consensus.
L'expert Kervadec : la loss boundary transposée en 3D, miroir précision de DistMap.
Explorer les segmentations, les consensus et les cartes d'interprétation (Grad-CAM, certitude, accord).