Manuscrit v0.6 — relecture en cours
MICCAI · BraTS 2023 GLI

Consensus d'experts sans entraînement contre MoE patch-wise appris

Trois experts BraTS, leurs vetos et leurs votes, face à un gate appris dans le réseau — jugés sur les métriques officielles BraTS-2023

BraTS 2023 GLI · nnU-Net v2 · MedNeXt-B · 3 experts × 5 folds (n = 1 196) · métriques officielles lesion-wise, régime clean

Guillaume Cassez (ORCID 0009-0007-0987-3931) · Stanislas Larnier (IdHAL stanislas-larnier) · Recherche indépendante 2026

Résumé

Trois experts complémentaires — Baseline (CE+Dice), DistMap (carte de distance signée en tâche auxiliaire) et Kervadec (loss boundary) — sont entraînés sur BraTS 2023 GLI en validation croisée 5 folds (1 196 patients, MedNeXt-B via nnU-Net v2, 300 epochs). Ce travail compare deux familles de combinaisons sous les métriques officielles du challenge (Dice et HD95 lesion-wise, nettoyage de composantes 1000/250/500, moyenne des trois régions par patient) : des opérateurs déterministes SANS entraînement — vetos de composantes connexes à deux et trois experts, votes majoritaires — et un mélange d'experts patch-wise (MoE V2) dont le gate est appris DANS le réseau pendant l'entraînement.

Le consensus K∩B (Kervadec filtré par le veto de Baseline) termine en tête du tableau des bras : Dice 0,8877 et HD95 18,86 mm au fold 0, avec deux intervalles de confiance excluant zéro. Le vote majoritaire à trois experts porte le seul gain qui survive à la correction de Holm sur la famille exploratoire : +0,0022 Dice, p_Holm = 9,0×10⁻⁸.

Le MoE patch-wise, lui, ne sort pas du bruit de graine : son gate tranche réellement (entropie 0,960, aucun expert mort sur 8), il bat son propre baseline au fold 1 (+0,0027 Dice, HD95 −1,51 mm, p = 0,034), mais pas le meilleur expert du même fold (+0,0008 Dice face à DistMap), et son étendue sur trois graines (0,0034 Dice) vaut 1,86× l'écart entre deux runs identiques du baseline. Un consensus sans entraînement livre le seul gain qui survive aux corrections de multiplicité ; un gate appris n'y parvient pas.

Contexte

Les papiers 1 et 2 ont établi que les deux losses auxiliaires — carte de distance et loss boundary — ne battent pas la baseline seules sur les métriques officielles, mais qu'elles se placent aux deux bouts de l'axe rappel/précision : DistMap rappelle plus, Kervadec précise plus. Cette complémentarité pose la question de la combinaison : comment assembler trois experts qui se trompent différemment ?

Deux réponses s'affrontent. La première, déterministe et sans entraînement : des vetos de composantes connexes (une composante d'un expert n'est conservée que si un autre expert la corrobore) et des votes voxel à voxel. La seconde, apprise : un mélange d'experts patch-wise dont le gate décide, région par région, quel expert écouter. Ce papier les mesure avec le même instrument — la capsule officielle des métriques BraTS-2023 — et la même correction de multiplicité.

Méthodes

Experts : Baseline (CE+Dice), DistMap (λ = 0,1), Kervadec (λ = 0,05) — socle commun MedNeXt-B via nnU-Net v2, 300 epochs, entraînés sur les 5 folds (n = 1 196 au total) et sur 3 graines du fold 0. MoE patch-wise V2 : gate dans le réseau, 300 epochs, 3 graines au fold 0 (42, 1337, 2024) et fold 1 complet (n = 239, population disjointe).

Opérateurs sans entraînement : vetos de composantes connexes à deux experts (K∩B, B∩K, D∩K, K∩D) et à trois experts, votes union/majorité/unanimité — appliqués sur les prédictions de validation, puis nettoyage de composantes du régime officiel « clean ». Métrique : Dice et HD95 lesion-wise officiels, moyenne des trois régions (WT, TC, ET) par patient, tests appariés avec correction de Holm.

Résultats

Au fold 0 (240 cas), le consensus K∩B domine le tableau : Dice 0,8877, HD95 18,86 mm, les deux intervalles de confiance excluant zéro. Le vote majoritaire porte le seul gain survivant à la correction de Holm sur toute la famille exploratoire (+0,0022 Dice, p_Holm = 9,0×10⁻⁸) — un opérateur qui n'a rien appris.

Le MoE V2 gagne 58 cas sur 240 (24,2 %) contre tous les bras déterministes au fold 0, mais en perd 63 (26,2 %) ; au fold 1 il bat son propre baseline (+0,0027 Dice, HD95 −1,51 mm, p = 0,034) sans battre l'expert DistMap du même fold (+0,0008 Dice, HD95 +0,68 mm). Sa dispersion sur trois graines (étendue 0,0034 Dice) vaut 1,86× l'écart entre deux runs du baseline à graine identique : le gain potentiel du gate est plus petit que la résolution de l'instrument.

Le verdict n'est pas que le MoE est mauvais — son gate tranche, les 8 experts vivent, l'entropie est à 0,960. Le verdict est que, sur ce dataset et cet instrument, l'entraînement du gate n'achète rien que le vote ou le veto ne livrent déjà, et que le seul résultat robuste est celui d'un opérateur sans paramètre.

Cas sélectionnés au viewer

Douze patients illustrent ces résultats dans le viewer 3D, choisis par classement automatique sur les métriques officielles (chaque lien ouvre le viewer sur le patient et le modèle du cas). Chaque cas porte le pourcentage de la population qu'il représente.

MoE V2 sauve
00621-000

Le gate assemble mieux que tous les opérateurs sans entraînement — 58/240 cas (24,2 %) au fold 0.

Ouvrir dans le viewer →
MoE V2 casse
01004-000

Le gate s'effondre à 0,80 quand chaque expert seul tient ≈ 0,96 — 63/240 cas (26,2 %).

Ouvrir dans le viewer →
Vote majoritaire sauve
00442-000

Le vote à 3 experts bat tout le monde, MoE compris — l'opérateur du gain robuste (+0,0022, Holm).

Ouvrir dans le viewer →
Consensus K∩B sauve (papier 2)
01182-000

Le veto de composantes passe devant ses deux experts — 3/1196 cas, l'exception qui survit.

Ouvrir dans le viewer →
Consensus K∩D casse (papier 2)
01377-000

Le veto retire à DistMap (0,98) une composante légitime : chute à 0,82.

Ouvrir dans le viewer →
Experts battent le MoE, fold 1
01309-000

Kervadec à 0,96 contre MoE à 0,80 — 178/239 cas (74,5 %) du fold 1.

Ouvrir dans le viewer →