Prépublication v1.1.1 · Zenodo · 05/10/2026
Cityscapes · 19 classes

La porte ne choisit toujours pas : un mélange d'experts initialisé depuis les spécialistes de loss

Réplication sur Cityscapes du résultat BraTS — le mélange bat son contrôle apparié (+0,45 pt de mIoU, p = 0,0066), mais il aide comme moyenne d'experts, pas comme sélection ; et c'est le seul bras polyvalent du plateau

Cityscapes 1024×2048 · ConvNeXt-V2-B + UPerNet · 19 classes · BF16 · gate top-2 sur patchs 3×3 · 80 epochs · 3 seeds

Guillaume Cassez · Stanislas Larnier · Recherche indépendante 2026

Résumé

Nous rapportons une évaluation contrôlée pré-enregistrée de MoE-V3-CS, un mélange d'experts par patch inséré dans un segmenteur Cityscapes pleine résolution. Ses quatre experts sont initialisés bit-à-bit depuis le bloc head.fpn_convs.0 de quatre spécialistes de loss entraînés indépendamment du même seed — B (CE+Dice), D (CE+Kervadec EDT), Dp (CE+carte de distance SDT), G (CE+Dice+0,5·blob) — puis un gate top-2 sur patchs 3×3 est entraîné 80 epochs depuis une échelle résiduelle γ initialisée à zéro : l'epoch 0 est bit-exact identique au contrôle.

Le critère primaire pré-enregistré — mIoU officiel au niveau du jeu (cityscapesScripts, 19 classes) sur le holdout partagé de 500 images, contre un contrôle apparié en recette (même initialisation B, même recette, 80 epochs, sans couche MoE), bootstrap d'images apparié B = 10 000, trois seeds moyennés dans chaque réplicat — est positif au seuil brut et dans la famille pré-enregistrée à une paire : Δ = +0,449 pt (MoE 81,618 contre contrôle 81,168), IC 95 % [+0,109 ; +0,820], p bilatéral = 0,0066, Holm = 0,0066.

Il ne survit pas aux familles exploratoires de multiplicité : Holm = 0,0726 sur 12 paires et 0,0924 sur 15 paires — et aucun bras du plateau n'y survit non plus (meilleur : 0,0750). Les trois familles sont rapportées ensemble ; aucune n'est choisie parce qu'elle flatte. Le résultat central est un diagnostic de routage : à l'epoch final la distribution du gate est plate (entropie normalisée minimale 0,99771 sur les trois seeds, part_max 0,5030 / 0,5019 / 0,5019 contre 0,5000 pour l'équidistribution exacte, chaque expert entre 49,79 % et 50,30 % des patchs, zéro expert mort), alors que γ croît de 0,00024 à ≈ 0,020 (×77 à ×84) : le mélange aide, mais comme MOYENNE d'experts, pas comme sélection. Le gain ne vient pas du routage ; il vient de l'initialisation par les experts.

Contexte

Ce papier est une réplication — pas une republication — du résultat BraTS « The Gate Does Not Choose » (DOI 10.5281/zenodo.22903668), sur un second jeu de données, une seconde architecture et un second point d'accroche : aucun chiffre BraTS n'est réutilisé. Cityscapes (conduite 2D, ConvNeXt-V2-B + UPerNet, métriques mIoU/boundary/instances, 500 images val) diffère de BraTS (gliome 3D, MedNeXt, capsule officielle lesion-wise, 1 196 cas) sur tous ces plans — sauf sur la question posée.

Le diagnostic de routage sépare une tautologie d'une preuve : à l'epoch final, l'égalité entropy_token == entropy_token_clean tient PAR CONSTRUCTION (le bruit de Shazeer est recuit à zéro) et ne prouve rien. La comparaison probante porte sur les 40 epochs à bruit actif : la distribution propre y est déjà plate (≥ 0,99821) et part_max reste dans [0,50011 ; 0,50217] de l'équidistribution 0,5000.

Méthodes

Les quatre experts sont initialisés depuis leur seul bloc head.fpn_convs.0 ; le gate (top-2 sur patchs 3×3) et l'échelle résiduelle γ sont les seuls composants ajoutés, entraînés 80 epochs depuis γ = 0 pour que l'epoch 0 soit bit-exact identique au contrôle. Les invariants de routage sont lus dans le code puis vérifiés : sum(frac) == top_k (2, et non 1), et top_expert_share (moyenne des maxima par batch, 0,667) ≥ part_max (maximum des moyennes), par l'inégalité de Jensen.

Le contrôle est apparié en recette : même initialisation B, même recette, 80 epochs, sans couche MoE. Trois seeds, moyennés dans chaque réplicat du bootstrap d'images (B = 10 000). Critère primaire : mIoU officiel au niveau du jeu (cityscapesScripts, 19 classes) sur le holdout partagé de 500 images.

Résultats

Sur le critère de polyvalence pré-enregistré du programme (36 endpoints × 13 bras), MoE-V3-CS est le seul polyvalent : dommage maximal −0,53 pt (instances de groupes de foule, det@0.5), contre −1,90 (consensus C⊘B) et −22,20 (D, précision pixel piéton 70.0 → 47.8) — une marge de 1,37 pt sur le bras suivant, et le plateau le moins cher du champ à −1,2 pt de dommage par point de mIoU (contre −43,1 pour D).

Il n'est pourtant premier sur AUCUN des 36 endpoints (D en gagne 16) et son percentile moyen est 60.4 (5e sur 11) : bon partout n'est pas meilleur partout. Deux métriques métier survivent au Holm 15 paires — les fragments (−31,2 composantes connexes par image) et le rappel des plus grandes instances (+0,26 pt) — tandis qu'aucune hausse d'IoU par classe ne survit au Holm 19 classes (la seule survivante est une baisse : bicycle, 0,0038).

Discussion

Un primaire pré-enregistré positif, rapporté avec ses TROIS familles de multiplicité ensemble et la mention explicite qu'il ne survit pas à la famille exploratoire : c'est le prix d'intégrité d'un plateau à 13 bras comparé sous Holm. Le diagnostic de routage en donne le mécanisme — un mélange initialisé par les experts dont la porte ne choisit pas.

Auteurs : depuis la v1.1.0 (2026-10-04), Stanislas Larnier est second auteur (questions de recherche, conseil méthodologique, relectures), aligné sur les quatre papiers BraTS dont celui-ci est la réplication déclarée. Les dépôts Zenodo antérieurs à cette date portent Guillaume Cassez seul — un record publié est immuable, et le manuscrit comme le CHANGELOG le disent explicitement.