Partir de la demande
La demande initiale parlait de «scorer des polygones». Notre note de cadrage listait donc des descripteurs classiques de forme : surface, périmètre, compacité de Polsby-Popper, nombre de sommets, nombre de trous. Lors de la réunion de lancement, le client a montré un exemple d’anomalie repérée par ses équipes et a insisté sur un point : il n’existe pas de liste d’anomalies validées. Tout devait donc reposer sur l’idée qu’une anomalie est ce qui sort de l’ordinaire, et le travail le plus important était de définir ce qu’est l’ordinaire pour une carte de couverture.
On a commencé par une recherche bibliographique sur la détection d’anomalies en général et sur les données géographiques en particulier. Elle a fait ressortir quatre familles d’anomalies : géométriques (formes impossibles), topologiques (trous et raccords incohérents), statistiques (valeurs qui tranchent avec leur voisinage) et physiques (propagation radio invraisemblable). Ces quatre familles recoupent les éléments de qualité de la norme ISO 19157 sur les données géographiques, en particulier la cohérence logique et topologique (ISO 2013).
Changer d’unité : du polygone à la maille
L’examen des fichiers (section précédente) a remis en cause l’idée de scorer des polygones. Avec 39 367 polygones d’un seul pixel, la distribution des formes est écrasée par le bruit de vectorisation, et un même polygone peut couvrir une vallée entière. On s’est posé la question autrement : à quel endroit de la carte la couverture déclarée est-elle étrange ? Il fallait une unité spatiale fixe, de taille contrôlée, sur laquelle comparer des choses comparables. C’est le rôle du maillage, décrit en la page le maillage.
Ce choix a une conséquence pratique. Plutôt que d’intersecter des centaines de milliers de polygones avec des mailles, on reconstitue le raster d’origine : pour chaque pixel de 10 m, on cherche le niveau dont le polygone contient son centre. On a écrit pour cela un rastériseur qui applique la règle pair-impair, ce qui gère correctement les trous et les îlots dans les trous. Les surfaces retrouvées coïncident avec celles des polygones à moins de 0,001 % près, et l’opération prend environ une seconde pour toute l’île.
Définir ce qu’est une anomalie
On a ensuite cherché, pour chaque famille, une signature mesurable dans le raster et une justification extérieure, souvent empruntée à un autre domaine. Le principe est toujours le même : un défaut de calcul ou de traitement laisse des traces géométriques que la physique de la propagation ne produit pas. Par exemple, les longues frontières parfaitement droites rappellent les bandes manquantes des images Landsat 7 ou les limites de tuiles en mosaïquage ; les bandes d’un pixel de large rappellent les «sliver polygons» qui apparaissent quand on superpose deux couches en SIG (Goodchild 1978) ; les petits trous isolés rappellent les cuvettes artificielles qu’on supprime des modèles numériques de terrain avant tout calcul hydrologique (Jenson et Domingue 1988). La la page les anomalies détaille les six types retenus.
Mesurer, puis scorer
Chaque type est traduit en un critère calculé sur chaque maille, toujours orienté de la même façon : plus la valeur est grande, plus la maille est suspecte. Trois détecteurs non supervisés combinent ensuite ces critères. On en utilise trois parce qu’aucun détecteur ne domine les autres sur l’ensemble des jeux de données publiés (Han et al. 2022), et parce qu’un accord entre méthodes différentes est un argument quand on ne peut pas mesurer la précision (Zimek, Campello, et Sander 2014). Le détail est en la page les détecteurs.
Le score seul ne suffisait pas : dire «la maille 5654 est suspecte» n’aide pas une équipe métier à décider. On extrait donc aussi des objets d’anomalie, chacun mesuré et localisé : tel segment droit de 630 m, tel trou de 1,3 ha. Leur rareté est calculée sur l’ensemble de la zone, ce qui permet d’écrire des phrases du type «3 frontières sur près d’un million sont aussi longues».
Se tromper, puis corriger
Les premières versions donnaient des résultats visiblement faux, et c’est en les regardant sur la carte qu’on a progressé.
Toute la côte ressortait. La très bonne couverture s’arrête net sur le trait de côte, ce qui ressemblait à une transition brutale. En réalité c’est le découpage à la mer fait avant publication. On traite désormais l’absence de couverture reliée au bord de la zone comme de l’extérieur, et non comme un trou.
Les cirques ressortaient tous. Mafate, Salazie et Cilaos ont une couverture très morcelée à cause du relief, ce qui est légitime. La densité de frontières est devenue un critère de contexte : elle sert à comparer une maille de montagne à d’autres mailles de montagne, mais elle n’entre plus dans le type d’anomalie.
Un même défaut était compté plusieurs fois. Un pixel isolé était à la fois une micro-zone, une bande fine et une transition brutale ; une bande d’un pixel comptait aussi comme zone isolée et comme rupture. On a imposé qu’un pixel soit attribué à un seul type, dans l’ordre micro-zone, zone isolée, bande fine, puis transition. Avant cette règle, les bandes et les trous injectés n’étaient reconnus sous leur vrai type que 0 à 2 fois sur 10 ; après, 112 défauts sur 120 sont correctement typés.
Deux hypothèses rejetées. On a cru un moment que les frontières droites suivaient une grille de tuiles régulière (par exemple tous les kilomètres) : aucune ne tombe sur une coordonnée ronde. On a aussi cherché des décalages de grille différents d’une zone à l’autre, qui auraient trahi des tuiles de calcul : 99,3 % des sommets sont sur la même grille. Les coupures droites sont donc locales. Notre hypothèse actuelle est qu’elles correspondent aux bords de la fenêtre de calcul de certaines antennes, ce qu’on pourrait vérifier avec la position des sites publiée par l’ANFR (ANFR 2026).
Prouver sans étiquettes
Sans anomalie validée, ni la précision ni le rappel ne sont calculables. La littérature propose plusieurs détours (Campos et al. 2016; Emmott et al. 2013), et on les a tous utilisés : injecter des défauts connus dans des zones saines et vérifier qu’ils remontent avec le bon type ; vérifier qu’aucun critère n’est inutile en les retirant un par un ; mesurer la stabilité du classement ; comparer les détecteurs entre eux ; et comparer chaque anomalie avec les cartes des autres opérateurs et des trimestres précédents. La la page validation présente les résultats. La seule mesure de qualité réelle restera la relecture du haut de la liste par les experts de l’Arcep, et l’outil est conçu pour la faciliter.
Ce qu’il reste à faire
Trois pistes nous semblent les plus utiles pour la suite. La première est de croiser les frontières droites avec la position des antennes, pour confirmer ou rejeter l’hypothèse des fenêtres de calcul. La deuxième est d’ajouter un modèle numérique de terrain, pour distinguer un trou de couverture derrière une crête (légitime) d’un trou en terrain dégagé (suspect). La troisième est de recaler le score à partir des retours des experts : quelques dizaines de cas validés suffiraient à transformer notre score en une probabilité vraiment calibrée.