Explainable AI for Genetic Disorder Detection from Facial Images
Loading...
Date
Authors
Journal Title
Journal ISSN
Volume Title
Publisher
Abstract
Genetic disorders affect approximately 8% of the global population, yet diagnostic delays of years or decades remain common due to the rarity of individual syndromes and the specialised expertise required to recognise their facial phenotypes. Recent deep learning systems have demonstrated remarkable accuracy in detecting genetic syndromes from facial photographs, but they operate as black boxes, providing predictions without explanations. This opacity limits their adoption in clinical settings where trust and accountability are essential.
This thesis addresses three problems: (1) achieving high-accuracy multi-class classification of genetic syndromes from facial images under clinically relevant paradigms, (2) identifying which facial regions drive model predictions and whether these align with dysmorphology knowledge, and (3) developing and evaluating a computationally practical XAI method that balances faithfulness with efficiency.
Using facial images from the GestaltMatcher Database, an InceptionResNetV1 backbone pretrained on VGGFace2 was fine-tuned under three classification paradigms: binary disorder-vs-control screening (DvC), four-syndrome multi-class differential diagnosis (MNC), and one-vs-rest syndrome discrimination (DvD). Three XAI methods were applied and evaluated: Grad-CAM, patch-based occlusion, and a novel hybrid method that guides occlusion using Grad-CAM to reduce computational cost.
The deep learning model achieved 97.35% accuracy on DvC screening and 93.0% on MNC differential diagnosis. XAI heatmaps revealed clinically consistent attention patterns: the eyebrow region dominated for Cornelia de Lange syndrome (synophrys), and the nasal region for Ogden syndrome. Quantitative faithfulness evaluation using Deletion and Insertion AUC metrics confirmed that full occlusion is the most faithful method but requires over 20 minutes per image. The proposed hybrid method achieves comparable faithfulness (Deletion AUC 0.3595 vs. 0.3134
for occlusion) at a 21.6× speedup (57 seconds per image). A cross-paradigm comparison further revealed that screening and diagnostic models attend to different facial regions, confirming that the classification paradigm shapes the features a model learns.
These results advance the understanding of explainable AI for facial dysmorphology and provide a practical path toward trustworthy AI-assisted genetic diagnosis.
---------------------------------------------------------------------------
ﺗؤﺛر اﻻﺿطراﺑﺎت اﻟﺟﯾﻧﯾﺔ ﻋﻠﻰ ﻣﺎ ﯾﻘﺎرب 8٪ ﻣن ﺳﻛﺎن اﻟﻌﺎﻟم، وﻣﻊ ذﻟك ﺗﺑﻘﻰ اﻟﺗﺄﺧﯾرات اﻟﺗﺷﺧﯾﺻﯾﺔ اﻟﺗﻲ ﺗﻣﺗد ﻟﺳﻧوات
أو ﺣﺗﻰ ﻋﻘود أﻣرا“ ﺷﺎﺋﻌﺎ“ ﺑﺳﺑب ﻧدرة ﻛل ﻣﺗﻼزﻣﺔ ﻋﻠﻰ ﺣدة واﻟﺣﺎﺟﺔ إﻟﻰ ﺧﺑرة ﻣﺗﺧﺻﺻﺔ ﻟﻠﺗﻌرف ﻋﻠﻰ اﻷﻧﻣﺎط اﻟظﺎھرﯾﺔ
اﻟوﺟﮭﯾﺔ اﻟﻣرﺗﺑطﺔ ﺑﮭﺎ. وﻗد أظﮭرت أﻧظﻣﺔ اﻟﺗﻌﻠم اﻟﻌﻣﯾق اﻟﺣدﯾﺛﺔ دﻗﺔ ﻣﻠﺣوظﺔ ﻓﻲ اﻛﺗﺷﺎف اﻟﻣﺗﻼزﻣﺎت اﻟﺟﯾﻧﯾﺔ ﻣن اﻟﺻور
اﻟوﺟﮭﯾﺔ، ﻟﻛﻧﮭﺎ ﺗﻌﻣل ﻛـ»ﺻﻧﺎدﯾق ﺳوداء«، ﺣﯾث ﺗﻘدم ﺗﻧﺑؤات دون ﺗﻔﺳﯾرات واﺿﺣﺔ. ھذا اﻟﻐﻣوض ﯾﺣد ﻣن اﻋﺗﻣﺎدھﺎ ﻓﻲ
اﻟﺑﯾﺋﺎت اﻟﺳرﯾرﯾﺔ اﻟﺗﻲ ﺗﺗطﻠب اﻟﺛﻘﺔ واﻟﻣﺳؤوﻟﯾﺔ. ﺗﻌﺎﻟﺞ ھذه اﻷطروﺣﺔ ﺛﻼث ﻣﺷﻛﻼت رﺋﯾﺳﯾﺔ: (1) ﺗﺣﻘﯾق ﺗﺻﻧﯾف ﻣﺗﻌدد
اﻟﻔﺋﺎت ﻋﺎﻟﻲ اﻟدﻗﺔ ﻟﻠﻣﺗﻼزﻣﺎت اﻟﺟﯾﻧﯾﺔ اﻋﺗﻣﺎد “ا ﻋﻠﻰ ﺻور اﻟوﺟﮭ ﺿﻣن ﺳﯾﻧﺎرﯾوھﺎت ﺗﺻﻧﯾف ذات ﺻﻠﺔ ﺳرﯾرﯾﺔ، (2)
ﺗﺣدﯾد اﻟﻣﻧﺎطق اﻟوﺟﮭﯾﺔ اﻟﺗﻲ ﺗؤﺛر ﻓﻲ ﺗﻧﺑؤات اﻟﻧﻣوذج وﻣﺎ إذا ﻛﺎﻧت ﺗﺗواﻓق ﻣﻊ اﻟﻣﻌرﻓﺔ اﻟﺳرﯾرﯾﺔ اﻟﺧﺎﺻﺔ ﺑﺎﺿطراﺑﺎت
اﻟﺗﺷﻛل اﻟوﺟﮭﻲ،(3) ﺗطوﯾر وﺗﻘﯾﯾم طرﯾﻘﺔ ﻋﻣﻠﯾﺔ وﻗﺎﺑﻠﺔ ﻟﻠﺗطﺑﯾق ﻣن اﻟذﻛﺎء اﻻﺻطﻧﺎﻋﻲ اﻟﻘﺎﺑل ﻟﻠﺗﻔﺳﯾر (XAI) ﺗﺣﻘق ﺗوازﻧﺎ“
ﺑﯾن اﻟﻣوﺛوﻗﯾﺔ واﻟﻛﻔﺎءة. ﺑﺎﺳﺗﺧدام ﺻور وﺟﮭﯾﺔ ﻣن ﻗﺎﻋدة ﺑﯾﺎﻧﺎت GestaltMatcher، ﺗم ﺿﺑط ﻧﻣوذج
InceptionResNetV1، اﻟﻣُد ﱠرب ﻣﺳﺑﻘﺎ“ ﻋﻠﻰ ﻣﺟﻣوﻋﺔ ﺑﯾﺎﻧﺎت VGGFace2، ﺿﻣن ﺛﻼﺛﺔ أﻧﻣﺎط ﺗﺻﻧﯾﻔﯾﺔ: اﻟﻔﺣص
اﻟﺛﻧﺎﺋﻲ:اﺿطراب ﻣﻘﺎﺑل ﺳﻠﯾم (DvC)، واﻟﺗﺷﺧﯾص اﻟﺗﻔرﯾﻘﻲ ﻣﺗﻌدد اﻟﻔﺋﺎت ﻷرﺑﻊ ﻣﺗﻼزﻣﺎت (MNC)، وﺗﻣﯾﯾز ﻣﺗﻼزﻣﺔ
ﻣﻘﺎﺑل اﻟﺑﻘﯾﺔ .(DvD) ﻛﻣﺎ ﺗم ﺗطﺑﯾق وﺗﻘﯾﯾم ﺛﻼث طرق ﻟﻠذﻛﺎء اﻻﺻطﻧﺎﻋﻲ اﻟﻘﺎﺑل ﻟﻠﺗﻔﺳﯾر: Grad-CAM، واﻹﺧﻔﺎء اﻟﻘﺎﺋم
ﻋﻠﻰ اﻟرﻗﻊ Occlusion) (Patch-based، وطرﯾﻘﺔ ھﺟﯾﻧﺔ ﺟدﯾدة ﺗوﺟّﮭ ﻋﻣﻠﯾﺔ اﻹﺧﻔﺎء ﺑﺎﺳﺗﺧدام Grad-CAM ﺑﮭدف ﺗﻘﻠﯾل اﻟﺗﻛﻠﻔﺔ اﻟﺣﺳﺎﺑﯾﺔ. ﺣﻘق ﻧﻣوذج اﻟﺗﻌﻠم اﻟﻌﻣﯾق دﻗﺔ ﺑﻠﻐت 97.35٪ ﻓﻲ ﻓﺣص DvC و93.0٪ ﻓﻲ اﻟﺗﺷﺧﯾص اﻟﺗﻔرﯾﻘﻲ
.MNC وﻛﺷﻔت ﺧراﺋط اﻟﺗﻔﺳﯾر اﻟﺣرارﯾﺔ ﻋن أﻧﻣﺎط اﻧﺗﺑﺎه ﻣﺗواﻓﻘﺔ ﺳرﯾرﯾﺎ“؛ إذ ھﯾﻣﻧت ﻣﻧطﻘﺔ اﻟﺣﺎﺟﺑﯾن ﻓﻲ ﻣﺗﻼزﻣﺔ
ﻛورﻧﯾﻠﯾﺎ دي ﻻﻧﺞ )ﺑﺳﺑب اﻟﺗﺣﺎم اﻟﺣﺎﺟﺑﯾن(، ﺑﯾﻧﻣﺎ ﺑرزت ﻣﻧطﻘﺔ اﻷﻧف ﻓﻲ ﻣﺗﻼزﻣﺔ أوﻏدن. ﻛﻣﺎ أﻛّد اﻟﺗﻘﯾﯾم اﻟﻛﻣﻲ ﻟﻠﻣوﺛوﻗﯾﺔ
ﺑﺎﺳﺗﺧدام ﻣﻘﺎﯾﯾس Deletion وAUC Insertion أن طرﯾﻘﺔ اﻹﺧﻔﺎء اﻟﻛﺎﻣل ھﻲ اﻷﻛﺛر ﻣوﺛوﻗﯾﺔ، ﻟﻛﻧﮭﺎ ﺗﺗطﻠب أﻛﺛر ﻣن
20 دﻗﯾﻘﺔ ﻟﻣﻌﺎﻟﺟﺔ اﻟﺻورة اﻟواﺣدة. أﻣﺎ اﻟطرﯾﻘﺔ اﻟﮭﺟﯾﻧﺔ اﻟﻣﻘﺗرﺣﺔ ﻓﻘد ﺣﻘﻘت ﻣوﺛوﻗﯾﺔ ﻣﺷﺎﺑﮭﺔ AUC) Deletion ﺑﻘﯾﻣﺔ
0.3595 ﻣﻘﺎﺑل 0.3134 ﻟطرﯾﻘﺔ اﻹﺧﻔﺎء( ﻣﻊ ﺗﺳرﯾﻊ ﺑﻣﻘدار 21.6 ﻣرة 57) ﺛﺎﻧﯾﺔ ﻟﻛل ﺻورة.( وﻛﺷف ﺗﺣﻠﯾل اﻟﻣﻘﺎرﻧﺔ
ﺑﯾن أﻧﻣﺎط اﻟﺗﺻﻧﯾف اﻟﻣﺧﺗﻠﻔﺔ أﯾﺿﺎ“ أن ﻧﻣﺎذج اﻟﻔﺣص واﻟﺗﺷﺧﯾص ﺗرﻛز ﻋﻠﻰ ﻣﻧﺎطق وﺟﮭﯾﺔ ﻣﺧﺗﻠﻔﺔ، ﻣﻣﺎ ﯾؤﻛد أن ﻧﻣط
اﻟﺗﺻﻧﯾف ﯾؤﺛر ﻋﻠﻰ اﻟﺧﺻﺎﺋص اﻟﺗﻲ ﯾﺗﻌﻠﻣﮭﺎ اﻟﻧﻣوذج. ﺗﺳﺎھم ھذه اﻟﻧﺗﺎﺋﺞ ﻓﻲ ﺗطوﯾر ﻓﮭم اﻟذﻛﺎء اﻻﺻطﻧﺎﻋﻲ اﻟﻘﺎﺑل ﻟﻠﺗﻔﺳﯾر ﻓﻲ
ﻣﺟﺎل اﺿطراﺑﺎت اﻟﺗﺷﻛل اﻟوﺟﮭﻲ، وﺗوﻓر ﻣﺳﺎرا“ ﻋﻣﻠﯾﺎ“ ﻧﺣو أﻧظﻣﺔ ﺗﺷﺧﯾص ﺟﯾﻧﻲ ﻣدﻋوﻣﺔ ﺑﺎﻟذﻛﺎء اﻻﺻطﻧﺎﻋﻲ ﺗﺗﻣﯾز ﺑﺎﻟﻣوﺛوﻗﯾﺔ
واﻟﺷﻔﺎﻓﯾﺔ.
-------------------------------------------------------------------------------
Les maladies génétiques touchent environ 8 % de la population mondiale, mais les retards de diagnostic de plusieurs années, voire de décennies, restent fréquents en raison de la rareté de chaque syndrome et de l’expertise spécialisée nécessaire pour reconnaître leurs phénotypes faciaux. Des systèmes récents d’apprentissage profond ont démontré une précision remarquable pour détecter les syndromes génétiques à partir de photographies du visage, mais ils fonctionnent comme des boîtes noires, fournissant des prédictions sans explication. Cette opacité limite leur adoption en milieu clinique, où la confiance et la responsabilité sont essentielles.
Cette thèse aborde trois problématiques : (1) réaliser une classification multi-classes de haute précision des syndromes génétiques à partir d’images faciales dans des paradigmes cliniquement pertinents, (2) identifier quelles régions du visage pilotent les prédictions du modèle et si celles-ci sont cohérentes avec les connaissances en dysmorphologie, et (3) développer et évaluer une méthode d’IA explicable (XAI) qui équilibre fidélité et efficacité calculatoire.
En utilisant des images faciales issues de la base GestaltMatcher Database, un réseau de type InceptionResNetV1 pré-entraîné sur VGGFace2 a été affiné selon trois paradigmes de classification : un dépistage binaire trouble vs. contrôle (DvC), un diagnostic différentiel multi-classes à quatre syndromes (MNC), et une discrimination un-contre-tous pour chaque syndrome (DvD). Trois méthodes XAI ont été appliquées et évaluées : Grad-CAM, l’occlusion par patch, et une nouvelle méthode hybride qui guide l’occlusion à l’aide de Grad-CAM pour réduire le coût de calcul.
Le modèle d’apprentissage profond a atteint une précision de 97,35 % pour le dépistage DvC et de 93,0 % pour le diagnostic différentiel MNC. Les cartes de chaleur XAI ont révélé des motifs d’attention cliniquement cohérents : la région des sourcils domine pour le syndrome de Cornelia de Lange (synophrys), et la région nasale pour le syndrome d’Ogden. L’évaluation quantitative de la fidélité à l’aide des métriques AUC de suppression (Deletion) et d’insertion (Insertion) confirme que l’occlusion complète est la méthode la plus fidèle, mais elle nécessite plus de 20 minutes par image. La méthode hybride proposée atteint une fidélité comparable (AUC de suppression de 0,3595 contre 0,3134 pour l’occlusion) avec un accélération d’un facteur 21,6 (57 secondes par image). Une comparaison inter-paradigmes révèle en outre que les modèles de dépistage et de diagnostic différentiel n’activent pas les mêmes régions faciales, confirmant que le paradigme de classification influence les caractéristiques apprises par le modèle.
Ces résultats améliorent la compréhension de l’IA explicable pour la dysmorphologie faciale et offrent une voie pratique vers un diagnostic génétique assisté par IA digne de confiance.
Description
Keywords
genetic disorders, facial dysmorphology, deep learning, explainable artificial intelli-gence, Grad-CAM, occlusion, GestaltMatcher Database, InceptionResNetV1, clinical decision support., اﻻﺿطراﺑﺎت اﻟﺟﯾﻧﯾﺔ، اﺿطراﺑﺎت اﻟﺗﺷﻛل اﻟوﺟﮭﻲ، اﻟﺗﻌﻠم اﻟﻌﻣﯾق، اﻟذﻛﺎء اﻻﺻطﻧﺎﻋﻲ اﻟﻘﺎﺑل ﻟﻠﺗﻔﺳﯾر، Grad-C، اﻹﺧﻔﺎء، ﻗﺎﻋدة ﺑﯾﺎﻧﺎت InceptionResNetV1 ،GestaltMatcher، دﻋم اﻟﻘرار اﻟﺳرﯾري, maladies génétiques, dysmorphologie faciale, apprentissage profond, intelligence artificielle explicable, aide à la décision clinique.