Le laboratoire multidisciplinaire Data Science for Social Impact (DSFSI) basé à l’Université de Pretoria est soutenu par le programme Intelligence artificielle pour le développement (AIPD), un partenariat entre le Foreign Commonwealth and Development Office (FCDO) du Royaume-Uni et le CRDI, avec un financement supplémentaire de l’Agence suédoise de coopération internationale (Asdi).
L’inclusion dès la conception : Rendre les langues africaines visibles pour l’IA
L’intelligence artificielle (IA) est souvent présentée comme un outil d’inclusion, mais une triste réalité se cache sous cette promesse : les systèmes d’IA peuvent exclure des populations entières simplement parce qu’ils ne reconnaissent pas leur langue.
Les grands modèles de langue (GML) modernes – la technologie derrière ChatGPT, Gemini, Claude et d’autres outils d’IA générative – apprennent à partir de vastes collections de textes rassemblés sur Internet. En définissant des modèles dans les données linguistiques, ils peuvent générer des réponses semblables à celles des personnes. Mais les processus utilisés pour recueillir et filtrer ces données intègrent un biais à chaque étape, bien avant qu’un modèle ne produise sa première réponse.
L’un des éléments clés de ce processus est l’utilisation de robots d’indexation, des programmes automatisés qui se déplacent sur Internet pour repérer et organiser le contenu en ligne. Le tout est stocké dans des ensembles de données utilisés pour former les GML. Ces robots commencent à partir d’une liste de pages Web connues, puis suivent des hyperliens de page en page, découvrant, organisant et stockant davantage de pages, élargissant ainsi en permanence le bassin de données qu’ils recueillent.
Pourquoi les langues africaines sont absentes des ensembles de données d’IA
Le défi réside où ce parcours commence. Les robots d’indexation typiques sont conçus pour commencer avec un petit ensemble de sites Web axés sur les pays du Nord, principalement en anglais, contournant dès le début le contenu en langue africaine. Même lorsque ces robots trouvent du contenu en langue africaine plus tard dans le processus de découverte, les outils automatisés d’identification de la langue le classent souvent de manière erronée. En cas d’incertitude, ces systèmes peuvent utiliser par défaut l’anglais ou confondre une langue africaine avec une autre, éliminant ainsi le texte valide.
Ainsi, alors que le contenu en langue africaine est disponible en ligne, les robots d’indexation le manquent souvent en raison de l’endroit et de la langue de la recherche. Au fil du temps, ces décisions créent une boucle de rétroaction : les systèmes d’IA sont formés sur des ensembles de données incomplets, et leurs limites renforcent la perception que ces langues sont « à faibles ressources », ce qui signifie qu’elles ne sont pas présentes en ligne – alors qu’en réalité, elles sont simplement sous-représentées ou mal représentées dans les données utilisées pour construire les modèles.
Ainsi, le problème n’est pas seulement un manque de données sur les langues africaines par rapport à l’anglais et à d’autres langues européennes, mais aussi un manque de visibilité. Bien que le contenu en langue africaine ne représente qu’une fraction de ce qui est disponible en ligne, il reflète la sagesse, les idées et les expériences de centaines de millions d’Africains et d’Africaines qui créent, échangent et appliquent des connaissances à travers les langues autochtones chaque jour. Cela est important, car il est essentiel de veiller à ce que ces langues soient représentées dans la recherche et l’IA pour rendre les systèmes de connaissances plus inclusifs et, par extension, plus exhaustifs.
Rendre le contenu en langue africaine plus facile à trouver
Pour Idris Abdulmumin et son équipe du laboratoire multidisciplinaire Data Science for Social Impact (DSFSI) basé à l’Université de Pretoria, ce défi a offert une occasion. Une question simple a été posée : Comment les communautés linguistiques locales pourraient-elles aider les robots d’indexation à trouver du contenu de qualité supérieure dans des langues sous-représentées et à créer des ensembles de données qui pourraient être utilisés pour former des outils d’IA?
Cette idée a été renforcée par une conversation avec une équipe de Common Crawl, une organisation américaine à but non lucratif qui explore Internet et fournit des ensembles de données gratuits au public, ce qui en fait l’une des sources de données d’entraînement les plus utilisées au monde pour les GML. La conversation a révélé à quel point le contenu en langue africaine était mal représenté sur la plateforme. Dirigée par Idris, l’équipe DSFSI de l’Université de Pretoria a entrepris de rendre les données existantes en langues africaines visibles et accessibles. L’initiative « Africa Common Crawl » (AfriCC) est née.
Le laboratoire de Pretoria a lancé un appel à la communauté de recherche de Masakhane, une initiative de bénévoles à l’échelle du continent qui travaille en collaboration sur les technologies langagières. On leur a demandé de réaliser une tâche simple : soumettre une ou plusieurs adresses URL de sites Web contenant du contenu en langues africaines.
La communauté africaine de l’IA a plus que répondu à cet appel. À ce jour, des équipes de recherche et des bénévoles de 19 pays ont cerné environ 700 adresses URL de départ dans 34 langues africaines. Une grande partie des données est repérée par l’intermédiaire de réseaux locaux, y compris des bénévoles qui ont contribué en partageant des liens, en annotant le texte et en aidant à valider l’utilisation de la langue. La participation est souvent motivée non par des incitations financières, mais par le désir de voir sa langue représentée avec précision dans les systèmes numériques. Comme l’a dit Idris : « C’est quelque chose de très agréable de pouvoir expliquer à quelqu’un que votre langue est importante, mais ensuite, voir votre langue correctement représentée – non seulement représentée, mais représentée correctement – parce que ces langues pourraient éventuellement disparaître. »
L’équipe DSFSI a utilisé ces adresses URL de départ pour étendre les recherches Web de Common Crawl et afficher le contenu existant en langue africaine, un processus qui se poursuit aujourd’hui. Jusqu’à présent, le projet AfriCC a permis de recueillir environ 29 millions de pages Web, dont quelque 6 millions à partir des adresses URL de départ fournies par les personnes contributrices, et a contribué à l’ajout de plus de 343 000 pages en langue africaine à l’ensemble de données Common Crawl de janvier 2026, ce qui représente une augmentation de 18 % par rapport à la mise à jour mensuelle précédente.
De meilleures données à une IA plus inclusive
Les implications de l’initiative AfriCC sont considérables. Une petite intervention communautaire a entraîné une augmentation mesurable de la représentation des langues africaines dans l’un des ensembles de données de formation à l’IA les plus utilisés au monde. Cela démontre que de nombreuses ressources en langues africaines sont déjà disponibles en ligne. Le défi consiste à les cerner, à les recueillir et à les intégrer dans les pipelines de formation en IA.
Pour garantir l’inclusion linguistique, il faut repenser la façon dont les modèles d’IA sont créés. Une grande partie des travaux actuels sur les langues sous-représentées se concentrent sur le réglage fin des modèles existants avec de petits ensembles de données. Bien qu’utile, cette approche ne comble pas les lacunes fondamentales en matière de représentation. Des efforts comme l’initiative AfriCC, le projet Africa Next Voices et le carrefour de Masakhane pour les langues africaines d’influencer l’étape préalable à la formation de l’élaboration de modèles, où les systèmes apprennent la structure de base du langage à partir d’ensembles de données à grande échelle. Améliorer la représentation à ce stade précoce peut améliorer considérablement le rendement en aval et réduire le besoin en matière d’adaptations coûteuses par la suite.
Mettre à l’échelle l’inclusion axée sur la communauté
Créer une IA inclusive nécessite de rendre les langues visibles, d’impliquer les communautés en tant que créatrices conjointes et d’intégrer l’inclusion à chaque étape du pipeline. Pour Idris et son équipe, l’espoir à long terme est de continuer à mettre à l’échelle cette approche de manière abordable et continue. En facilitant la contribution des communautés, ne serait-ce qu’une seule adresse URL, l’initiative AfriCC peut aider à augmenter le volume de données en langues africaines disponibles pour la formation des futurs GML et d’autres outils d’IA, améliorant ainsi constamment la disponibilité et les rendements dans les langues africaines. En fin de compte, cette approche vise à garantir que les langues africaines sont intégrées dès le départ, en façonnant des modèles qui reflètent mieux la diversité multilingue des sociétés qu’elles servent.
Points saillants de la recherche
Lutter contre les biais dans les données de formation à l’IA : L’initiative AfriCC souligne comment les systèmes d’indexation et de définition des langues peuvent systématiquement exclure les langues africaines des ensembles de données utilisés pour former de grands modèles de langue, ce qui renforce les inégalités linguistiques dans l’IA.
Adopter une approche communautaire pour l’inclusion des données : Des équipes de recherche et des bénévoles de 19 pays africains ont fourni environ 700 adresses URL de départ dans 34 langues africaines, aidant ainsi à mettre en évidence le contenu en ligne sous‑représenté à inclure dans les principaux ensembles de données de formation à l’IA.
Démontrer que les données existent, mais restent invisibles : Le projet montre que de nombreuses ressources en langues africaines sont déjà disponibles en ligne. Le défi consiste à les cerner, à les recueillir et à les intégrer dans les pipelines de formation en IA.
Façonner l’IA au niveau des fondations : En améliorant la représentation linguistique au cours de la phase préalable à la formation du développement de l’IA, des initiatives comme l’initiative AfriCC peuvent améliorer le rendement du modèle et l’inclusion linguistique tout en réduisant le besoin d’adaptations ultérieures.
Contributeur·trice·s: Janani Balasubramaniam, Agent·e de gestion de programme, CRDI et Abbey Gandhi, Administrateur·trice de programme, CRDI avec Idris Abdulmumin, Chercheur·euse associé·e, Université de Pretoria
Partagez cette page