ACCUEIL

Contenu de ce site web (généré par IA)

Tout ce qui suit ce paragraphe est entièrement généré par l’IA à l’aide de la version gratuite de ChatGPT, avec la réponse initiale telle quelle, sans aucune modification. Il s’agit de la seule et unique page de ce site web utilisant explicitement l’IA.

Ce que vous trouverez sur le site d’OBDILCI (généré par IA)

Cette page est une synthèse du contenu du site réalisée avec l’aide de ChatGPT. Elle a été rédigée à partir des différentes pages et publications disponibles sur le site, puis adaptée et traduite dans les trois autres langues de travail d’OBDILCI. Elle constitue une porte d’entrée destinée à faciliter la découverte de nos travaux ; pour les résultats, méthodes et références détaillés, nous vous invitons à consulter les pages originales.

Comprendre la diversité linguistique sur Internet

L’Observatoire de la diversité linguistique et culturelle dans l’Internet (OBDILCI) est une organisation à but non lucratif consacrée à l’étude de la présence des langues et des cultures dans l’Internet. Depuis 1998, OBDILCI développe des méthodes permettant de mesurer cette présence et d’en suivre l’évolution, dans un environnement numérique qui change constamment.

Le cœur de cette activité est un travail de recherche : produire des données, construire des indicateurs, développer des méthodes reproductibles et confronter les résultats aux travaux scientifiques existants. Une partie importante des recherches d’OBDILCI fait l’objet de publications évaluées par les pairs.

Mesurer la présence des langues dans l’Internet

Le principal programme de recherche d’OBDILCI est consacré aux indicateurs de présence des langues dans l’Internet. Depuis 2017, l’Observatoire a développé un modèle permettant d’estimer, pour plusieurs centaines de langues, leur poids relatif dans les contenus du Web et de le mettre en relation avec le nombre de locuteurs et leur accès à Internet.

Cette approche cherche notamment à répondre à une question essentielle : la présence d’une langue sur Internet est-elle proportionnelle à son poids démographique et à la proportion de ses locuteurs connectés ?

La base de données permet d’explorer ces indicateurs langue par langue et de comparer les situations. Elle met également en évidence des phénomènes tels que la sur- ou sous-représentation virtuelle de certaines langues et la productivité relative de leurs communautés en matière de contenus numériques.

Mesurer le multilinguisme du Web

La seconde grande orientation est l’étude du multilinguisme des sites Web. Un site ne doit pas nécessairement être associé à une seule langue : de nombreux sites proposent plusieurs versions linguistiques. Cette réalité complique considérablement la mesure de la présence des langues.

Le programme MECILDI constitue la réponse informatique développée par OBDILCI à ce problème. Il permet d’analyser une série donnée de sites Web et d’identifier les langues présentes, afin de mesurer notamment le pourcentage de sites multilingues, le nombre moyen de langues par site multilingue et le taux global de multilinguisme. Le programme permet également d’étudier des populations particulières de sites, par exemple celles correspondant à certains ccTLD, gTLD ou aux sites les plus visités.

Cette approche permet de dépasser les méthodes qui attribuent une seule langue à chaque site et peuvent ainsi introduire un biais important dans l’évaluation de la diversité linguistique du Web.

Des études consacrées aux langues et aux territoires

Le site rassemble également des études consacrées à des langues ou à des espaces linguistiques particuliers : les langues de France, le français, le portugais et l’espagnol, ainsi que des recherches sur les relations entre langues dans différents espaces du Web.

Ces études permettent de passer des indicateurs globaux à des questions plus ciblées : présence d’une langue dans différents pays, développement de ses versions Web, relations entre langues voisines, effets du commerce électronique, des territoires, des types de domaines ou encore du degré de développement économique.

Une série récente de rapports explore ainsi le multilinguisme du Web à partir de grandes bases de données portant sur des dizaines de millions de sites. Elle permet notamment d’étudier les relations entre langue principale des sites, multilinguisme, activité économique et type de domaine.

Internet, intelligence artificielle et avenir des langues

OBDILCI s’intéresse également aux relations entre langues et intelligence artificielle. L’arrivée des grands modèles de langage et des outils de traduction automatique ouvre de nouvelles possibilités pour les langues, mais soulève aussi des questions importantes concernant leur représentation dans les données numériques, leur capacité à être traitées par les technologies linguistiques et les risques de nouvelles formes d’inégalité entre langues.

Cette réflexion prolonge naturellement la mission de l’Observatoire : mesurer la diversité linguistique numérique ne consiste plus seulement à observer les contenus du Web, mais aussi à comprendre comment les technologies qui les produisent, les indexent, les traduisent ou les analysent prennent en compte les différentes langues.

Publications, données et travaux antérieurs

Le site donne accès aux publications scientifiques, rapports, présentations, vidéos et articles de blog produits par OBDILCI ou liés à ses travaux. Il conserve également la mémoire de projets plus anciens qui ont contribué à l’évolution de la recherche sur la diversité linguistique et culturelle dans l’Internet.

L’ensemble permet ainsi de suivre près de trois décennies de recherche, depuis les premières observations sur la diversité linguistique de l’Internet jusqu’aux méthodes actuelles de mesure à grande échelle.

Un site conçu comme une ressource ouverte

OBDILCI souhaite que ses recherches puissent être utilisées par les chercheurs, institutions, organisations linguistiques, acteurs du numérique et toute personne intéressée par l’avenir des langues dans l’environnement numérique.

Le site est donc à la fois un espace de présentation, une base documentaire, un outil d’exploration des données et un laboratoire de recherche. Il ne prétend pas seulement répondre à la question « quelles langues sont présentes sur Internet ? », mais cherche également à comprendre pourquoi leur présence est différente, comment elle évolue et ce que ces différences nous apprennent sur la diversité linguistique et culturelle dans le monde numérique.

La consultation des différentes rubriques permet d’aller progressivement de cette vision générale aux données, méthodes, études et références scientifiques qui la sous-tendent.

Les projets d’OBDILCI

  • Indicateurs de la présence des langues et du multilinguisme dans l’Internet
  • Les langues de France dans l’Internet
  • Le français dans l’Internet
  • Le portugais dans l’Internet
  • L’espagnol dans l’Internet
  • Rapports sur le multilinguisme de la Toile
  • Cours
  • IA et multilinguisme
  • gTLDs linguistiques
  • DILINET
  • Projets pré-historiques
  • Mort numérique des langues