OBDILCI

PROYECTO PRINCIPAL 2: MECILDI

Nuestra misión principal es elaborar indicadores sobre la presencia de lenguas y el multilingüismo en la Internet.

El primer proyecto principal, iniciado en 2017 y que alcanzó su madurez en 2022, creó un modelo capaz de generar indicadores para 362 idiomas. Este modelo se actualiza al menos una vez al año.

El segundo proyecto principal (MECILDI), iniciado en 2025, consiste en proporcionar un programa capaz de medir la presencia lingüística y los indicadores de multilingüismo en cualquier conjunto de sitios web seleccionado. Este programa permite evaluar los resultados del modelo y abrir nuevas líneas de investigación mediante su aplicación en diferentes conjuntos, por ejemplo, centrándose en ccTLD específicos o en la lista TRANCO de los sitios web más visitados con más de un millón de visitas.

A diferencia de la mayoría de los programas comparables existentes (como W3Techs), MECILDI proporcionará el proceso adecuado para tener en cuenta el hecho de que un sitio web puede contener más de un idioma, eliminando así este enorme sesgo de los otros métodos documentados en esta referencia revisada por pares.

Esta sección se centra en MECILDI. Si te interesa el MODELO, pasa a PROYECTO PRINCIPAL 1: MODELO.

MECILDI: RESUMEN DEL PROYECTO

Los datos obtenidos del modelo OBDILCI son de interés general en lo que respecta a las lenguas en la Internet, ya que el método no permite realizar un análisis específico de un subconjunto concreto, como un país específico o un grupo de países.

Además, las investigaciones históricas realizadas para desarrollar indicadores de diversidad lingüística han aportado pruebas científicas documentadas que contradicen los métodos propuestos por las empresas de marketing, los cuales carecen del rigor científico necesario y cuyo marcado sesgo a favor del inglés ha alimentado, y sigue alimentando, una desinformación crónica sobre el espacio que ocupa el inglés en la web. Los sesgos más significativos de estas fuentes se derivan de su incapacidad para tener en cuenta la realidad del multilingüismo en los sitios web (véase este artículo) y, al mismo tiempo, ocultan la realidad del fuerte multilingüismo de la web, que está creciendo rápidamente (véase esta sección) gracias a las contribuciones de las herramientas de inteligencia artificial.

Estas circunstancias han llevado a OBDILCI a adoptar el método tradicional utilizado por fuentes influyentes pero sesgadas: la detección algorítmica de lenguas directamente sobre una muestra de sitios web que se supone representativa de toda la Web. Sin embargo, a diferencia de estos métodos superficiales, MECILDI aportará el rigor necesario al análisis del multilingüismo. Esta nueva y ambiciosa herramienta permitirá además a OBDILCI ampliar su ámbito de estudio mediante el análisis específico de segmentos concretos de la Internet, definidos según criterios geográficos o temáticos.

El programa MECILDI será capaz de analizar una amplia variedad de sitios web, aplicando a cada uno de ellos un algoritmo de detección de lengua—seleccionado por su fiabilidad y cobertura—. Esta herramienta, combinada con una amplia gama de técnicas de identificación, permitiría extraer la distribución lingüística del público objetivo en términos porcentuales, así como otros indicadores relacionados con el multilingüismo. Tener en cuenta la naturaleza multilingüe de una proporción significativa de sitios web supone un complejo reto técnico que constituye el objetivo principal de este proyecto.

La primera versión del proyecto cuenta con el apoyo de la DGLFLF y la OIF. Esta primera versión, más sencilla, se centra en la técnica más habitual para el multilingüismo de los sitios web (la etiqueta «hreflang») y complementa sus resultados mediante extrapolación. Esta versión 1 concluyó en junio de 2026 y ha generado resultados para la lista TRANCO de los un millón de sitios web más visitados y para una serie de gTLD asociados a las lenguas de Francia. La versión 2, más ambiciosa en cuanto a la cobertura exhaustiva de todos los métodos de creación de sitios web multilingües, cuenta con el apoyo de la OIF y la DGLFLF. Aportará más precisiones sobre los indicadores generados y ampliará su aplicación a una decena de países de la Francofonía.

La versión 1 ha sido objeto de una primera descripción detallada de su método, disponible por el momento en formato preimpresión y próximamente en una revista científica. Los resultados de la versión 1 han permitido confirmar definitivamente los trabajos previos de OBDILCI , que estimaban que el porcentaje de páginas web en inglés en el conjunto de la WWW se sitúa dentro del intervalo del 19 % al 26 % (véase el estudio presentado en la reunión de la UNESCO/LT4ALL en 2025), así como los primeros estudios sobre el multilingüismo de la WWW realizados con la base de datos de DataProvider.com (véase esta sección).

ABRIL DE 2026: LA VERSIÓN 1 DE MECILDI YA ES OPERACIONAL

Se ha establecido una serie de pruebas con el fin, por un lado, de verificar y aprobar el método y el programa y, por otro, de recabar datos relevantes sobre el uso de los sitios web más visitados —un millón en total— para estimar la proporción de idiomas en toda la web.

  • SERIE 1: 4 de mayo de 2026, aplicada a la serie TRANCO de noviembre de 2025
  • RUN 1.1: 5 de mayo de 2026; igual que la anterior, pero con la corrección de un error en el porcentaje de sitios web que cuentan con una versión en inglés (57,9 %). Porcentaje de páginas web en inglés = 22,1 %; índice de multilingüismo = 3; porcentaje de sitios web multilingües = 33,8 %; número medio de idiomas por sitio web multilingüe = 7; porcentaje de sitios que utilizan Google Translate integrado = 1,2 %
  • ANÁLISIS DE SENSIBILIDAD DE FACTORES: 8 de mayo de 2026. El principal sesgo del método es el factor de extrapolación utilizado para proyectar los resultados completos. a) Un análisis heurístico confirma que la elección del 40 % como base es correcta. b) La simulación de variaciones de este valor en un amplio rango confirma que el porcentaje del inglés se mantiene dentro del intervalo del 20 % al 27 %. El impacto de otros factores en los resultados es marginal.
  • La ejecución 2: 11/4/2026, aplicada a la serie TRANCO del 4 de abril de 2026, confirma y avala los resultados principales. No se observan grandes diferencias en los indicadores principales ni en las lenguas principales (a menudo dentro del intervalo de confianza). La mayoría de las diferencias se produjeron, como era de esperar, en las tasas de error y en los idiomas menos dominantes. La tendencia del inglés es ligeramente a la baja (56%/21,8 % frente a 58%/22,1 %).
  • RUN 3: 13 de mayo de 2026, se lleva a cabo una última prueba para confirmar el enfoque estadístico. Se somete a prueba una nueva serie generada aleatoriamente de 100 x 1000 sitios. El 97,8 % de los nuevos resultados se mantiene dentro del intervalo de confianza de los primeros resultados y, en los 5 resultados de los 240 que muestran una diferencia superior, esta sigue siendo marginal (0,05 %). Esta última prueba confirma el enfoque estadístico y concluye la campaña de medición.
  • RUN8: junio de 2026 – Estamos en la versión 1.7 de MECILDI, que mejora con cada actualización el proceso de gestión de errores, por ejemplo, gracias a una mejor detección de las obras en construcción, evitando al mismo tiempo los falsos negativos.
  • RUN10: junio de 2026. Con la versión 1.8 ha concluido la fase 1 del proyecto MECILDI. Esta última versión incluye, para cada idioma, el porcentaje de sitios web que cuentan con una versión lingüística. El archivo de resultados, al que se puede acceder a continuación, recoge ahora, además de los resultados finales, los resultados de todos los estudios intermedios y complementarios que se mencionan a continuación:

> Resultados de la versión 1.7 (RUN8) en Tranco, recopilados el 12 de junio de 2026
> Resultados de la V1 (RUN1) en Tranco, recopilados en noviembre de 2025, con intervalo de confianza para cada campo y comparaciones con W3Techs y el modelo OBDILCI
> Estudio de sensibilidad para el factor alfa (extrapolación) y el encabezado Accept-Language.
> V1 (RUN3) en Tranco, datos recopilados en abril de 2026; comparación con RUN1
> V1 (RUN4): el mismo Tranco de abril de 2026, pero con una muestra aleatoria diferente; control de la consistencia estadística
> Estudio de tendencias utilizando la función de Tranco que permite consultar listas anteriores, desde 2019
> Comparación entre el modelo OBDILCI para los resultados de toda la web y los resultados de Tranco para el millón de sitios web más visitados
> Resultado utilizando únicamente datos de Crux en lugar de Tranco, con parámetros configurados para excluir subdominios y la repetición de sitios web pertenecientes a la misma organización (RUN9)
> Análisis centrado en los sitios web con la instrucción Hreflang= y recopilación de sus datos específicos

RESULTADOS DEL RUN3 (V1.3 Abril 2026)

% OF WEBPAGES INVALOR EN TRANCOCONFIDENCE
INTERVAL 99%
(+-)
English21,77%0,79%
German6,93%0,24%
French6,38%0,24%
Spanish6,36%0,22%
Italian4,13%0,16%
Portuguese3,86%0,15%
Russian3,86%0,16%

RESULTADOS DEL RUN10 FINAL V1.8 TRANCO, junio de 2026

Indicadores de multilingüismo

RUN 10AVERAGE
Sitios (inglés)67.52%Websites having an English version
Paginas (inglés)20.13%Percentage of web pages in English
MultiR3.41  Rate of multilingualism
%Multi37.32%%  multilingual web sites
AvgL7.45Número medio de idiomas por sitio multilingüe
ERR46.92%Total sin procesar
ErrG112.70%Domain not accessible
ErrG2-5-616.33%Valid sites but not allowing process
ErrG30.94%Parked or under construction site
ErrG46.99%Web site error
ErrG79.97%Language detection fail
MonoL62.68%Monolingual web sites
GooT1.05%GoogleTranslate imbedded
Alpha 2.71  Factor de extrapolación para la heurística.
Lang=69.09%Lang= presente
HrefLang=14.93%HrefLang= presente
IDN0.16%Internationalized Domain Names

Indicadores lingüísticos

LENGUAS%PAGES%SITIOS
 TOTAL100.00%341.33%
English20.13%67.52%
German6.51%21.99%
French6.13%20.73%
Spanish6.09%20.55%
Italian4.10%13.92%
Portuguese3.87%13.15%
Russian3.58%12.11%
Dutch3.21%10.98%
Japanese2.98%10.12%
Chinese2.92%9.90%
Polish2.63%8.97%
Turkish1.81%6.19%
Swedish1.79%6.14%
Arabic1.78%6.12%
Korean1.78%6.10%
Indonesian1.68%5.75%
Czech1.56%5.34%
Danish1.40%4.82%
Finnish1.33%4.60%
Romanian1.30%4.48%
Hungarian1.27%4.38%
Ukrainian1.25%4.28%
Vietnamese1.23%4.24%
Modern Greek1.22%4.20%
Thai1.10%3.82%
OTHERL (*)1.04%3.67%
Slovak1.02%3.50%
Norwegian0.90%3.12%
Hindi0.88%3.04%
Bulgarian0.80%2.77%
Slovenian0.74%2.57%
Croatian0.72%2.50%
Malay0.63%2.18%
Estonian0.62%2.17%
Lithuanian0.61%2.11%
Latvian0.60%2.09%
Hebrew0.59%2.06%
Bengali0.51%1.78%
Serbian0.49%1.71%
Persian0.36%1.28%
NON-ID (**)0.32%1.07%
Catalan0.32%1.11%
Tagalog0.30%1.05%
Urdu0.29%1.05%
Albanian0.28%1.01%

(*) OTHERL: Idiomas que no figuran en la lista de idiomas detectables de Tomedes, aunque estén especificados en Hreflang

(**) NON-ID: Idiomas no detectados por Tomedes.

Esta tabla recoge los idiomas presentes en el millón de sitios web más visitados según la serie TRANCO. Esta serie agrega las clasificaciones de las listas proporcionadas por Crux, Farsight, Majestic, Radar y Umbrella, que pueden presentar un fuerte sesgo a favor de los principales países occidentales, lo que a su vez favorece a las principales lenguas europeas (alemán, francés, español…).

Esas cifras no reflejan la realidad de la proporción de idiomas en toda la web, donde los porcentajes de idiomas no europeos, en particular el chino, serían considerablemente más altos.

En cualquier caso, las diferencias entre esas cifras y las de W3Techs (calculadas en la misma serie) se deben a que W3Techs no tiene en cuenta el multilingüismo de los sitios web y contabiliza un único idioma por sitio, mientras que nosotros contabilizamos todas las versiones lingüísticas.

Los datos relativos a las más de 200 lenguas incluidas en el estudio TRANCO están disponibles en acceso abierto (CC-BY-SA 4.0) a continuación.

A continuación se incluyen también algunas cifras sobre la situación del multilingüismo en la web.

El estudio sobre el multilinguismo de unos gTLDs de Francia se ha concluido. Consulte los resultados abajo.

Por último, se ofrece información técnica dirigida a los administradores de sitios web para que puedan comprobar cómo el robot MECILDI procesa los sitios web rastreados.

El programa MECILDI y sus productos han sido ahora documentados en sus minimos detalles en un preimpreso publicado en ResearchGate, una etapa antes de la publicación en una revista peer-reviewed.

Proyectos OBDILCI

  • Indicadores de la presencia de lenguas en la Internet
  • Las lenguas de Francia en la Internet
  • El francés en la Internet
  • El portugués en la Internet
  • El español en la Internet
  • Informes sobre multilingüísmo de la Web
  • Cursos
  • IA y multilinguismo
  • gTLDs lingüísticos
  • DILINET
  • Proyectos pre-históricos
  • Muerte digital de las lenguas