OBDILCI

PROJETO PRINCIPAL 2: MECILDI

A nossa principal missão é produzir indicadores da presença de línguas e do multilinguismo na Internet.

O primeiro projeto principal, iniciado em 2017 e que atingiu a maturidade em 2022, criou um modelo capaz de produzir indicadores para 362 línguas. Este modelo é atualizado pelo menos uma vez por ano.

O segundo projeto principal (MECILDI), iniciado em 2025, visa fornecer um programa capaz de medir indicadores de presença linguística e multilinguismo em qualquer conjunto de sites alvo. Este programa permite avaliar os resultados do modelo e abrir novas linhas de investigação através da sua aplicação em diferentes conjuntos, por exemplo, visando ccTLDs específicos ou a lista TRANCO dos sites mais visitados com mais de um milhão de visitas. Ao contrário da maioria dos programas existentes comparáveis (como o W3Techs), o MECILDI irá fornecer um processo adequado para ter em conta o facto de um site poder conter mais do que um idioma, eliminando assim este enorme enviesamento dos outros métodos documentados nesta referência revista por pares.

Esta secção centra-se no MECILDI. Se estiver interessado no MODEL, passe para PROJETO PRINCIPAL 1: MODEL.

MECILDI

Os dados obtidos a partir do modelo OBDILCI são de interesse geral no que diz respeito às línguas na Internet, uma vez que o método não permite realizar uma análise específica de um subconjunto concreto, como um país específico ou um grupo de países.

Além disso, as investigações históricas realizadas para desenvolver indicadores de diversidade linguística forneceram provas científicas documentadas  que contradizem os métodos propostos pelas empresas de marketing, os quais carecem do rigor científico necessário e cujo forte viés a favor do inglês alimentou, e continua a alimentar, uma desinformação crónica sobre o espaço que o inglês ocupa na web. Os enviesamentos mais significativos destas fontes derivam da sua incapacidade de ter em conta a realidade do multilinguismo nos sites (ver este artigo) e, ao mesmo tempo, ocultam a realidade do forte multilinguismo da web, que está acrescer rapidamente (ver esta secção) graças às contribuições das ferramentas de inteligência artificial.

Estas circunstâncias levaram a OBDILCI a adotar o método tradicional utilizado por fontes influentes, mas tendenciosas: a deteção algorítmica de línguas diretamente numa amostra de sites que se supõe representativa de toda a Web. No entanto, ao contrário destes métodos superficiais, o MECILDI conferirá o rigor necessário à análise do multilinguismo. Esta nova e ambiciosa ferramenta permitirá ainda à OBDILCI alargar o seu âmbito de estudo através da análise específica de segmentos concretos da Internet, definidos de acordo com critérios geográficos ou temáticos.

O programa MECILDI será capaz de analisar uma ampla variedade de sítios web, aplicando a cada um deles um algoritmo de deteção de língua — selecionado pela sua fiabilidade e abrangência. Esta ferramenta, combinada com uma vasta gama de técnicas de identificação, permitirá determinar a distribuição linguística do público-alvo em termos percentuais, bem como outros indicadores relacionados com o multilinguismo. Ter em conta a natureza multilingue de uma proporção significativa de sites constitui um desafio técnico complexo que representa o objetivo principal deste projeto.

Numa primeira fase, o MECILDI poderá esclarecer a prevalência real do inglês na Internet, utilizando a mesma técnica que a W3Techs, mas sem o viés significativo inerente a esses dados. Posteriormente, o MECILDI fornecerá resultados originais e específicos, capazes de orientar, numa base objetiva, as estratégias digitais e as políticas públicas em matéria de línguas e multilinguismo no ciberespaço, começando pelos domínios linguísticos das línguas da França.

O projeto conta atualmente com o apoio da DGLFLF. Este apoio permitiu desenvolver uma versão inicial mais simples, que se centra na técnica mais comum para sites multilingues (o atributo hreflang) e se baseia na extrapolação de dados. Esta versão encontra-se atualmente em fase de testes e deverá apresentar os primeiros resultados nas próximas semanas. É necessário um maior apoio para desenvolver a versão completa, capaz de identificar todas as técnicas multilingues nos sites e extrair a sua distribuição linguística, o que representa um importante desafio técnico.

De qualquer forma, o método e os seus resultados serão apresentados em pormenor num artigo publicado numa revista científica sujeita a revisão por pares. É muito provável que os resultados confirmem definitivamente as conclusões do OBDILCI, que estimam que a percentagem de páginas web em inglês a nível mundial se situe entre 20 % e 27 % (ver o estudo apresentado na reunião da UNESCO/LT4ALL em 2025).

ABRIL DE 2026: A VERSÃO 1 DO MECILDI JÁ FOI DESENVOLVIDA, TESTADA E ESTÁ A FUNCIONAR.

Foi definida uma série de testes com o objetivo, por um lado, de verificar e aprovar o método e o programa e, por outro, de recolher dados relevantes sobre a utilização dos sites mais visitados — um milhão no total — para estimar a proporção de línguas em toda a Web.

  • SÉRIE 1: 4 de maio de 2026, aplicável à série TRANCO de novembro de 2025
  • RUN 1.1: 5 de maio de 2026; igual à anterior, mas com a correção de um erro na percentagem de sites que dispõem de uma versão em inglês (57,9 %). Percentagem de páginas web em inglês = 22,1 %; índice de multilinguismo = 3; percentagem de sites multilingues = 33,8 %; número médio de idiomas por site multilingue = 7; percentagem de sites que utilizam o Google Translate integrado = 1,2 %
  • ANÁLISE DE SENSIBILIDADE DOS FATORES: 8 de maio de 2026. O principal viés do método é o fator de extrapolação utilizado para projetar os resultados completos. a) Uma análise heurística confirma que a escolha de 40 % como base está correta. b) A simulação de variações deste valor num amplo intervalo confirma que a percentagem do inglês se mantém dentro do intervalo de 20 % a 27 %. O impacto de outros fatores nos resultados é marginal.
  • A execução 2: 11/4/2026, aplicada à série TRANCO de 4 de abril de 2026, confirma e corrobora os principais resultados. Não se observam grandes diferenças nos indicadores principais nem nas línguas principais (frequentemente dentro do intervalo de confiança). A maioria das diferenças ocorreu, como era de esperar, nas taxas de erro e nas línguas menos dominantes. A tendência do inglês é ligeiramente descendente (56 %/21,8 % contra 58 %/22,1 %).
  • RUN 3: 13 de maio de 2026, é realizado um último teste para confirmar a abordagem estatística. É submetida uma nova série gerada aleatoriamente de 100 mil locais. 97,8% dos novos resultados permanecem no intervalo de confiança dos primeiros resultados e, para os 5 resultados em 240 que apresentam uma diferença superior, esta permanece marginal (0,05%). Este último teste confirma a abordagem estatística e conclui a campanha de medição.
  • RUN8: junho de 2026 – Estamos na versão 1.7 do MECILDI, que melhora, a cada atualização, o processo de gestão de erros, por exemplo, graças a uma melhor deteção das obras em curso, evitando simultaneamente os falsos negativos. Por isso, modificámos a tabela de resultados para a deixar da melhor forma possível. Mantivemos as primeiras linhas da tabela RUN3 para podermos ver as ligeiras diferenças. Na nova tabela, adicionámos a percentagem de sites que dispõem de uma versão em cada idioma.
  • RUN 1 : 5/4/2026 applied on TRANCO series of 11/2025
  • RUN 1.1: 4 de julho de 2025, idêntico ao anterior, com a correção de um erro na percentagem de sítios Web com uma versão em inglês (57,9 %). Percentagem de páginas web em inglês = 22,1%; índice de multilinguismo = 3; percentagem de sítios web multilingues = 33,8%; número médio de idiomas por sítio web multilingue = 7; percentagem de sítios que utilizam o Google Translate incorporado = 1,2%
  • ANÁLISE DE SENSIBILIDADE DOS FATORES: 8/4/2026. O principal viés do método é o fator de extrapolação utilizado para projetar os resultados completos. a) uma abordagem heurística confirma que a escolha de 40 % como base é correta; b) a simulação de variações deste valor num amplo intervalo confirma que a percentagem relativa permanece dentro do intervalo de 20 % a 27 %. O impacto de outros fatores nos resultados é marginal.
  • A EXECUÇÃO 2: 4/11/2026, aplicada à série TRANCO de 4/4/2026, confirma e reforça a fiabilidade dos principais resultados. Não se observam grandes diferenças nos principais indicadores e nas principais línguas (frequentemente dentro do intervalo de confiança). A maioria das diferenças verificou-se, como seria de esperar, nas taxas de erro e nos idiomas menos dominantes. A tendência para o inglês é ligeiramente descendente (56 %/21,8 % vs. 58 %/22,1 %).
  • EXECUÇÃO 3: 13 de maio de 2026 — é realizado um teste final para validar a abordagem estatística. É submetido um novo conjunto, gerado aleatoriamente, de 100 x 1000 locais. 97,8% dos novos resultados situam-se dentro do intervalo de confiança dos resultados iniciais e, no que diz respeito aos 5 resultados, de um total de 240, que apresentam uma diferença maior, esta continua a ser marginal (0,05%). Este teste final confirma a abordagem estatística e encerra a campanha de medição.
  • RUN8: junho de 2026 — Chegámos à versão V1.7 do MECILDI, melhorando, em cada lançamento, o processo de gestão de erros; por exemplo, com uma melhor deteção de sites em construção, evitando simultaneamente falsos negativos.
  • RUN10: junho de 2026 — Com a versão 1.8, a fase 1 do projeto MECILDI chegou ao fim. Esta última versão inclui, para cada língua, a percentagem de sítios Web que dispõem de uma versão linguística. O ficheiro de resultados, acessível abaixo, reúne agora, para além dos resultados finais, os resultados de todos os estudos intermédios e complementares, conforme referido a seguir:

> Resultados da V1.7 (execução 8) no Tranco, recolhidos a 12 de junho de 2026
> Resultados da V1 (primeira execução) no Tranco, recolhidos em novembro de 2025, com intervalo de confiança para cada campo e comparações com o W3Techs e o modelo OBDILCI
> Estudo de sensibilidade para o fator alfa (extrapolação) e o cabeçalho Accept-Language.
> V1 (execução 3) no Tranco, recolhidos em abril de 2026, comparação com a execução 1
> V1 (execução 4) no mesmo Tranco de abril de 2026, mas com uma amostra aleatória diferente, controlo da consistência estatística
> Estudo das tendências utilizando a funcionalidade do Tranco que permite aceder a listas mais antigas, desde 2019
> Comparação entre o modelo OBDILCI para os resultados de toda a Web e os resultados do Tranco para o milhão de sites mais visitados
> Resultado utilizando apenas dados do Crux em vez do Tranco, com parâmetros definidos para excluir subdomínios e repetições de sites pertencentes à mesma organização (run9)
> Foco nos sites com a instrução Hreflang= e recolha dos seus dados específicos

PRINCIPAIS RESULTADOS DA CORRIDA 3 (V1.3 April 2026)

Esses resultados são apresentados para dar uma ideia da ordem de grandeza do intervalo de confiança.

% OF WEBPAGES INVALOR EM TRANCOintervalo de confiança
English21,77%0,79%
German6,93%0,24%
French6,38%0,24%
Spanish6,36%0,22%
Italian4,13%0,16%
Portuguese3,86%0,15%
Russian3,86%0,16%

PRINCIPAIS RESULTADOS DA EXECUÇÃO FINAL 10 V1.8 TRANCO, junho de 2026

Indicadores de multilinguismo

RUN 10AVERAGE
Pages (English)67.52%Websites having an English version
Sites (English)20.13%Percentage of web pages in English
MultiR3.41  Rate of multilingualism
%Multi37.32%%  multilingual web sites
AvgL7.45Average number of languages per multilingual web sites
ERR46.92%Total sites non processed
ErrG112.70%Domain not accessible
ErrG2-5-616.33%Valid sites but not allowing process
ErrG30.94%Parked or under construction site
ErrG46.99%Web site error
ErrG79.97%Language detection fail
MonoL62.68%Monolingual web sites
GooT1.05%GoogleTranslate imbedded
Alpha 2.71  Extrapolation factor for heuristics.
Lang=69.09%Lang= presente
HrefLang=14.93%HrefLang= presente
IDN0.16%Internationalized Domain Names

Indicadores linguísticos

 LANGUAGE%PAGES%SITES
 TOTAL100.00%341.33%
English20.13%67.52%
German6.51%21.99%
French6.13%20.73%
Spanish6.09%20.55%
Italian4.10%13.92%
Portuguese3.87%13.15%
Russian3.58%12.11%
Dutch3.21%10.98%
Japanese2.98%10.12%
Chinese2.92%9.90%
Polish2.63%8.97%
Turkish1.81%6.19%
Swedish1.79%6.14%
Arabic1.78%6.12%
Korean1.78%6.10%
Indonesian1.68%5.75%
Czech1.56%5.34%
Danish1.40%4.82%
Finnish1.33%4.60%
Romanian1.30%4.48%
Hungarian1.27%4.38%
Ukrainian1.25%4.28%
Vietnamese1.23%4.24%
Modern Greek1.22%4.20%
Thai1.10%3.82%
OTHERL (*)1.04%3.67%
Slovak1.02%3.50%
Norwegian0.90%3.12%
Hindi0.88%3.04%
Bulgarian0.80%2.77%
Slovenian0.74%2.57%
Croatian0.72%2.50%
Malay0.63%2.18%
Estonian0.62%2.17%
Lithuanian0.61%2.11%
Latvian0.60%2.09%
Hebrew0.59%2.06%
Bengali0.51%1.78%
Serbian0.49%1.71%
Persian0.36%1.28%
NON-ID (**)0.32%1.07%
Catalan0.32%1.11%
Tagalog0.30%1.05%
Urdu0.29%1.05%
Albanian0.28%1.01%

(*) OUTROS: Línguas que não fazem parte da lista de línguas detetáveis pelo Tomedes, embora estejam especificadas no atributo hreflang

(**) SEM ID: Línguas não detetadas pelo Tomedes.

Esta tabela apresenta os idiomas presentes nos milhões de sites mais visitados, com base na série TRANCO. Esta série agrega as classificações das listas fornecidas por Crux, Farsight, Majestic, Radar e Umbrella, que podem apresentar um forte viés a favor dos principais países ocidentais, favorecendo assim as principais línguas europeias (alemão, francês, espanhol…).

Esses números não refletem a realidade da proporção de idiomas em toda a web, onde as percentagens de idiomas não europeus, em particular o chinês, seriam consideravelmente mais elevadas.

De qualquer forma, as diferenças entre estes números e os do W3Techs (calculados na mesma série) devem-se ao facto de a W3Techs não ter em conta o multilinguismo dos sites e contabilizar apenas um único idioma por site, enquanto nós contabilizamos todas as versões linguísticas.

Os dados relativos às mais de 200 línguas incluídas no estudo estão disponíveis em acesso aberto (CC-BY-SA 4.0) abaixo.

Os detalhes relativos às mais de 200 línguas incluídas no estudo TRANCO estão disponíveis gratuitamente (CC-BY-SA 4.0) abaixo. Também se apresentam alguns dados sobre o estado do multilinguismo na Web.

O estudo sobre a diversidade linguística dos gTLD em França já foi concluído; pode consultar os resultados abaixo.

Por fim, incluem-se informações técnicas para que os webmasters possam verificar como o robô MECILDI trata os sites explorados.

O programa MECILDI e seus produtos foram agora documentados em detalhes minuciosos em um preprint publicado no ResearchGate, uma etapa anterior à publicação em um periódico com revisão por pares.

Projetos de OBDILCI

  • Indicadores da presença das línguas e multilinguismo na Internet
  • As línguas da França na Internet
  • Francês na Internet
  • Português na Internet
  • Espanhol na Internet
  • Multilinguismo en la Web
  • Cursos
  • IA e multilinguismo
  • gTLDs linguisticos
  • DILINET
  • Projetos pré-históricos
  • Projeto Digital Language Death