Datos abiertos · actualización semanal

¿Qué lenguas tienen datos, modelos y corpus, y cuáles no?¿Qué lenguas tienen datos, modelos y corpus, y cuáles no?

Cada semana registramos qué conjuntos de datos, modelos, corpus de voz, treebanks y herramientas existen para las 68 agrupaciones lingüísticas de México, junto a su grado de riesgo y su número de hablantes.

Última instantánea
Agrupaciones lingüísticas
68
Catálogo del INALI
Variantes lingüísticas
364
Con grado de riesgo del INALI
Lenguas en la lista de referencia
7,674
Glottolog 5.3, lenguas habladas (L1)
Fecha de la instantánea
5 oct 2026
Semanal, solo se agrega

Cada valor se guarda con la fecha en que se midió. Los indicadores nunca se mezclan en un solo puntaje.

Más hablantes no siempre significa más recursosMás hablantes no siempre significa más recursos

Cada punto es una agrupación lingüística. A la derecha, más hablantes; hacia arriba, más tipos de recursos digitales. El color indica el grado de riesgo del INALI.

Nos referimos a los elementos técnicos necesarios para construir herramientas de lenguaje — traductores, reconocimiento de voz, correctores — no a contenido cultural como libros o música. Qué contamos y de dónde viene

Grado de riesgo (INALI 2012), variante en mayor riesgo
  • Muy alto
  • Alto
  • Mediano
  • No inmediato

Tipos de recursos con al menos un registro (de 5)

Hablantes de 3 años y más (Censo 2020, escala logarítmica)

Los cinco tipos: conjuntos de datos y modelos en Hugging Face dedicados a la lengua, corpus de voz en Common Voice, treebanks en Universal Dependencies y soporte en Omnilingual ASR.

Dentro de cada fila los puntos se separan un poco en vertical para que no se encimen.

No aparecen en la gráfica: ku'ahl (sin renglón en el censo; identidad sin resolver).