¿Qué lenguas tienen datos, modelos y corpus, y cuáles no?¿Qué lenguas tienen datos, modelos y corpus, y cuáles no?
Cada semana registramos qué conjuntos de datos, modelos, corpus de voz, treebanks y herramientas existen para las 68 agrupaciones lingüísticas de México, junto a su grado de riesgo y su número de hablantes.
- Agrupaciones lingüísticas
- 68
- Catálogo del INALI
- Variantes lingüísticas
- 364
- Con grado de riesgo del INALI
- Lenguas en la lista de referencia
- 7,674
- Glottolog 5.3, lenguas habladas (L1)
- Fecha de la instantánea
- 5 oct 2026
- Semanal, solo se agrega
Cada valor se guarda con la fecha en que se midió. Los indicadores nunca se mezclan en un solo puntaje.
Más hablantes no siempre significa más recursosMás hablantes no siempre significa más recursos
Cada punto es una agrupación lingüística. A la derecha, más hablantes; hacia arriba, más tipos de recursos digitales. El color indica el grado de riesgo del INALI.
Nos referimos a los elementos técnicos necesarios para construir herramientas de lenguaje — traductores, reconocimiento de voz, correctores — no a contenido cultural como libros o música. Qué contamos y de dónde viene
- Muy alto
- Alto
- Mediano
- No inmediato
Tipos de recursos con al menos un registro (de 5)
Hablantes de 3 años y más (Censo 2020, escala logarítmica)
Los cinco tipos: conjuntos de datos y modelos en Hugging Face dedicados a la lengua, corpus de voz en Common Voice, treebanks en Universal Dependencies y soporte en Omnilingual ASR.
Dentro de cada fila los puntos se separan un poco en vertical para que no se encimen.
No aparecen en la gráfica: ku'ahl (sin renglón en el censo; identidad sin resolver).