Método
Qué mide Glototeca, de dónde salen los datos, cómo se decide que dos nombres son la misma lengua, y qué no sabemos todavía.
Qué mide y qué no
Glototeca registra, una vez por semana, qué recursos digitales públicos existen para cada una de las 68 agrupaciones lingüísticas del catálogo del INALI: conjuntos de datos, modelos, corpus de voz, treebanks y soporte en una herramienta de reconocimiento de voz. Los pone junto a dos datos de contexto: cuántas personas hablan la lengua y qué tan en riesgo está.
Mide presencia en fuentes públicas, no calidad ni utilidad. Que una lengua tenga un conjunto de datos no dice si es bueno, si la comunidad lo conoce o si le sirve. Y que no aparezca nada no significa que no exista nada: significa que nada aparece en las fuentes que revisamos.
Los cuatro estados de un valor
Ayapaneco: 3 conjuntos de datos en Hugging Face llevan su etiqueta. →
Ayapaneco: se revisó Universal Dependencies, que podría contener un treebank de cualquier lengua, y no hay ninguno. Es un cero de verdad. →
Ayapaneco: Common Voice publica una lista cerrada de lenguas y esta no está en ella. No es un cero: la fuente no la contempla. →
Ku’ahl: no tiene código ISO 639-3, así que no hay con qué buscarlo en ninguna fuente. El valor se desconoce y así se muestra. →
Sin puntaje único
Los indicadores nunca se combinan en una calificación. Sumar conjuntos de datos con treebanks, o ponderar uno contra otro, produciría un número que parece preciso y no significa nada. Cada indicador se muestra por separado, con su fuente y su fecha.
México es el piloto. La meta a largo plazo es aplicar el mismo método a todas las lenguas de la lista de referencia de Glottolog (7,674 lenguas habladas en la versión 5.3); hoy el sitio solo cubre México.
De dónde vienen los datos
Ocho fuentes, todas públicas y sin costo. Cinco se consultan cada semana; tres son publicaciones fijas que se cargaron una vez. La instantánea más reciente es del 5 oct 2026.
| Fuente | Qué aporta | Cómo se obtiene | Frecuencia | Versión registrada |
|---|---|---|---|---|
| Glottolog | Identidad de cada lengua y su estado de amenaza | Versión fechada, descargada de Zenodo y fijada por su DOI | Semanal | glottolog 5.3 (doi:10.5281/zenodo.18840967) |
| Hugging Face | Conjuntos de datos y modelos etiquetados con la lengua | API pública, sin cuenta | Semanal | 5 oct 2026 |
| Common Voice | Si hay corpus de voz y de cuántas variedades | Metadatos de cada versión, publicados en GitHub | Semanal | common-voice scripted 27.0 (2026-09-11), spontaneous 5.0 (2026-09-11) |
| Universal Dependencies | Treebanks publicados | Versiones semestrales en GitHub | Semanal | universal-dependencies 2.18 (2026-05-15) |
| Omnilingual ASR | Si el modelo de reconocimiento de voz declara soporte | Lista de lenguas del propio modelo, por código | Semanal | omnilingual-asr lang_ids.py @ a7fb36017a (2025-11-10) |
| INEGI, Censo 2020 | Hablantes de 3 años y más, por lengua | Tabulado oficial del censo, descargado una vez | Fija | INEGI Censo de Población y Vivienda 2020, cpv2020_b_eum_05_etnicidad.xlsx sheet 03 |
| INALI, Catálogo de las Lenguas Indígenas Nacionales (2008) | Las 364 variantes: nombres, autodenominaciones y localidades | PDF oficial, leído con un programa y verificado por su huella digital | Fija | |
| INALI, Lenguas indígenas nacionales en riesgo de desaparición (2012) | Grado de riesgo de cada variante | PDF oficial, leído con un programa y verificado por su huella digital | Fija |
Ninguna fuente requiere pago ni clave. Lo que una fuente publica bajo sus propias condiciones sigue bajo esas condiciones.
Cómo se resuelve la identidad
Cada fuente nombra las lenguas a su manera. El INALI habla de agrupaciones y variantes; Hugging Face y Common Voice usan códigos ISO 639-3; Glottolog usa sus propios identificadores. Antes de contar nada hay que decidir qué código corresponde a qué agrupación. Esa tabla de correspondencias se hizo una sola vez, a mano, y se verificó contra las referencias cruzadas del propio Glottolog. Todo lo demás la lee automáticamente.
De las 68 agrupaciones, 65 quedaron resueltas: 43 corresponden a una sola lengua de Glottolog, 21 reúnen varias y 1 es una macrolengua. Las 3 restantes (ku'ahl, otomí, zoque) no se resolvieron, y así aparecen en el sitio. Una identidad dudosa se marca; nunca se adivina.
Un error que encontramos
El catálogo de 2008 y el libro de riesgo de 2012 son dos publicaciones del INALI sobre las mismas 364 variantes. Al cruzarlas, 354 nombres coinciden letra por letra. Entre los que no, hay 3 que difieren en una sola palabra, y esa palabra es una dirección: donde una publicación dice «noreste», la otra dice «noroeste».
No es una variante ortográfica. Son dos direcciones distintas. Lo que permite saber que se trata de la misma variante es otra evidencia: el número de localidades que cada publicación le asigna.
| Catálogo de 2008 | Libro de riesgo de 2012 | Localidades (2008) | Localidades (2012) |
|---|---|---|---|
| zapoteco de la Sierra sur, noroeste | zapoteco de la Sierra sur, noreste | 16 | 16 |
| zapoteco de la Sierra sur, noreste alto | zapoteco de la Sierra sur, noroeste alto | 13 | 13 |
| náhuatl del noreste central | náhuatl del noroeste central | 400 | 398 |
Lo más probable es que el error esté en el catálogo de 2008, aunque no podemos descartar que esté en el libro de 2012. No tenemos forma de saberlo desde los documentos.
Por eso no lo corregimos. El sitio conserva el nombre tal como lo imprime el catálogo, vincula cada variante con su renglón del libro de riesgo, y dice en la página de la variante cómo se hizo el vínculo. La discrepancia queda marcada en los datos, a la vista, para que el INALI o cualquier especialista pueda resolverla.
Limitaciones
Lo que conviene saber antes de citar una cifra de este sitio.
- El riesgo y los hablantes son de censos distintos
- Los grados de riesgo se calcularon con el censo de 2000. El número de hablantes que mostramos es del censo de 2020. Entre uno y otro pasaron veinte años: una variante puede estar hoy mejor o peor de lo que dice su grado.
- La mayoría de las variantes no tiene identificador propio
- Solo 136 de las 364 variantes llevan un Glottocode, y es el de su agrupación, no uno propio. Las otras 228 pertenecen a agrupaciones que corresponden a varias lenguas de Glottolog, y no hay una forma confiable de asignarlas. Por eso los recursos digitales se miden por agrupación y no por variante.
- Hay puntos en revisión
- 24 casos esperan una revisión manual: transcripciones con signos de tono que no pudimos confirmar, nombres de municipio que no aparecen en la lista del INEGI, y dos erratas geográficas del catálogo. Mientras tanto, 13 de las 476 transcripciones fonéticas no se publican. Nada de esto se rellenó con una suposición.
- Un umbral del grado de riesgo es inferido
- Las reglas que el INALI publica para asignar los grados reproducen 351 de los 364 grados publicados. Un umbral de niños hablantes de alrededor de 15% reproduce los 364 grados publicados bajo las reglas declaradas para distinguir el grado 2 del 3; el texto del INALI no declara ese valor explícitamente: es una inferencia hecha a partir de los datos, confirmada contra todos los casos conocidos pero no confirmada como la regla real de la fuente. El sitio no la usa: siempre muestra el grado publicado.
- Una columna del libro de riesgo no está explicada
- El libro publica una «proporción de hablantes» por variante sin decir respecto a qué población se calcula. La mostramos como se publica, sin interpretarla.
- Dedicado a la lengua es un criterio nuestro
- Muchos repositorios de Hugging Face etiquetan cientos de lenguas a la vez. Para distinguirlos, contamos aparte los que están etiquetados para tres agrupaciones o menos. Ese corte lo elegimos nosotros; con otro corte las cifras cambiarían.
Licencia
El código es de uso libre bajo la licencia MIT. Los datos que Glototeca produce (la tabla de correspondencias, las instantáneas semanales y los archivos derivados) se publican bajo Creative Commons Atribución 4.0 (CC BY 4.0): se pueden usar y adaptar citando la fuente.
Esa licencia cubre nuestro trabajo, no el de otros. Las cifras del INEGI, los catálogos del INALI y la clasificación de Glottolog pertenecen a sus autores y conservan sus propias condiciones; Glototeca no puede volver a licenciarlos. Quien reutilice esos datos debe consultar y citar la fuente original.
Un caso sigue abierto: los grados de riesgo se extrajeron de un libro del INALI de 2012 que reserva todos los derechos. No se publican bajo CC BY 4.0; su redistribución depende de la respuesta del INALI, y el estado actual está en la página de Datos.
Cómo citar
Si usas estos datos en un artículo, reportaje o investigación, por favor cítalos así.
Rangel, J. (2026). Glototeca: Mapa de recursos digitales de las lenguas indígenas de México [Conjunto de datos]. Recuperado el 5 de octubre de 2026, de https://glototeca.com/
Rangel, Jhonnatan. “Glototeca.” Glototeca, 5 oct. 2026, https://glototeca.com/.
Los datos corresponden a la instantánea del 5 de octubre de 2026.Fecha de consulta: 5 de octubre de 2026
Todavía no hay un DOI permanente. Mientras tanto, cita la dirección del sitio y tu fecha de consulta.
Datos indígenas
Este sitio registra solo metadatos públicos y enlaces: que algo existe, dónde está publicado y cuándo se vio. No copia, aloja ni redistribuye grabaciones, textos ni materiales de ninguna lengua. El contenido privado o resguardado por las comunidades nunca se cuenta.
Un cero en estas tablas no dice que una lengua carezca de recursos. Dice que no hay nada publicado en las fuentes que revisamos. El conocimiento que una comunidad guarda para sí no está aquí, y no debe estar.
Tomamos como guía los principios CARE para la gobernanza de datos indígenas. No los cumplimos por declararlo; esto es lo que hacemos hoy respecto a cada uno:
- Beneficio colectivo
- El sitio es abierto y gratuito, pensado para que las propias comunidades puedan ver dónde está su lengua.
- Autoridad para controlar
- No reunimos datos de las comunidades ni decidimos sobre ellos. Solo señalamos lo que terceros ya publicaron.
- Responsabilidad
- Cada cifra lleva su fuente y su fecha, y los errores que encontramos se marcan en lugar de ocultarse.
- Ética
- No calificamos lenguas ni comunidades con un puntaje, y no presentamos la ausencia de datos como carencia.