Método

Qué mide Glototeca, de dónde salen los datos, cómo se decide que dos nombres son la misma lengua, y qué no sabemos todavía.

Qué mide y qué no

Glototeca registra, una vez por semana, qué recursos digitales públicos existen para cada una de las 68 agrupaciones lingüísticas del catálogo del INALI: conjuntos de datos, modelos, corpus de voz, treebanks y soporte en una herramienta de reconocimiento de voz. Los pone junto a dos datos de contexto: cuántas personas hablan la lengua y qué tan en riesgo está.

Mide presencia en fuentes públicas, no calidad ni utilidad. Que una lengua tenga un conjunto de datos no dice si es bueno, si la comunidad lo conoce o si le sirve. Y que no aparezca nada no significa que no exista nada: significa que nada aparece en las fuentes que revisamos.

Los cuatro estados de un valor

3
Medido

Ayapaneco: 3 conjuntos de datos en Hugging Face llevan su etiqueta. →

0
Revisado, sin resultados

Ayapaneco: se revisó Universal Dependencies, que podría contener un treebank de cualquier lengua, y no hay ninguno. Es un cero de verdad. →

La fuente no cubre esta lengua
La fuente no cubre esta lengua

Ayapaneco: Common Voice publica una lista cerrada de lenguas y esta no está en ella. No es un cero: la fuente no la contempla. →

Identidad sin resolver
Identidad sin resolver

Ku’ahl: no tiene código ISO 639-3, así que no hay con qué buscarlo en ninguna fuente. El valor se desconoce y así se muestra. →

Sin puntaje único

Los indicadores nunca se combinan en una calificación. Sumar conjuntos de datos con treebanks, o ponderar uno contra otro, produciría un número que parece preciso y no significa nada. Cada indicador se muestra por separado, con su fuente y su fecha.

México es el piloto. La meta a largo plazo es aplicar el mismo método a todas las lenguas de la lista de referencia de Glottolog (7,674 lenguas habladas en la versión 5.3); hoy el sitio solo cubre México.

De dónde vienen los datos

Ocho fuentes, todas públicas y sin costo. Cinco se consultan cada semana; tres son publicaciones fijas que se cargaron una vez. La instantánea más reciente es del 5 oct 2026.

FuenteQué aportaCómo se obtieneFrecuenciaVersión registrada
GlottologIdentidad de cada lengua y su estado de amenazaVersión fechada, descargada de Zenodo y fijada por su DOISemanalglottolog 5.3 (doi:10.5281/zenodo.18840967)
Hugging FaceConjuntos de datos y modelos etiquetados con la lenguaAPI pública, sin cuentaSemanal5 oct 2026
Common VoiceSi hay corpus de voz y de cuántas variedadesMetadatos de cada versión, publicados en GitHubSemanalcommon-voice scripted 27.0 (2026-09-11), spontaneous 5.0 (2026-09-11)
Universal DependenciesTreebanks publicadosVersiones semestrales en GitHubSemanaluniversal-dependencies 2.18 (2026-05-15)
Omnilingual ASRSi el modelo de reconocimiento de voz declara soporteLista de lenguas del propio modelo, por códigoSemanalomnilingual-asr lang_ids.py @ a7fb36017a (2025-11-10)
INEGI, Censo 2020Hablantes de 3 años y más, por lenguaTabulado oficial del censo, descargado una vezFijaINEGI Censo de Población y Vivienda 2020, cpv2020_b_eum_05_etnicidad.xlsx sheet 03
INALI, Catálogo de las Lenguas Indígenas Nacionales (2008)Las 364 variantes: nombres, autodenominaciones y localidadesPDF oficial, leído con un programa y verificado por su huella digitalFijaPDF
INALI, Lenguas indígenas nacionales en riesgo de desaparición (2012)Grado de riesgo de cada variantePDF oficial, leído con un programa y verificado por su huella digitalFijaPDF

Ninguna fuente requiere pago ni clave. Lo que una fuente publica bajo sus propias condiciones sigue bajo esas condiciones.

Cómo se resuelve la identidad

Cada fuente nombra las lenguas a su manera. El INALI habla de agrupaciones y variantes; Hugging Face y Common Voice usan códigos ISO 639-3; Glottolog usa sus propios identificadores. Antes de contar nada hay que decidir qué código corresponde a qué agrupación. Esa tabla de correspondencias se hizo una sola vez, a mano, y se verificó contra las referencias cruzadas del propio Glottolog. Todo lo demás la lee automáticamente.

De las 68 agrupaciones, 65 quedaron resueltas: 43 corresponden a una sola lengua de Glottolog, 21 reúnen varias y 1 es una macrolengua. Las 3 restantes (ku'ahl, otomí, zoque) no se resolvieron, y así aparecen en el sitio. Una identidad dudosa se marca; nunca se adivina.

Un error que encontramos

El catálogo de 2008 y el libro de riesgo de 2012 son dos publicaciones del INALI sobre las mismas 364 variantes. Al cruzarlas, 354 nombres coinciden letra por letra. Entre los que no, hay 3 que difieren en una sola palabra, y esa palabra es una dirección: donde una publicación dice «noreste», la otra dice «noroeste».

No es una variante ortográfica. Son dos direcciones distintas. Lo que permite saber que se trata de la misma variante es otra evidencia: el número de localidades que cada publicación le asigna.

Catálogo de 2008Libro de riesgo de 2012Localidades (2008)Localidades (2012)
zapoteco de la Sierra sur, noroestezapoteco de la Sierra sur, noreste1616
zapoteco de la Sierra sur, noreste altozapoteco de la Sierra sur, noroeste alto1313
náhuatl del noreste centralnáhuatl del noroeste central400398

Lo más probable es que el error esté en el catálogo de 2008, aunque no podemos descartar que esté en el libro de 2012. No tenemos forma de saberlo desde los documentos.

Por eso no lo corregimos. El sitio conserva el nombre tal como lo imprime el catálogo, vincula cada variante con su renglón del libro de riesgo, y dice en la página de la variante cómo se hizo el vínculo. La discrepancia queda marcada en los datos, a la vista, para que el INALI o cualquier especialista pueda resolverla.

Limitaciones

Lo que conviene saber antes de citar una cifra de este sitio.

El riesgo y los hablantes son de censos distintos
Los grados de riesgo se calcularon con el censo de 2000. El número de hablantes que mostramos es del censo de 2020. Entre uno y otro pasaron veinte años: una variante puede estar hoy mejor o peor de lo que dice su grado.
La mayoría de las variantes no tiene identificador propio
Solo 136 de las 364 variantes llevan un Glottocode, y es el de su agrupación, no uno propio. Las otras 228 pertenecen a agrupaciones que corresponden a varias lenguas de Glottolog, y no hay una forma confiable de asignarlas. Por eso los recursos digitales se miden por agrupación y no por variante.
Hay puntos en revisión
24 casos esperan una revisión manual: transcripciones con signos de tono que no pudimos confirmar, nombres de municipio que no aparecen en la lista del INEGI, y dos erratas geográficas del catálogo. Mientras tanto, 13 de las 476 transcripciones fonéticas no se publican. Nada de esto se rellenó con una suposición.
Un umbral del grado de riesgo es inferido
Las reglas que el INALI publica para asignar los grados reproducen 351 de los 364 grados publicados. Un umbral de niños hablantes de alrededor de 15% reproduce los 364 grados publicados bajo las reglas declaradas para distinguir el grado 2 del 3; el texto del INALI no declara ese valor explícitamente: es una inferencia hecha a partir de los datos, confirmada contra todos los casos conocidos pero no confirmada como la regla real de la fuente. El sitio no la usa: siempre muestra el grado publicado.
Una columna del libro de riesgo no está explicada
El libro publica una «proporción de hablantes» por variante sin decir respecto a qué población se calcula. La mostramos como se publica, sin interpretarla.
Dedicado a la lengua es un criterio nuestro
Muchos repositorios de Hugging Face etiquetan cientos de lenguas a la vez. Para distinguirlos, contamos aparte los que están etiquetados para tres agrupaciones o menos. Ese corte lo elegimos nosotros; con otro corte las cifras cambiarían.

Licencia

El código es de uso libre bajo la licencia MIT. Los datos que Glototeca produce (la tabla de correspondencias, las instantáneas semanales y los archivos derivados) se publican bajo Creative Commons Atribución 4.0 (CC BY 4.0): se pueden usar y adaptar citando la fuente.

Esa licencia cubre nuestro trabajo, no el de otros. Las cifras del INEGI, los catálogos del INALI y la clasificación de Glottolog pertenecen a sus autores y conservan sus propias condiciones; Glototeca no puede volver a licenciarlos. Quien reutilice esos datos debe consultar y citar la fuente original.

Un caso sigue abierto: los grados de riesgo se extrajeron de un libro del INALI de 2012 que reserva todos los derechos. No se publican bajo CC BY 4.0; su redistribución depende de la respuesta del INALI, y el estado actual está en la página de Datos.

Cómo citar

Si usas estos datos en un artículo, reportaje o investigación, por favor cítalos así.

APA 7

Rangel, J. (2026). Glototeca: Mapa de recursos digitales de las lenguas indígenas de México [Conjunto de datos]. Recuperado el 5 de octubre de 2026, de https://glototeca.com/

MLA 9

Rangel, Jhonnatan. “Glototeca.” Glototeca, 5 oct. 2026, https://glototeca.com/.

Los datos corresponden a la instantánea del 5 de octubre de 2026.Fecha de consulta: 5 de octubre de 2026

Todavía no hay un DOI permanente. Mientras tanto, cita la dirección del sitio y tu fecha de consulta.

Datos indígenas

Este sitio registra solo metadatos públicos y enlaces: que algo existe, dónde está publicado y cuándo se vio. No copia, aloja ni redistribuye grabaciones, textos ni materiales de ninguna lengua. El contenido privado o resguardado por las comunidades nunca se cuenta.

Un cero en estas tablas no dice que una lengua carezca de recursos. Dice que no hay nada publicado en las fuentes que revisamos. El conocimiento que una comunidad guarda para sí no está aquí, y no debe estar.

Tomamos como guía los principios CARE para la gobernanza de datos indígenas. No los cumplimos por declararlo; esto es lo que hacemos hoy respecto a cada uno:

Beneficio colectivo
El sitio es abierto y gratuito, pensado para que las propias comunidades puedan ver dónde está su lengua.
Autoridad para controlar
No reunimos datos de las comunidades ni decidimos sobre ellos. Solo señalamos lo que terceros ya publicaron.
Responsabilidad
Cada cifra lleva su fuente y su fecha, y los errores que encontramos se marcan en lugar de ocultarse.
Ética
No calificamos lenguas ni comunidades con un puntaje, y no presentamos la ausencia de datos como carencia.