Proyectos

Tiyat

Primer modelo de IA para las lenguas originarias de México

Tiyat es el primer modelo fundacional de Inteligencia Artificial tipo LLM-nano entrenado desde cero con una representación mayoritaria de lenguas originarias de México. Completamente reproducible y open-source.

Este modelo no es una adaptación o finetuning sobre otros modelos existentes ya que fue entrenado desde cero incluyendo el tokenizador especializado en lenguas originarias de México y otros avances previos como la digitalización avanzada de documentos.

Lee el artículo completo para saber más detalles sobre su desarrollo.

¿Para qué sirve?

Tiyat demuestra que es posible construir desde cero un modelo generativo donde las lenguas originarias no sean una presencia marginal. Integra en un mismo experimento la digitalización de documentos, un corpus multilingüe, un tokenizador propio y una arquitectura Transformer entrenada con pesos aleatorios.

El modelo sirve como una plataforma de investigación para:

  • estudiar qué patrones lingüísticos aprende un modelo pequeño entre distintas lenguas y variantes;
  • evaluar una tokenización diseñada desde los datos de Tachiwin, en vez de heredar un vocabulario centrado en inglés;
  • ampliar el preentrenamiento conforme crezca el corpus;
  • desarrollar posteriormente capacidades de seguimiento de instrucciones, conversación y traducción;
  • ofrecer un proceso que comunidades, desarrolladorxs e investigadorxs puedan revisar, reproducir y adaptar.

Tiyat todavía no es un asistente como ChatGPT ni un traductor terminado. Es un modelo base de predicción del siguiente token: la primera capa de una línea de investigación más amplia hacia una IA capaz de identificar, traducir y conversar en las lenguas originarias de México y sus variantes.

¿Cómo se usa?

Tiyat funciona como un sistema de autocompletado. La persona escribe el inicio de un texto y el modelo genera una continuación token por token. Para obtener resultados más estables conviene proporcionar varias palabras que indiquen la lengua, el tema y el estilo esperado, por ejemplo:

Había una vez un gato que...

Las demostraciones públicas permiten definir la longitud de la continuación y ajustar parámetros de generación. Los prompts demasiado breves pueden producir mezclas entre lenguas o variantes; las generaciones largas también pueden perder coherencia o repetir fragmentos. Estos comportamientos forman parte de los límites que deben documentarse y evaluarse con participación de hablantes.

Puede probarse en línea através de Hugging Face o ModelScope mediante los enlaces de esta página. Al ser servicios comunitarios gratuitos, la demostración puede tardar en iniciar después de un periodo de inactividad.

Arquitectura y escala

Tiyat arch1 es un Transformer decoder-only de aproximadamente 180 millones de parámetros. Emplea atención causal y aprende a predecir cada token sin observar las posiciones futuras. Su escala es comparable con la de los primeros modelos GPT-2, pero utiliza una arquitectura, un vocabulario y una distribución lingüística propios.

CaracterísticaTiyat arch1
Tipo de modeloTransformer decoder-only
Parámetros~180 millones
Bloques Transformer12
Dimensión de embeddings768
Cabezas de atención24
Dimensión feed-forward3072
Ventana de contexto918 tokens
Vocabulario64 mil tokens
Embeddings de entrada y salidaIndependientes
Objetivo de entrenamientoPredicción del siguiente token

Es un modelo nano: miles de veces menor que los modelos comerciales de frontera. Esta escala permite estudiar el ciclo completo de entrenamiento, repetir experimentos y ejecutar inferencias con recursos más accesibles. La ventana de 918 tokens fue elegida a partir de la longitud de los ejemplos del corpus, no por copiar una dimensión convencional. Asimismo, Tiyat mantiene separados los embeddings de entrada y salida, una decisión derivada de los resultados de nuestros experimentos multilingües.

Datos y entrenamiento

El modelo fue entrenado con cerca de 300 millones de tokens, menos de dos tokens por parámetro. Esto indica que su desarrollo está limitado principalmente por la cantidad de datos: la arquitectura aún puede aprovechar nuevas rondas de digitalización y preentrenamiento antes de requerir un aumento considerable de tamaño.

Categoría del corpusProporción objetivo
Lenguas originarias de México70%
Español7.5%
Inglés7.5%
Código15%

Reservar el 70% de la mezcla para lenguas originarias cambia el punto de partida habitual de los LLM generalistas, donde el inglés concentra la mayor parte de los datos. El español y el inglés aportan conexiones con recursos abundantes, mientras que el código incorpora estructuras formales.

El entrenamiento se realizó por sesiones en una GPU NVIDIA T4 de 16 GB mediante el nivel gratuito de Google Colab. Los checkpoints conservan el modelo, el optimizador y la posición en los datos para continuar cada sesión sin reiniciar el proceso. El código, los pesos, el tokenizador y los cuadernos se publican de forma abierta para que Tiyat pueda auditarse, reproducirse y convertirse en tierra fértil para nuevos desarrollos.