Tachiwin obtiene el 5.º lugar en el PaddleOCR Global Derivative Model Challenge

Nos complace anunciar que nuestro fundador, Luis Javier, recibió el 5.º lugar en el PaddleOCR Global Derivative Model Challenge, parte del 10.º Hackathon PaddlePaddle, por su solución y contribuciones de código alrededor del reconocimiento óptico de caracteres (OCR) para las lenguas originarias de México. 🎉
El desafío propuso construir modelos derivados mediante el ajuste fino de la serie PaddleOCR-VL, enfocándose en escenarios especializados de OCR. Tachiwin participó con el tema "Indigenous Languages of Mexico", demostrando que un modelo de código abierto puede reconocer correctamente los caracteres latinos no estándar, glotales, tonos y diacríticos que los OCR genéricos suelen omitir o distorsionar.
Esta distinción se suma al reconocimiento de nuestro modelo Tachiwin OCR 1.5, entrenado sobre la base PaddleOCR-VL-1.5 con el conjunto de datos tachiwin/multilingual_ocr_llm_2 (55 200 imágenes). Los resultados hablan por sí mismos:
- Tasa de error de caracteres (CER): de 17.65% a 2.03% frente al modelo base.
- Tasa de error de palabras (WER): de 38.59% a 3.60%.
- 14 de 21 lenguas evaluadas alcanzan un 0.00% de CER.
Que una iniciativa sin fines de lucro, comunitaria y de origen indígena logre destacar entre una comunidad global de desarrollo demuestra la viabilidad de soluciones de vanguardia incluso con recursos limitados. 💙
Agradecemos a la comunidad PaddlePaddle por el reconocimiento y por impulsar el acceso tecnológico para las lenguas originarias. Este logro refuerza nuestro compromiso de seguir poniendo la tecnología al servicio de las comunidades hablantes y de las 68 lenguas nacionales y sus variantes.
Conoce la convocatoria y los detalles del desafío en el Issue de PaddleOCR #17858, y prueba el modelo en línea en nuestro demo de OCR multilingüe.
Si quieres que sigamos avanzando, puedes apoyar nuestro esfuerzo en tachiwin.org/donate.