[Imagen por: Frida Quiñones / Fast Company México]
Un video publicado esta semana en redes sociales puso a circular algo que hasta hace poco sonaba a ciencia ficción: alguien firmando frente a un teléfono y viendo, casi al instante, cómo esas señas se convierten en texto en pantalla. No es una animación conceptual: es SL2T (Sign Language to Text), el modelo de Google DeepMind que llegó con la serie Pixel 11 y que, a diferencia del reconocimiento automático del habla tradicional, pensado para convertir voz en texto, traduce directamente movimiento en texto. Es apenas la pieza más visible de un movimiento mucho más amplio por la accesibilidad educativa: decenas de equipos, universidades, startups y gobiernos, compitiendo por resolver, con inteligencia artificial, uno de los problemas de accesibilidad y calidad de vida más persistentes del mundo.
¿Cómo funciona SL2T?, el modelo detrás del Pixel 11
El sistema trabaja en dos pasos pensados para proteger la privacidad de quien lo usa. Primero, directamente en el dispositivo, un modelo de computer vision llamado Media Pipe Holistic convierte los movimientos de manos, rostro y cuerpo en 130 coordenadas geométricas (un esqueleto digital). El video original se descarta de inmediato; solo esas coordenadas se envían a los servidores de Google, donde una red neuronal tipo transformer genera el texto en inglés mientras la persona sigue filmando.
Lo relevante no es solo la arquitectura, sino la decisión de diseño detrás de ella. Los sistemas anteriores de sign language recognition (SLR) dependían de “glosas”: etiquetas de palabras asignadas a cada seña individual. El problema es que las lenguas de señas tienen gramáticas propias, independientes del idioma hablado del país donde se usan , el ASL, por ejemplo, comparte más estructura sintáctica con el japonés que con el inglés. SL2T se salta ese paso intermedio y traduce directamente de movimiento a texto fluido, entrenado con más de 100 mil horas de video en más de 50 lenguas de señas.
¿Qué puede hacer hoy y qué no?
Por ahora, SL2T solo traduce lengua de señas estadounidense (ASL) a inglés, y vive dentro de Gboard y Live Transcribe. El modelo procesa clips de máximo 60 segundos, pierde precisión con señas poco frecuentes o mala iluminación, y Google, junto con su comité asesor AISLAC, integrado por organizaciones como la National Association of the Deaf, desaconseja usarlo en consultas médicas, procesos legales, entrevistas de trabajo o trámites gubernamentales. En esos contextos, el intérprete humano certificado sigue siendo insustituible.
El panorama internacional: ¿quién más está construyendo esto?
Google no es el primero ni el único. La traducción automática de lengua de señas pasó de ser un experimento de laboratorio a un campo de investigación en plena expansión: solo en 2026, publicaciones especializadas como IEEE Xplore y ScienceDirect documentaron nuevas revisiones sistemáticas de modelos de deep learning y machine learning aplicados al reconocimiento automático de lengua de señas, evidencia de que el tema ya es una disciplina científica consolidada, no una curiosidad técnica.
Fuera de los laboratorios, ya hay productos operando. Hand Talk, de Brasil, ofrece a “Hugo”, un avatar itérprete que traduce texto y voz a lengua de señas portuguesa y ASL, y es una de las apps de accesibilidad más usadas de América Latina. Signvrse, una startup keniana respaldada por el Google.org Accelerator y el Microsoft Imagine Cup, entrena avatares 3D con captura de movimiento de intérpretes reales para su plataforma educativa Terp360, diseñada para escalar la interpretación a miles de estudiantes de forma simultánea en clases virtuales. Y en julio de 2026, la firma italiana QuestIT presentó ante el Parlamento Europeo un avatar de IA entrenado con 8,000 videos y validado junto con la asociación nacional de personas sordas de Italia, ya en pruebas en las estaciones de tren de Roma y Milán.
El patrón se repite: los países y empresas con más avance combinan tres cosas que en otros contextos escasean, financiamiento sostenido, participación directa de comunidades sordas en el diseño y validación del modelo, y una vía clara hacia el despliegue público, no solo la tecnología en sí.
¿Y en México? Los proyectos que ya existen
En México también se está construyendo tecnología similar, pero se concentra casi por completo en el ámbito universitario y de proyectos estudiantiles, todavía lejos de convertirse en producto con usuarios masivos.
- Auris, del Tecnológico de Monterrey (campus Santa Fe): un ecosistema de dos apps creado por las estudiantes Cynthia Hanael Castro y Nadja Xareny Alamán, que conecta a especialistas en LSM con personas sordas que necesitan interpretación en tiempo real para clases o conferencias. Sigue en fase de prototipo, presentado en la competencia PrepApps 2023.
- Equipos de los campus Puebla y Sonora Norte del Tec de Monterrey desarrollaron, por separado, traductores de LSM con IA como proyectos escolares o de emprendimiento estudiantil.
- Un estudio publicado en Scielo México documenta un software de traducción de LSM entrenado con redes convolucionales (YOLOv8) y MediaPipe que alcanzó 90% de precisión (mAP50) reconociendo letras, números y vocabulario, además de un módulo de reconocimiento de objetos del entorno.
- La revista académica RIDE publicó una investigación sobre una aplicación móvil basada en deep learning para el reconocimiento y traducción de LSM, orientada explícitamente a la inclusión educativa.
- La Universidad Tecnológica de León publicó en su revista Reaxión un análisis sobre el desarrollo de un traductor de LSM mediante reconocimiento de patrones.
- El recurso público más consolidado sigue siendo “Manos con Voz“, el diccionario de LSM de 240 páginas de CONAPRED: no usa IA, pero es exactamente el tipo de recurso lingüístico validado que un futuro modelo de reconocimiento necesitaría como base de entrenamiento.
Ninguno de estos proyectos mexicanos ha alcanzado todavía la escala, el financiamiento o el respaldo institucional de SL2T, Hand Talk, Signvrse o QuestIT. Son, en su mayoría, tesis, artículos científicos y prototipos técnicamente sólidos , sin la infraestructura ni las alianzas público-privadas necesarias para llegar a un salón de clases real.
La brecha educativa que la tecnología busca cerrar
En México viven cerca de 2.3 millones de personas con discapacidad auditiva, según cifras retomadas del INEGI. Entre las personas sordas mayores de 15 años, 19% no sabe leer ni escribir (cerca de 1.2 millones de personas) una tasa casi cuatro veces mayor que la de la población general sin discapacidad. En el rango de edad de educación básica a superior (12 a 22 años), 75% de las personas con discapacidad no recibió educación formal.
El origen del problema, según especialistas citados por La Crónica de Hoy, no es la sordera en sí, sino la falta de acceso temprano a una lengua completa: cuando un niño o niña no adquiere lenguaje en sus primeros años de vida, llega a la escuela sin herramientas lingüísticas ni cognitivas. La LSM fue reconocida legalmente en México desde 2005, pero su integración en el sistema educativo sigue siendo limitada, fragmentada y, en muchos casos, más simbólica que real, se ve agravada por la escasez de maestros bilingües (LSM-español) e intérpretes certificados en las aulas.
El siguiente paso hacia la accesibilidad educativa: un avatar-intérprete para el salón de clases mexicano
Los modelos internacionales ya trazan una ruta técnica viable para cerrar esta brecha de accesibilidad educativa en México. El caso de Signvrse es el más cercano a lo que un e-learning inclusivo mexicano necesitaría: una plataforma donde las clases (grabadas o en vivo) se procesan primero con reconocimiento automático del habla (ASR, por sus siglas en inglés, el término técnico de speech to text) para convertir el audio en texto, y ese texto se traduce después a LSM mediante un modelo de generación de señas que anima a un avatar intérprete en pantalla, sincronizado con el video de la clase.
Ninguna pieza de esa cadena es hipotética por separado: el reconocimiento de voz y los subtítulos automáticos ya son maduros; el reconocimiento de LSM vía computer vision ya existe en prototipos como el de Scielo México y el de RIDE; y los modelos de animación de avatar ya funcionan en producción en Signvrse y QuestIT. Lo que falta en México no es la tecnología base, sino integrarla en una sola plataforma, entrenada y validada específicamente con la gramática de la LSM ,que, como muestra la arquitectura de SL2T, no puede simplemente adaptarse de un modelo en ASL o Libras sin perder precisión y construida junto con la comunidad sorda, no solo para ella, siguiendo el mismo principio que QuestIT aplicó junto a la asociación nacional de sordos de Italia y que el propio comité AISLAC de Google exige para SL2T.
Hecho así, un avatar-intérprete de este tipo no sustituiría al maestro bilingüe ni al intérprete certificado que la ley mexicana ya exige en la educación inclusiva: los complementaría, llevando apoyo lingüístico a las clases y regiones donde hoy simplemente no hay ningún intérprete disponible, que, de acuerdo con las cifras de arriba, son la mayoría.
Una pieza más de una apuesta más grande
SL2T no aparece en el vacío. Es parte de una estrategia de Google que ha ido colocando modelos como Gemini 3 en cada capa de sus productos, y que también se ha usado para atender brechas de comunicación en lenguas indígenas y comunidades lingüísticas minoritarias. La traducción de lengua de señas es, en ese sentido, otra frontera del mismo problema: hacer que el lenguaje, hablado, escrito o gestual, deje de ser una barrera de acceso a la educación y a la tecnología. Que la primera demostración pública se haya vuelto viral en Instagram antes que en cualquier keynote dice algo sobre dónde está aterrizando hoy la conversación sobre inteligencia artificial: no solo en productividad, sino en accesibilidad educativa medible, en personas concretas.
![[Fotos: Galar/Galería Arquitectura/ @galar.galeriaarquitectura ]](https://fc-bucket-100.s3.amazonaws.com/wp-content/uploads/2026/08/14103219/p-1-91586240-bio-lamp-made-from-bacteria.webp)
![[Imagen: envato]](https://fc-bucket-100.s3.amazonaws.com/wp-content/uploads/2026/08/14113319/aws-summit-cdmx-ia-adopcion.jpg)
![[Imágenes de: Adobe Stock]](https://fc-bucket-100.s3.amazonaws.com/wp-content/uploads/2026/08/14015515/p-91587783-computers-and-text-to-speech.webp)