[Imágenes de: Adobe Stock]
Cuando hablas con asistentes virtuales como Siri o Alexa, contestan con voces que suenan muy humanas. Pero, ¿cómo es que las computadoras, los teléfonos inteligentes y las aplicaciones hablan como una persona? Utilizan una tecnología llamada conversión de texto a voz.
Cuando hablas, tus pulmones impulsan el aire hacia la tráquea y a través de las cuerdas vocales en tu garganta. Esto hace vibrar las cuerdas vocales, creando así el sonido. Tu cerebro le ordena a tu boca, lengua y labios que den forma a ese sonido para convertirlo en palabras.
Soy ingeniero informático e investigo cómo las computadoras crean experiencias realistas para las personas. Una computadora simula este proceso de producción de palabras habladas. Envía señales eléctricas a una pequeña bocina, que vibra muy rápido. Estas vibraciones empujan el aire que rodea el altavoz, creando ondas sonoras. El software de la computadora controla esas señales eléctricas para dar forma a las ondas sonoras y producir el habla.
Si una computadora quiere decir: “Hola, ¿cómo estás?”, divide cada palabra en fragmentos de sonido llamados fonemas. Los fonemas son los componentes básicos del habla, como los sonidos “sh”, “i corta” y “p” para decir “barco”. El software crea los fonemas y los agrupa en el orden correcto para formar palabras: “Heh”, “lo”, “how”, “r”, “u”. El cerebro y la boca humanos también crean y conectan fonemas.
En el siglo XVIII, la gente empezó a intentar que las máquinas hablaran como los humanos.
Habla robótica
Allá por el siglo XVIII, los inventores intentaron que las máquinas funcionaran como nuestros pulmones y garganta. Utilizaban fuelles (una bolsa grande que se podía apretar) para impulsar el aire desde su interior a través de tubos, silbatos y conductos de cuero. Los sonidos resultantes eran chirriantes, extraños e inquietantes.
Las primeras máquinas de voz electrónicas, llamadas sintetizadores, se construyeron en la década de 1930. Una máquina famosa fue Voder, que hizo su debut en la Feria Mundial de 1939 en la ciudad de Nueva York. Voder tenía la apariencia de un órgano. Una persona tenía que presionar botones electrónicos, teclas y pedales para que emitiera frases básicas como “¡Buenos días!”.
En la década de 1960, las computadoras comenzaron a hablar combinando fonemas, creando un habla rígida y robótica.
Piezas de un rompecabezas
Las voces de las computadoras antiguas a menudo sonaban robóticas y entrecortadas, como “hola-humano-soy-una-computadora”. Esto se debía a que los programas informáticos antiguos tenían que unir pequeños sonidos que se habían extraído de grabaciones de voz. Estos mapas, llamados espectrogramas, se parecen a gráficos con picos y valles que representan la intensidad de cada tono en cada instante en que se producía un sonido.
Los programas unían los mapas como piezas de un rompecabezas y los convertían de nuevo en sonidos. Ese método funcionaba, pero sonaba muy poco natural.
Las primeras grabaciones de voz sintetizadas por ordenador sonaban rígidas y robóticas.
Las computadoras actuales utilizan machine learning, un tipo de inteligencia artificial, para imitar la voz humana. Ingenieros y científicos entrenan un programa de IA proporcionándole muchas horas de grabaciones de personas reales hablando. El software de aprendizaje automático analiza patrones en el habla, desde la forma en que las personas respiran hasta cuando ríen y cómo su voz se vuelve más aguda cuando se emocionan.
Estos patrones permiten que la computadora transforme los fonemas en palabras y oraciones de todas las maneras sutiles en que lo hacen las personas.
Esta tecnología avanzada permite incluso que un sofisticado ordenador con inteligencia artificial escuche una grabación de tu voz durante tan solo unos segundos, aprenda tus patrones de habla exactos y los copie. A continuación, puede pronunciar frases que nunca has dicho, con una voz idéntica a la tuya.
Voces útiles y voces perjudiciales
El software de conversión de texto a voz ayuda a millones de personas cada día. En los automóviles, proporciona indicaciones para que los conductores puedan mantener la vista en la carretera. Puede leer artículos de noticias y sitios web para personas ciegas, y puede dar voz a quienes no pueden hablar.
Al igual que otras tecnologías potentes, este software también puede ser mal utilizado. Los programas avanzados pueden crear voces falsas muy realistas, a veces llamadas deepfakes de audio . Estas voces sintéticas pueden sonar casi idénticas a la voz de una persona real, aprendiendo a partir de una breve muestra de su habla.
Los estafadores pueden usar esta tecnología para suplantar la identidad de familiares, compañeros de trabajo o celebridades. Pueden realizar llamadas telefónicas o dejar mensajes de voz para engañar a la gente y hacerles creer información falsa. Científicos e ingenieros están trabajando en herramientas que puedan identificar voces falsas para ayudar a detener a los estafadores.
Así que la próxima vez que oigas un teléfono, una computadora o un videojuego hablar con voz humana, ¡ya sabes cómo lo ha conseguido sin tener pulmones, cuerdas vocales, labios ni lengua!
![[Imagen: envato]](https://fc-bucket-100.s3.amazonaws.com/wp-content/uploads/2026/08/14113319/aws-summit-cdmx-ia-adopcion.jpg)
![[Foto: Xcaret]](https://fc-bucket-100.s3.amazonaws.com/wp-content/uploads/2026/08/12145104/C8B825B0-3504-4DF6-A2EF-7D099025C49A.jpeg)
![[Imagen por: Frida Quiñones / Fast Company México]](https://fc-bucket-100.s3.amazonaws.com/wp-content/uploads/2026/08/14102853/ChatGPT-Image-Aug-14-2026-10_28_33-AM.png)