← Volver al glosario

Text-to-Speech (TTS)

Tecnología que convierte texto escrito en voz sintetizada. Los sistemas actuales, basados en redes neuronales, producen voces con entonación y ritmo cercanos a los de un locutor humano, en decenas de idiomas.

Text-to-speech (TTS), o síntesis de voz, es la tecnología que transforma texto en audio hablado. Las generaciones antiguas sonaban robóticas porque pegaban fragmentos de grabaciones; los sistemas actuales usan redes neuronales que generan la onda sonora desde cero, aprendiendo entonación, pausas y emoción a partir de miles de horas de habla real. En las mejores herramientas, el resultado es difícil de distinguir de un locutor humano.

Recursos que diferencian a las plataformas modernas:

  • Variedad de voces e idiomas, incluidos acentos regionales.
  • Clonación de voz: crear una voz sintética a partir de muestras de una voz real, útil para una narración consistente, y sensible desde el punto de vista ético (exige el consentimiento de la persona clonada).
  • Control de estilo: ajustar velocidad, énfasis, pausas y emoción.
  • API: generar audio de forma programática, para dar voz a chatbots y asistentes.

Los usos van de la accesibilidad (lectores de pantalla, audiodescripción) a la producción de contenido: narración de videos, audiolibros, podcasts, cursos y sistemas telefónicos automatizados. Es el camino inverso del *speech-to-text* (transcripción).

Ejemplo concreto: un creador de contenido escribe el guion de un video educativo, pega el texto en una herramienta como ElevenLabs o Murf, elige una voz en español y descarga la narración lista en minutos, sin estudio ni micrófono.

Categorías

Ver también