Text-to-Speech (TTS)
Tecnologia que converte texto escrito em fala sintetizada. Os sistemas atuais, baseados em redes neurais, produzem vozes com entonação e ritmo próximos aos de um locutor humano, em dezenas de idiomas.
Text-to-speech (TTS), ou síntese de voz, é a tecnologia que transforma texto em áudio falado. As gerações antigas soavam robóticas porque colavam pedaços de gravações; os sistemas atuais usam redes neurais que geram a onda sonora do zero, aprendendo entonação, pausas e emoção a partir de milhares de horas de fala real. O resultado, nas melhores ferramentas, é difícil de distinguir de um locutor humano.
Os recursos que diferenciam as plataformas modernas:
- Variedade de vozes e idiomas, incluindo sotaques regionais (como português brasileiro).
- Clonagem de voz: criar uma voz sintética a partir de amostras de uma voz real, útil para narração consistente, e sensível do ponto de vista ético (exige consentimento de quem é clonado).
- Controle de estilo: ajustar velocidade, ênfase, pausas e emoção.
- API: gerar áudio programaticamente, para dar voz a chatbots e assistentes.
Os usos vão de acessibilidade (leitores de tela, audiodescrição) a produção de conteúdo: narração de vídeos, audiolivros, podcasts, cursos e atendimentos telefônicos automatizados. É o caminho inverso do *speech-to-text* (transcrição).
Exemplo concreto: um criador de conteúdo escreve o roteiro de um vídeo educativo, cola o texto numa ferramenta como ElevenLabs ou Murf, escolhe uma voz em português e baixa a narração pronta em minutos, sem estúdio nem microfone.