Volver al inicio

Calidad de voz

Cómo corregir la pronunciación en texto a voz

FreeTextoSpeech Team

Los fallos de pronunciación al convertir texto a voz casi nunca se deben a un problema del modelo o de la voz, sino a ambigüedades en el texto escrito. Una persona que lee un guion deduce de inmediato si «05/09» representa una fecha, si «$12.50» es una cantidad de dinero o si «Dr.» corresponde a doctor o a dirección. Para un modelo de síntesis de voz, en cambio, cada símbolo representa varias lecturas posibles. La solución más fiable consiste en preparar una versión fonética o hablada del guion, manteniendo siempre el texto original a mano para cotejarlo.

Esta guía recoge un flujo de trabajo práctico: localizar las palabras de riesgo, transcribir los símbolos en palabras habladas, probar una sola frase de muestra, guardar las soluciones en un glosario del proyecto y regenerar únicamente la parte que requiera corrección.

Flujo de pronunciación en tres pasos: marcar el guion, escribir la guía fonética y escuchar la muestra
Identifica primero las palabras dudosas, escribe cómo deben sonar y previsualiza un fragmento breve antes de procesar la locución completa.

Empieza por los términos que marcan la diferencia

No hace falta revisar cada frase con el mismo nivel de detalle. Conviene centrar la atención en nombres propios, marcas comerciales, topónimos, siglas, unidades de medida, fechas, horas, importes, correos electrónicos y direcciones web. Esos son justo los elementos que cualquier oyente detecta al instante si suenan mal.

Antes de procesar la grabación definitiva, comprueba esas palabras complejas en el generador de ortografía fonética. En el caso de nombres extranjeros o poco habituales, separa la palabra en sílabas cotidianas y resalta la que lleva el golpe de voz: por ejemplo, un nombre en inglés como «Siobhan» puede escribirse como «shiv-ÓN» o «shih-VAWN», y un término como «Cognitive» puede anotarse según el idioma de la voz elegida.

Un primer barrido metódico:

  1. Lee el guion completo de corrido para entender el contexto.
  2. Marca cualquier término o símbolo que un locutor desconocido podría dudar al leer.
  3. Escribe la versión hablada exacta justo al lado del original.
  4. Guarda ambas versiones en las notas de producción para que cualquier editor pueda revertir los cambios si hace falta.

Si varias personas del equipo van a generar fragmentos de audio a partir del mismo guion, acuerden una versión hablada definitiva. Si una persona transcribe «IA» deletreado como «i-a» y otra lo amplía a «inteligencia artificial», los cortes finales sonarán incoherentes.

Transcribe los símbolos en palabras habladas

Los modelos de síntesis no interpretan una página con sentido común: leen secuencias de caracteres y eligen una lectura estadística.

En vez de dejar $12.50, escribe «doce dólares con cincuenta centavos» (o «doce euros con cincuenta», según la moneda local); en vez de 09:30, escribe «nueve y media de la mañana»; y en las direcciones web, anota exactamente las palabras que quieres que se escuchen. Si una sigla es ambigua, desarróllala o sepárala con guiones o espacios. Conserva siempre el texto original junto al texto adaptado para la locución.

Sustituciones habituales que evitan casi todos los tropiezos:

  • Fechas: 14/08/2026 conviene escribirlo como «catorce de agosto de dos mil veintiséis».
  • Horas: 18:00 o 6:00 PM se convierte en «seis de la tarde».
  • Monedas: $1,200 pasa a ser «mil doscientos dólares».
  • Unidades: 3.5kg se transcribe como «tres coma cinco kilogramos» o «tres kilos y medio».
  • Direcciones web: freetexttospeech.net/blog se lee mejor como «free text to speech punto net barra blog».
  • Correos: hola@ejemplo.com se anota como «hola arroba ejemplo punto com».
  • Siglas y abreviaturas: siglas como DNI o IVA se leen fluidas, pero abreviaturas o iniciales como J.R.R. suelen necesitar espacios («Jota Erre Erre» o «J R R») para que la voz no intente juntarlas como una sola palabra extraña.
  • Versiones de software: v2.0 se transcribe como «versión dos punto cero».

La puntuación también forma parte de la pronunciación. Las comas generan pausas cortas y naturales; los puntos crean cierres más claros y descansos en el ritmo. Las barras diagonales, los paréntesis o los guiones rara vez tienen una única lectura al hablar, por lo que es mucho más seguro sustituirlos por palabras directas.

Prueba una sola frase antes del guion entero

Genera una muestra corta de cinco o diez segundos que contenga la palabra difícil. Escúchala a velocidad normal y, a continuación, pruébala dentro de la frase completa. El ritmo, la entonación y los acentos secundarios cambian cuando la palabra está rodeada de otras. En cuanto des con la pronunciación adecuada, apunta esa solución en el glosario del proyecto.

Una palabra que suena bien de forma aislada puede tropezar dentro del párrafo. Esto pasa a menudo con términos polisémicos o con acentuación variable según la función gramatical. Si el modelo duda con una forma verbal, ajusta la puntuación previa o añade una tilde ortográfica en la transcripción de prueba para forzar el acento prosódico correcto.

Si se trata del nombre o apellido de una persona real, no asumas que el modelo tiene la razón por defecto. Pregunta directamente a la persona cómo prefiere que se pronuncie su nombre y utiliza el generador como herramienta para plasmar ese sonido exacto.

Crea un glosario de pronunciación

Un glosario es simplemente una tabla de referencia que acompaña al proyecto audiovisual:

  • Término original
  • Forma hablada escrita en el guion
  • Guía fonética aproximada
  • Frase de ejemplo
  • Fecha de validación

Guarda esa tabla para episodios futuros, capítulos siguientes o revisiones del contenido. No tiene sentido volver a investigar cómo pronunciar una marca o un apellido técnico en cada entrega.

En proyectos de equipo, coloca este glosario junto al guion cerrado. Si la locución se graba por bloques, todos los fragmentos deben nutrirse de las mismas decisiones. Si en el primer capítulo se dice «la NASA» como palabra y en el segundo se deletrea «la N-A-S-A», el resultado final dará una sensación descuidada.

Regenera únicamente el fragmento que necesite corrección

Para grabaciones extensas (podcasts, audiolibros o vídeos explicativos largos), divide el texto en bloques lógicos antes de generar el audio. Si detectas un error en un término del minuto diez, bastará con corregir esa frase concreta y volver a unirla al conjunto, en lugar de gastar tiempo y cuota regenerando todo el archivo desde cero.

Una pauta práctica es dividir por escenas, encabezados o fragmentos de entre 30 y 90 segundos. Nombra los archivos en orden numérico correlativo. Al sustituir una toma corregida, escucha con atención la transición: si la frase empalmada tiene una velocidad o un volumen visiblemente distintos, llamará más la atención que el propio fallo que intentabas resolver.

Usa el combinador de audio para unir las pistas aprobadas manteniendo una pausa constante y natural entre bloques. Conserva siempre los archivos WAV sin compresión durante la edición; exporta a MP3 únicamente la mezcla final que vayas a publicar o compartir.

Lista de comprobación rápida antes de publicar

  • Nombres propios, marcas y lugares se han verificado en un fragmento de prueba.
  • Fechas, horas, importes y unidades métricas están redactados como lenguaje hablado.
  • Direcciones web, correos y números de versión tienen una lectura explícita.
  • Las siglas dudosas están desarrolladas o claramente separadas para su lectura.
  • Las soluciones se han anotado en el glosario de pronunciación.
  • Solo se ha regenerado el bloque que contenía el error.
  • Las uniones entre tomas se han escuchado a velocidad normal para comprobar la continuidad.

La regla fundamental es sencilla: haz explícito todo lo que pueda resultar ambiguo, prueba de antemano los términos difíciles y mantén cada ajuste documentado.

Preguntas frecuentes

¿Por qué el texto a voz pronuncia mal algunos nombres propios?

La mayoría de los modelos de síntesis se basan en patrones estadísticos del idioma general. Los nombres poco comunes, de origen extranjero o con grafías familiares específicas se desvían de esas reglas. La forma más segura de resolverlo es escribir una transcripción fonética sencilla adaptada a las reglas de pronunciación del idioma de la voz y confirmar cómo le gusta sonar a la persona.

¿Conviene usar el Alfabeto Fonético Internacional (AFI/IPA) en el guion?

Por lo general, no hace falta. El AFI es una herramienta excelente para diccionarios y documentación lingüística, pero la mayoría de modelos comerciales responden de forma más predecible ante una reescritura intuitiva con el alfabeto habitual del guion. Deja las transcripciones en AFI para el glosario interno si necesitas documentar con precisión técnica.

¿Es necesario utilizar etiquetas SSML para corregir la pronunciación?

En la gran mayoría de locuciones web no es necesario. Escribir el guion tal como debe sonar, comprobar una frase de muestra y regenerar solo el corte afectado resulta mucho más rápido y fácil de mantener para un equipo que pelear con etiquetas de marcado complejas.

¿Qué hago si solo una palabra suena mal en un archivo de audio largo?

Divide el guion en secciones antes de pulsar generar. Si falla una palabra, corrige únicamente esa toma de 30 o 45 segundos y monta el resultado con las demás pistas. Reprocesar una locución de media hora por un solo tropiezo es la forma más lenta e ineficiente de trabajar.

Abrir FreeTextoSpeech