El navegador coordina la reproducción
Cuando una página pide que se lea un texto en voz alta, se lo entrega a speechSynthesis, una interfaz del navegador definida por la API Web Speech. El navegador no genera el audio por sí mismo; pasa el texto al motor de texto a voz que ya tiene instalado tu propio sistema operativo, recibe el audio de vuelta, y lo reproduce por tus altavoces. Nada de ese proceso implica una solicitud de red. El texto nunca tiene que salir de tu dispositivo para que ocurra la lectura, y por eso una herramienta así puede afirmar honestamente que "nada se sube".
Las voces disponibles dependen del entorno
speechSynthesis.getVoices() muestra las voces disponibles en esa sesión. La lista puede cargar de forma asíncrona y cambia según paquetes de idioma, sistema, navegador y preferencias. La página puede elegir entre las voces informadas, pero no garantizar el mismo nombre o calidad en otro equipo.
Por qué la reproducción estándar no produce un MP3
Esto no es una función que Orisod haya decidido omitir; la API Web Speech simplemente nunca definió una forma de capturar su salida como un archivo. Tiene un solo trabajo: convertir texto en sonido y reproducirlo, en vivo, por la salida de audio del dispositivo. No hay ninguna etapa de codificación, ningún búfer que se le entregue a la página, nada que un script pueda redirigir hacia un .mp3 o .wav descargable. Cualquier herramienta que diga lo contrario o bien está usando síntesis de voz del lado del servidor (lo que normalmente significa que tu texto salió de tu dispositivo), o bien usa trucos de grabación específicos de un navegador que no funcionan de forma fiable en todos los dispositivos. Ser claro sobre esa limitación desde el principio es más útil que prometer de más y dejar que la gente lo descubra por las malas.
Los textos largos necesitan una cola cuidadosa
Los enunciados largos pueden detenerse o comportarse de forma irregular en ciertas combinaciones. Dividir el texto y poner los segmentos en cola mejora la resistencia y permite resaltar frases. La segmentación depende del idioma, así que abreviaturas y puntuación inusual todavía requieren cuidado.
Comportamiento esperado de la reproducción
Cerrar la página o navegar fuera suele detener la lectura, pero el ciclo de vida puede variar entre navegadores y estados en segundo plano.
Instalar voces del sistema puede ampliar las opciones cuando el sistema operativo lo permite. Una página no puede añadir por sí sola una voz nativa mediante Web Speech.
Pausa, reanudación, eventos de límites y resaltado varían entre motores. Estas diferencias pueden afectar la sincronización aunque el código sea correcto.
Prueba el texto a voz en tu navegador
Leer en Voz Alta de Orisod usa las voces informadas por tu navegador y ofrece velocidad, tono y resaltado. La disponibilidad, conexión y reproducción dependen del navegador, sistema y voz elegida.
Leer texto en voz alta →La síntesis del navegador es una solicitud de reproducción en la plataforma actual. Prueba la voz y los controles en el dispositivo real, y verifica la privacidad de esa voz en vez de confiar en una promesa universal de procesamiento local.