Conversor de Texto a Voz

Convierte texto en inglés en voz natural con un modelo de IA en tu propio dispositivo, en el navegador. Descarga en MP3 o WAV, gratis, privado, sin cuenta.

🌐 English

🔒 Privado por diseño: tu texto se procesa localmente en tu navegador; nada se sube nunca a ningún servidor.

Cómo convertir texto a voz

  1. Pega o escribe el texto en inglés que quieres que se lea en voz alta en el recuadro de arriba. Consulta el aviso más abajo sobre por qué específicamente en inglés.
  2. Elige una Voz, ajusta la Velocidad de habla si la quieres más rápida o lenta de lo normal, y elige MP3 o WAV como formato de descarga.
  3. Pulsa Conversor de Texto a Voz y espera la barra de progreso. La primera ejecución descarga un pequeño modelo de voz de IA a tu navegador (un coste único); cada conversión después de eso empieza al instante.
  4. Pulsa el enlace de descarga para guardar el archivo de audio generado.

Un aviso honesto: esta herramienta convierte inglés, no español

Aunque esta página está en español, es importante decir con claridad qué produce realmente la herramienta por debajo: el modelo de voz Kokoro que impulsa esta conversión solo tiene voces entrenadas en inglés americano y británico, y la conversión de texto a fonemas de la que depende solo implementa reglas de pronunciación en inglés. Si pegas texto en español, la herramienta no da ningún error (genera un archivo de audio igualmente) pero el resultado aplica reglas de pronunciación inglesas a letras y palabras españolas, produciendo un acento marcadamente artificial y pronunciaciones incorrectas en la mayoría de palabras. Para texto en inglés, en cambio, esta herramienta funciona exactamente como se describe a continuación, sin ninguna salvedad.

Por qué convertir texto a voz en el navegador en lugar de una API en la nube

La mayoría de herramientas gratuitas de texto a voz online funcionan enviando tu texto a un servidor, que devuelve un archivo de audio, lo que significa que lo que escribiste pasa por el backend de otra persona, a menudo con un límite diario de caracteres, una cuenta obligatoria, o una marca de agua en el plan gratuito. Eso es un problema real si el texto es un guion privado, un documento aún no publicado, o cualquier cosa que preferirías no entregar a un tercero solo para escucharla en voz alta.

Esta herramienta funciona de otra manera: todo el modelo de voz, Kokoro, un modelo de texto a voz de código abierto, se descarga una vez en tu pestaña del navegador y se ejecuta localmente desde entonces, de la misma forma en que funcionan las demás herramientas de IA de este sitio (eliminador de fondo, transcriptor de audio, ampliador de imagen). Tu texto se convierte directamente en una forma de onda de audio en tu propio dispositivo y nunca se transmite a ningún sitio, sin cuenta, sin cuota diaria y sin marca de agua.

Voces con sonido natural, funcionando enteramente sin conexión tras la primera carga

Kokoro es un modelo de voz de código abierto moderno y genuinamente capaz, un gran salto respecto a las voces del sistema planas y robóticas integradas en la mayoría de sistemas operativos. Como todo el modelo se ejecuta vía WebAssembly en lugar de llamar a una API en la nube, una vez que está en caché en tu navegador puedes seguir generando voz sin necesitar conexión a internet ni esperar la latencia de red de cada petición.

Usos habituales

Preguntas frecuentes

Esta página está en español, ¿puedo usar esta herramienta para generar voz en español?

No, y preferimos decirlo con total claridad antes de que pegues un texto en español esperando un resultado natural. El modelo de voz que usa esta herramienta (Kokoro) solo ofrece voces en inglés americano y británico, y la conversión de texto a fonemas de la que depende (la librería `phonemizer`, basada en espeak-ng) solo implementa reglas fonéticas para el inglés. Si pegas texto en español, la herramienta no lo rechaza ni da ningún error, simplemente lo lee aplicando reglas de pronunciación inglesas sobre letras y combinaciones españolas, así que el resultado suena con un acento marcadamente extraño y muchas palabras se pronuncian mal o de forma irreconocible. Esta herramienta es genuinamente útil solo para texto escrito en inglés; para narrar texto en español necesitarías un servicio de texto a voz específico para español, que esta herramienta no es.

¿Se sube mi texto a un servidor para generar la voz?

No. Un modelo de voz de IA de código abierto (Kokoro, convertido para ejecutarse en WebAssembly) se descarga una vez en tu pestaña del navegador, y cada conversión después de eso se ejecuta enteramente en tu propio dispositivo. Lo que escribas (un guion, una nota privada, una lectura de accesibilidad) nunca se envía a ningún sitio.

¿Por qué la primera conversión tarda más que las siguientes?

El propio modelo de voz (unos 90 MB, cuantizado para una descarga más pequeña) se descarga una vez, la primera vez que usas la herramienta, y tu navegador lo guarda en caché. Cada conversión después de eso (en esta sesión o en una visita futura) reutiliza el modelo en caché, así que solo la primera ejecución paga el coste de descarga.

¿Por qué todas las voces son solo en inglés?

El modelo subyacente de Kokoro puede técnicamente producir varios idiomas, pero la conversión de texto a fonemas que usa esta herramienta (mediante la librería `phonemizer` basada en espeak-ng) solo implementa reglas fonéticas de inglés americano y británico. Alimentarlo con texto que no sea inglés usando una voz en inglés lo pronunciaría mal, así que esta herramienta expone deliberadamente solo las voces en inglés que realmente funcionan correctamente.

¿Cómo elijo entre las distintas voces?

Las seis voces que se ofrecen aquí están seleccionadas del conjunto completo integrado de Kokoro, restringidas a las que tienen las puntuaciones de calidad más altas valoradas por la propia comunidad del modelo, así que cada opción suena razonablemente natural, prueba varias con tu propio texto en inglés, ya que la preferencia de voz es subjetiva y algunas voces se adaptan mejor a narraciones largas que otras.

¿Debería descargar MP3 o WAV?

MP3 es la mejor opción por defecto para casi todo el mundo, un archivo mucho más pequeño que es fácil de compartir, adjuntar a un correo, o meter en un editor de vídeo, sin pérdida de calidad audible para voz hablada. WAV está sin comprimir y es algo más grande; elígelo solo si necesitas específicamente un archivo fuente sin pérdida para edición de audio posterior.

¿Hay un límite de cuánto texto puedo convertir?

Esta herramienta no impone ningún límite estricto, pero un texto muy largo tarda proporcionalmente más en sintetizarse ya que todo se ejecuta en la CPU de tu propio dispositivo sin ningún servidor al que delegar. Para un documento largo, convertirlo en varios fragmentos más cortos tiende a sentirse más ágil que una sola ejecución muy larga.

¿Qué tan natural suena realmente el habla?

Kokoro es un modelo de voz de código abierto genuinamente capaz, moderno, más cercano a una voz comercial de texto a voz que las voces robóticas del sistema integradas en la mayoría de sistemas operativos, pero no es una grabación humana perfecta. Abreviaturas poco habituales, números y nombres poco comunes pueden pronunciarse mal ocasionalmente, así que escucha cualquier cosa importante antes de confiar en ella.

Herramientas relacionadas