Transcribir Audio a Texto

Transcribe notas de voz, entrevistas y reuniones a texto con un modelo de IA en tu propio dispositivo, en el navegador. Gratis, privado, sin subida.

🌐 English

Drop your files here (.mp3, .wav, .m4a, .ogg, .flac)

🔒 Privado por diseño: tus archivos se procesan localmente en tu navegador; nada se sube nunca a ningún servidor.

Cómo transcribir audio a texto

  1. Suelta tu grabación en MP3, WAV, M4A, OGG o FLAC en el recuadro de arriba, o haz clic en Elegir archivos, puedes seleccionar uno o un lote entero.
  2. Elige el Idioma hablado, o déjalo en Detección automática si no estás seguro o el lote mezcla idiomas.
  3. Pulsa Transcribir y espera la barra de progreso. La primera ejecución descarga un pequeño modelo de IA a tu navegador (un coste único); cada grabación después de eso empieza a procesarse al instante.
  4. Descarga el resultado: cada grabación produce su propio archivo .txt con la transcripción.

Por qué transcribir audio a texto

Una grabación es fácil de hacer y difícil de aprovechar. Un memo de voz dictado de camino al trabajo, una entrevista grabada con el móvil, una reunión captada para quienes no pudieron asistir, en todos los casos las palabras están ahí, pero no puedes buscarlas, citarlas, pegarlas en unas notas ni pasarlas por un traductor hasta que existan como texto. Volver a escuchar y teclear todo a mano es lento y, para cualquier cosa de más de un par de minutos, genuinamente tedioso.

El reconocimiento automático de voz resuelve esto escuchando el audio y reconstruyendo lo que se dijo como texto plano, convirtiendo una grabación en algo que puedes buscar con Ctrl+F, copiar en un acta, traducir o archivar como una nota legible. Esta herramienta usa Whisper, el modelo de reconocimiento de voz de código abierto publicado originalmente por OpenAI, compilado para ejecutarse directamente en tu pestaña del navegador vía WebAssembly en lugar de en un servidor.

Whisper es genuinamente bueno en esto, pero no es infalible, el ruido de fondo, los hablantes solapados, los acentos marcados y la jerga poco común aumentan todos la tasa de error, y esta herramienta ejecuta deliberadamente la variante más pequeña (“tiny”) de Whisper para mantener el modelo lo bastante pequeño como para descargarlo en tiempo de ejecución, en lugar de una versión de varios gigabytes. Para una nota rápida, una entrevista entre dos personas, o captar la idea general de una reunión, es un compromiso sólido; para una transcripción que necesite ser perfecta palabra por palabra, dale siempre una revisión.

Sí, transcribe genuinamente en español

A diferencia de otras herramientas de IA de este sitio cuyo modelo subyacente solo produce inglés (y que lo dicen honestamente en su página en español), Whisper es un modelo verdaderamente multilingüe, y el español está entre los idiomas con mejor soporte de todo el conjunto. Elige “Español” en el desplegable de Idioma hablado para darle a Whisper una pista explícita, o deja Detección automática si tu grabación ya está claramente en español, en ambos casos obtendrás una transcripción real en español, con sus propios acentos y signos de puntuación, no un texto en inglés.

Tu grabación nunca sale de tu dispositivo

Las grabaciones de voz son a menudo exactamente el audio que menos querrías que acabara en el servidor de un desconocido: una reunión de negocios confidencial, una conversación legal o médica, una entrevista aún no publicada, un memo de voz personal. La mayoría de herramientas de transcripción online exigen subir esa grabación a sus servidores, donde puede registrarse, almacenarse temporalmente, o usarse para mejorar sus propios modelos, y los planes gratuitos suelen limitar cuántos minutos puedes transcribir antes de pedirte que pagues.

SysFenix funciona al revés: todo el modelo de reconocimiento de voz se descarga una vez en tu pestaña del navegador (de la misma forma en que las herramientas de vídeo, PDF y OCR de este sitio cargan sus propios motores de procesamiento) y cada transcripción se ejecuta localmente en la CPU de tu propio dispositivo. Nada del audio, ni nada de las palabras que contiene, se transmite jamás a ningún sitio. Cierra la pestaña y nada de eso existe en ningún otro lugar más que en tu propio archivo .txt descargado.

Usos habituales

Preguntas frecuentes

Esta página está en español, ¿la herramienta realmente transcribe audio en español?

Sí, genuinamente. A diferencia de otras herramientas de este sitio que solo producen inglés, esta usa Whisper, un modelo de reconocimiento de voz entrenado en decenas de idiomas (incluido el español como uno de sus idiomas mejor soportados) así que puedes elegir "Español" explícitamente en el desplegable de Idioma hablado, o dejarlo en Detección automática si no estás seguro, y obtendrás una transcripción real en español, no un texto en inglés forzado.

¿Se sube mi grabación a un servidor?

No. Un modelo de IA de reconocimiento de voz (Whisper, convertido para ejecutarse en WebAssembly) se descarga una vez en tu pestaña del navegador y cada transcripción a partir de ahí ocurre localmente en tu propio dispositivo. Ni el audio ni la transcripción se envían jamás a ningún sitio, lo que importa para una grabación de reunión privada, una nota de una sesión de terapia, o un memo de voz que preferirías no entregar a un servidor de terceros.

¿Por qué el primer archivo tarda más que el resto?

El propio modelo de IA (unos 40 MB, cuantizado para una descarga más pequeña) se descarga una vez, la primera vez que usas la herramienta, y tu navegador lo guarda en caché. Cada grabación después de eso (en esta sesión o en una visita futura) reutiliza el modelo en caché, así que solo la primera transcripción paga el coste de la descarga.

¿Debería elegir un idioma concreto o dejarlo en Detección automática?

Detección automática funciona bien con audio claro de un solo idioma y es la opción por defecto. Elige el idioma hablado explícitamente si lo conoces y la grabación es corta, ruidosa o tiene conversación de fondo, darle a Whisper el idioma de antemano se salta su propio paso de detección y puede mejorar notablemente la precisión en audio complicado.

¿Hay un límite de duración de la grabación?

No se aplica ningún límite estricto. El modelo de Whisper procesa audio nativamente en ventanas de 30 segundos, pero esta herramienta divide automáticamente grabaciones más largas (entrevistas, reuniones completas) en ventanas superpuestas y une el texto resultante, así que una grabación de reunión de 45 minutos se transcribe en un solo pase continuo, simplemente tarda más que un memo de voz de 30 segundos, ya que todo se ejecuta en la CPU de tu propio dispositivo.

¿Puedo transcribir varias grabaciones a la vez?

Sí. Suelta varios archivos y cada uno se transcribe por turno, en tu propio dispositivo, produciendo su propio archivo `.txt` descargable. El modelo de IA solo se descarga una vez para todo el lote.

¿Qué tan precisa es la transcripción?

Whisper es un modelo de reconocimiento de voz genuinamente capaz, pero esta herramienta ejecuta su variante más pequeña ("tiny") específicamente para mantener la descarga lo bastante pequeña como para obtenerla en tiempo de ejecución, cometerá más errores que un modelo Whisper más grande o un servicio de transcripción en la nube de pago, especialmente con acentos marcados, hablantes solapados, ruido de fondo o jerga especializada. Revisa siempre la transcripción antes de confiar en ella para algo importante como un acta de reunión o una cita textual.

¿También traduce el audio?

No, esta herramienta siempre transcribe en el idioma hablado en lugar de traducir al inglés o a cualquier otro idioma. Si necesitas una traducción, pasa la transcripción descargada por una herramienta de traducción después, como nuestro Traductor de Texto con IA.

Herramientas relacionadas