Cómo transcribir audio a texto
- Suelta tu grabación en MP3, WAV, M4A, OGG o FLAC en el recuadro de arriba, o haz clic en Elegir archivos, puedes seleccionar uno o un lote entero.
- Elige el Idioma hablado, o déjalo en Detección automática si no estás seguro o el lote mezcla idiomas.
- Pulsa Transcribir y espera la barra de progreso. La primera ejecución descarga un pequeño modelo de IA a tu navegador (un coste único); cada grabación después de eso empieza a procesarse al instante.
- Descarga el resultado: cada grabación produce su propio archivo
.txtcon la transcripción.
Por qué transcribir audio a texto
Una grabación es fácil de hacer y difícil de aprovechar. Un memo de voz dictado de camino al trabajo, una entrevista grabada con el móvil, una reunión captada para quienes no pudieron asistir, en todos los casos las palabras están ahí, pero no puedes buscarlas, citarlas, pegarlas en unas notas ni pasarlas por un traductor hasta que existan como texto. Volver a escuchar y teclear todo a mano es lento y, para cualquier cosa de más de un par de minutos, genuinamente tedioso.
El reconocimiento automático de voz resuelve esto escuchando el audio y reconstruyendo lo que se dijo como texto plano, convirtiendo una grabación en algo que puedes buscar con Ctrl+F, copiar en un acta, traducir o archivar como una nota legible. Esta herramienta usa Whisper, el modelo de reconocimiento de voz de código abierto publicado originalmente por OpenAI, compilado para ejecutarse directamente en tu pestaña del navegador vía WebAssembly en lugar de en un servidor.
Whisper es genuinamente bueno en esto, pero no es infalible, el ruido de fondo, los hablantes solapados, los acentos marcados y la jerga poco común aumentan todos la tasa de error, y esta herramienta ejecuta deliberadamente la variante más pequeña (“tiny”) de Whisper para mantener el modelo lo bastante pequeño como para descargarlo en tiempo de ejecución, en lugar de una versión de varios gigabytes. Para una nota rápida, una entrevista entre dos personas, o captar la idea general de una reunión, es un compromiso sólido; para una transcripción que necesite ser perfecta palabra por palabra, dale siempre una revisión.
Sí, transcribe genuinamente en español
A diferencia de otras herramientas de IA de este sitio cuyo modelo subyacente solo produce inglés (y que lo dicen honestamente en su página en español), Whisper es un modelo verdaderamente multilingüe, y el español está entre los idiomas con mejor soporte de todo el conjunto. Elige “Español” en el desplegable de Idioma hablado para darle a Whisper una pista explícita, o deja Detección automática si tu grabación ya está claramente en español, en ambos casos obtendrás una transcripción real en español, con sus propios acentos y signos de puntuación, no un texto en inglés.
Tu grabación nunca sale de tu dispositivo
Las grabaciones de voz son a menudo exactamente el audio que menos querrías que acabara en el servidor de un desconocido: una reunión de negocios confidencial, una conversación legal o médica, una entrevista aún no publicada, un memo de voz personal. La mayoría de herramientas de transcripción online exigen subir esa grabación a sus servidores, donde puede registrarse, almacenarse temporalmente, o usarse para mejorar sus propios modelos, y los planes gratuitos suelen limitar cuántos minutos puedes transcribir antes de pedirte que pagues.
SysFenix funciona al revés: todo el modelo de reconocimiento de voz se descarga una vez en tu pestaña del navegador (de la misma forma en que las herramientas de vídeo, PDF y OCR de este sitio cargan sus propios motores de procesamiento) y cada transcripción se ejecuta localmente en la CPU de tu propio dispositivo. Nada del audio, ni nada de las palabras que contiene, se transmite jamás a ningún sitio. Cierra la pestaña y nada de eso existe en ningún otro lugar más que en tu propio archivo .txt descargado.
Usos habituales
- Convertir una entrevista grabada con el móvil en un documento de texto buscable y citable.
- Obtener un registro escrito aproximado de una reunión o una clase grabada sin tomar notas a mano.
- Convertir un memo de voz dictado en texto que puedas pegar en un correo, un ticket o un documento.
- Hacer accesible una grabación de audio a alguien que no puede escucharla (o preferiría leerla).
- Producir un primer borrador de transcripción que limpiar antes de publicarlo como notas del programa o artículo.
- Grabar una nota de voz directamente en tu navegador y transcribirla aquí.
- Ir en la dirección contraria: convertir texto escrito de nuevo en audio hablado con el Conversor de Texto a Voz.