Eliminador de Voz con IA y Creador de Karaoke

Elimina la voz de una canción para crear un instrumental, o aísla la voz, con un modelo de IA en tu navegador. Gratis, privado, sin subida.

🌐 English

Drop your files here (.mp3, .wav, .m4a, .ogg, .flac)

🔒 Privado por diseño: tus archivos se procesan localmente en tu navegador; nada se sube nunca a ningún servidor.

Separar una mezcla en sus partes otra vez

Una vez que una canción está mezclada a dos canales, los instrumentos individuales han dejado de existir como entidades separadas. Lo que queda es la suma de todo, y sacar un elemento de una suma no es una operación con respuesta exacta.

Durante años el único truco disponible era la cancelación de canales, que se apoya en que la voz suele ir centrada en la panoramización. Resta un canal del otro y todo lo que sea idéntico en los dos desaparece. Funciona, en el sentido de que la voz baja de volumen, y también se lleva por delante el bombo, el bajo y la caja, que están centrados por el mismo motivo, y te deja además un archivo mono.

Un modelo de separación entrenado funciona de otra manera. Ha aprendido, a partir de una gran cantidad de canciones en las que estaban disponibles tanto la mezcla como las partes por separado, qué aspecto tiene una voz humana como patrón de energía a lo largo de la frecuencia y del tiempo. Ante una mezcla nueva predice qué partes de ese patrón pertenecen a la voz, y la predicción se hace por frecuencia y por instante, no por canal. La batería se queda, el bajo se queda, y el resultado se queda en estéreo.

Separar un archivo

  1. Suelta uno o más archivos MP3, WAV, M4A, OGG o FLAC.
  2. Elige Qué extraer: el instrumental, la voz, o las dos cosas.
  3. Ejecútalo. La primera pasada descarga el modelo, y la separación en sí lleva su tiempo.
  4. Descarga el WAV, o el zip cuando hayas pedido las dos partes.

Qué está haciendo el modelo en realidad

El audio se decodifica primero a estéreo a 44,1 kHz, que es la frecuencia que espera el modelo. El material mono se duplica en los dos canales y cualquier cosa con más de dos canales se reduce a dos.

Esa forma de onda se convierte después en un espectrograma, una imagen de cuánta energía hay en cada frecuencia en cada instante. Esta es la representación en la que trabaja el modelo, y es la razón de que el planteamiento pueda separar cosas que se solapan en el tiempo: dos sonidos que ocurren a la vez suelen ocupar frecuencias distintas, y donde se solapan el modelo ha aprendido cuál es más probable que sea cuál.

El modelo produce una máscara, un valor por frecuencia y por fotograma que dice qué proporción pertenece a la voz. Aplicar la máscara y volver a convertir a forma de onda produce el audio separado. La otra parte es lo que queda.

Por qué la salida va sin comprimir

El audio separado llega como muestras en bruto y se escribe directamente a un WAV.

Codificarlo a MP3 en ese punto pondría artefactos de compresión encima de artefactos de separación, y los dos no se tapan entre sí. La separación deja un residuo espectral tenue en sitios poco habituales, justo el tipo de cosa que un codificador con pérdida lleva mal, y la combinación suena bastante peor que cualquiera de las dos por separado.

Los archivos salen grandes como consecuencia. Si los quieres más pequeños, convierte después como paso deliberado con convertir MP3 a WAV en sentido inverso, una vez hayas confirmado que la separación es lo bastante buena como para quedártela.

Qué esperar, con honestidad

El instrumental va a tener trazas tenues de la voz, sobre todo en las secciones fuertes y en las colas de reverberación, porque la reverberación reparte una voz a lo largo del tiempo y de la frecuencia de formas difíciles de atribuir. La acapela va a arrastrar un poco del acompañamiento por el mismo motivo.

Los arreglos escasos separan mejor que los densos. Una grabación acústica con una voz clara sale muy limpia. Una producción moderna con compresión fuerte, armonías por capas y efectos sobre todo es un problema bastante más difícil.

Nada de esto es una limitación de esta herramienta en concreto, sino de la tarea. Reconstruir partes a partir de una mezcla es inferencia, y ninguna cantidad de proceso recupera la información que la mezcla descartó.

Herramientas de audio relacionadas

Si la fuente está baja o desigual antes de empezar, normalizar el volumen del audio le da al modelo una entrada mejor con la que trabajar, y eliminar el ruido del audio ayuda con una grabación ruidosa. Si un canal de tu fuente está muerto, arregla eso primero con convertir estéreo a mono, porque una imagen estéreo rota confunde a la separación.

Para obtener la letra como texto en lugar de como audio, transcribir audio a texto ejecuta un modelo distinto de la misma manera local, y funciona bastante mejor sobre una voz ya separada que sobre una mezcla completa.

Preguntas frecuentes

¿Se sube mi canción a un servidor?

No. Un modelo de IA de separación de fuentes (Spleeter, convertido para ejecutarse en WebAssembly) se descarga una vez en tu pestaña del navegador, y cada separación ocurre localmente en tu propio dispositivo a partir de entonces. El archivo de audio nunca se envía a ningún sitio.

¿Por qué esto tarda más que una conversión de audio normal?

Separar la voz del instrumental es un cómputo genuinamente pesado, el modelo de IA analiza el contenido de frecuencia completo de cada fracción de segundo de la canción, dos veces (una para la voz, otra para el instrumental). Ejecutar eso en la CPU de tu propio dispositivo, sin ninguna GPU de servidor a la que delegar, es más lento que una simple conversión de formato. Una canción típica de 3-4 minutos suele terminar bien dentro de un minuto, pero el tiempo exacto depende enteramente de tu dispositivo, espera que tarde más en un portátil o teléfono antiguo, y mantén la pestaña abierta mientras trabaja.

¿Qué tan buena es la calidad de la separación?

Es una separación real y útil (reducción o aislamiento de voz claramente audible, suficientemente buena para karaoke, un mashup de DJ, o muestreo) pero no es perfecta a nivel de estudio. El modelo de 2 pistas de Spleeter es un modelo ligero, rápido y de código abierto, no el modelo de separación de fuentes más grande o preciso disponible; puedes oír algo de "sangrado" (un rastro tenue de la otra pista) o artefactos sutiles, especialmente en pistas densamente mezcladas, con mucho bajo, o muy procesadas.

¿Por qué el resultado suena un poco más apagado o menos nítido que el original?

El modelo subyacente solo analiza y separa frecuencias de audio hasta unos 11 kHz, una característica conocida de este modelo Spleeter concreto (rápido y pequeño). El contenido por encima de eso (el brillo de los platillos, algo de sibilancia vocal, sintetizadores muy brillantes) no se separa y simplemente está ausente tanto del instrumental como de la salida de voz, lo que puede hacer que el resultado suene ligeramente menos brillante que la mezcla original. Es una contrapartida real de un modelo lo bastante pequeño y rápido como para ejecutarse enteramente en una pestaña del navegador.

¿En qué formato está la salida?

Un archivo WAV a 44,1 kHz, sin importar el formato de tu archivo original. Se usa WAV porque la separación en sí se reconstruye muestra por muestra a partir de la salida del modelo de IA, volver a comprimir ese resultado a MP3 solo añadiría una pérdida de calidad adicional e innecesaria encima de la propia separación. Conviértelo después con la operación inversa de MP3 a WAV, WAV a MP3, si necesitas un archivo más pequeño.

¿Puedo obtener tanto la voz como el instrumental de una sola subida?

Sí, elige "Ambos (ZIP)" y obtendrás una única descarga .zip que contiene tanto el archivo `-vocals.wav` como el `-instrumental.wav`. Ambas pistas se calculan a partir del mismo pase de IA sin importar qué opción elijas, así que elegir "Ambos" no tarda notablemente más que elegir solo una.

¿Puedo procesar varias canciones a la vez?

Sí. Suelta varios archivos y cada uno se separa por turno, en tu propio dispositivo. El modelo de IA solo se descarga una vez para todo el lote, pero recuerda que cada canción es genuinamente pesada de procesar, así que un lote grande tardará un rato, puedes ver la barra de progreso de cada archivo.

Herramientas relacionadas