Separar una mezcla en sus partes otra vez
Una vez que una canción está mezclada a dos canales, los instrumentos individuales han dejado de existir como entidades separadas. Lo que queda es la suma de todo, y sacar un elemento de una suma no es una operación con respuesta exacta.
Durante años el único truco disponible era la cancelación de canales, que se apoya en que la voz suele ir centrada en la panoramización. Resta un canal del otro y todo lo que sea idéntico en los dos desaparece. Funciona, en el sentido de que la voz baja de volumen, y también se lleva por delante el bombo, el bajo y la caja, que están centrados por el mismo motivo, y te deja además un archivo mono.
Un modelo de separación entrenado funciona de otra manera. Ha aprendido, a partir de una gran cantidad de canciones en las que estaban disponibles tanto la mezcla como las partes por separado, qué aspecto tiene una voz humana como patrón de energía a lo largo de la frecuencia y del tiempo. Ante una mezcla nueva predice qué partes de ese patrón pertenecen a la voz, y la predicción se hace por frecuencia y por instante, no por canal. La batería se queda, el bajo se queda, y el resultado se queda en estéreo.
Separar un archivo
- Suelta uno o más archivos MP3, WAV, M4A, OGG o FLAC.
- Elige Qué extraer: el instrumental, la voz, o las dos cosas.
- Ejecútalo. La primera pasada descarga el modelo, y la separación en sí lleva su tiempo.
- Descarga el WAV, o el zip cuando hayas pedido las dos partes.
Qué está haciendo el modelo en realidad
El audio se decodifica primero a estéreo a 44,1 kHz, que es la frecuencia que espera el modelo. El material mono se duplica en los dos canales y cualquier cosa con más de dos canales se reduce a dos.
Esa forma de onda se convierte después en un espectrograma, una imagen de cuánta energía hay en cada frecuencia en cada instante. Esta es la representación en la que trabaja el modelo, y es la razón de que el planteamiento pueda separar cosas que se solapan en el tiempo: dos sonidos que ocurren a la vez suelen ocupar frecuencias distintas, y donde se solapan el modelo ha aprendido cuál es más probable que sea cuál.
El modelo produce una máscara, un valor por frecuencia y por fotograma que dice qué proporción pertenece a la voz. Aplicar la máscara y volver a convertir a forma de onda produce el audio separado. La otra parte es lo que queda.
Por qué la salida va sin comprimir
El audio separado llega como muestras en bruto y se escribe directamente a un WAV.
Codificarlo a MP3 en ese punto pondría artefactos de compresión encima de artefactos de separación, y los dos no se tapan entre sí. La separación deja un residuo espectral tenue en sitios poco habituales, justo el tipo de cosa que un codificador con pérdida lleva mal, y la combinación suena bastante peor que cualquiera de las dos por separado.
Los archivos salen grandes como consecuencia. Si los quieres más pequeños, convierte después como paso deliberado con convertir MP3 a WAV en sentido inverso, una vez hayas confirmado que la separación es lo bastante buena como para quedártela.
Qué esperar, con honestidad
El instrumental va a tener trazas tenues de la voz, sobre todo en las secciones fuertes y en las colas de reverberación, porque la reverberación reparte una voz a lo largo del tiempo y de la frecuencia de formas difíciles de atribuir. La acapela va a arrastrar un poco del acompañamiento por el mismo motivo.
Los arreglos escasos separan mejor que los densos. Una grabación acústica con una voz clara sale muy limpia. Una producción moderna con compresión fuerte, armonías por capas y efectos sobre todo es un problema bastante más difícil.
Nada de esto es una limitación de esta herramienta en concreto, sino de la tarea. Reconstruir partes a partir de una mezcla es inferencia, y ninguna cantidad de proceso recupera la información que la mezcla descartó.
Herramientas de audio relacionadas
Si la fuente está baja o desigual antes de empezar, normalizar el volumen del audio le da al modelo una entrada mejor con la que trabajar, y eliminar el ruido del audio ayuda con una grabación ruidosa. Si un canal de tu fuente está muerto, arregla eso primero con convertir estéreo a mono, porque una imagen estéreo rota confunde a la separación.
Para obtener la letra como texto en lugar de como audio, transcribir audio a texto ejecuta un modelo distinto de la misma manera local, y funciona bastante mejor sobre una voz ya separada que sobre una mezcla completa.