Come funzionano la rimozione vocale con l’AI e la separazione delle stem
2026/05/13

Come funzionano la rimozione vocale con l’AI e la separazione delle stem

Uno sguardo pratico a Demucs, alla source separation e a come CreateMusicAI trasforma la separazione audio di livello di ricerca in strumenti semplici per i creator.

Si dice che non si possa rimettere insieme una torta già sfornata. Nell’audio, separare un brano finito in voce, batteria e basso un tempo sembrava simile: si potevano sentire gli ingredienti, ma non era possibile dividerli in modo pulito. La source separation basata sull’AI non recupera davvero la sessione originale di studio, ma oggi può produrre stime sorprendentemente utili.

Per questo molti strumenti audio partono da una domanda molto pratica: posso estrarre la voce da questo brano, oppure posso suddividere la traccia in parti utilizzabili?

Per chi ascolta, un brano finito è un unico oggetto. Per un producer, un DJ, un cantante, un insegnante o un content creator, lo stesso brano può contenere diversi livelli utili: una linea vocale, un groove di batteria, una parte di basso e tutto il resto dell’arrangiamento. La rimozione vocale AI e la separazione delle stem AI sono modi per trasformare quel mix finito in file audio separati e lavorabili.

L’idea sembra semplice. Carichi un brano, scegli ciò che ti serve e scarichi il risultato. Sotto il cofano, però, questo è uno dei problemi più interessanti della musica AI. Il file audio non contiene cartelle separate etichettate "voce", "batteria" e "basso". Contiene un’unica forma d’onda mixata, in cui tutti questi suoni si sovrappongono nel tempo, nella frequenza, nel volume, nella posizione stereo e nel riverbero.

Per questo gli strumenti moderni usano modelli di source separation come Demucs, invece di affidarsi a vecchi trucchi come il filtraggio EQ o la cancellazione del canale centrale.

Cosa Significa Source Separation

La source separation è il compito di stimare sorgenti sonore individuali da un segnale audio mixato. Nella musica, i target più comuni sono voce, batteria, basso e altri strumenti. Quando un modello separa un brano in queste quattro uscite, i risultati vengono solitamente chiamati "stem".

La rimozione vocale AI è una versione più ristretta della stessa idea. Invece di chiedere quattro stem, al modello si chiedono due gruppi ampi:

  • voce
  • accompagnamento, o traccia strumentale senza la voce

Questo è utile per tracce karaoke, acapella, cover, esercizio vocale, bozze di remix e rapidi esperimenti di arrangiamento. La separazione delle stem va oltre. Offre più controllo separando il mix in voce, batteria, basso e altro, il che è migliore per remix, campionamento, apprendimento delle parti o studio della produzione di un brano.

Entrambi i flussi di lavoro si basano sullo stesso problema di fondo: il modello deve ascoltare un mix finito e dedurre quali parti del segnale appartengano con maggiore probabilità a ciascuna sorgente.

Perché un Brano Finito è Difficile da Dividere

Se la musica fosse organizzata in modo ordinato per frequenza, la source separation sarebbe facile. Potremmo rimuovere le basse frequenze per il basso, le alte frequenze per i piatti e le medie per la voce. La musica reale non funziona così.

I livelli audio sovrapposti rendono difficile la source separation

La voce umana può occupare la stessa area di frequenza di chitarre, synth, pianoforti, rullanti e riflessioni ambientali. Un kick e un basso elettrico possono condividere lo stesso spazio sulle basse frequenze. La coda del riverbero di una voce può espandersi nell’immagine stereo e confondersi con pad o strumenti di sottofondo. La compressione in mastering può incollare ancora più strettamente tutti questi suoni.

Questo è anche il motivo per cui i vecchi metodi di rimozione vocale spesso risultavano poco affidabili. Molti assumevano che la voce principale fosse centrata nel campo stereo, poi provavano a cancellare il canale centrale. Può funzionare su alcuni brani, ma può anche rimuovere kick, basso, rullante o qualsiasi altro elemento mixato vicino al centro. Fatica con riverberi, cori, effetti stereo e produzioni moderne molto dense.

La source separation AI è diversa. Non si limita a tagliare una banda di frequenza o a cancellare una posizione stereo. Usa un modello addestrato per riconoscere pattern che tendono ad appartenere a sorgenti specifiche. Il modello impara come appaiono spesso le voci, come si comportano nel tempo le percussioni, quale contributo danno le linee di basso alle basse frequenze e come gli altri strumenti riempiono il resto dell’arrangiamento.

Demucs Dietro il Workflow

Demucs è un progetto open source di separazione di sorgenti musicali creato da Alexandre Defossez e sviluppato inizialmente presso Meta AI. Il repository attuale descrive Demucs come un modello state-of-the-art per la separazione di sorgenti musicali, con supporto per la divisione dei brani in batteria, basso, voce e altro accompagnamento.

La versione più rilevante per l’uso moderno è Hybrid Transformer Demucs, spesso indicato come HTDemucs. Il progetto lo descrive come un modello ibrido di separazione basato su spettrogramma e waveform, che utilizza i Transformer. In pratica, ciò significa che può usare sia la forma grezza dell’audio nel tempo sia una vista frequenza-tempo del mix. La parte waveform aiuta a preservare timing, transienti e dettagli fini; la parte spettrogramma aiuta il modello a riconoscere pattern armonici e di frequenza. Gli strati Transformer aggiungono un contesto musicale più ampio, così il modello può ragionare su una frase vocale, un groove di batteria o una linea di basso come qualcosa che si sviluppa nel tempo, non solo come una raccolta di frammenti audio isolati.

Demucs supporta anche una modalità vocale a due stem tramite opzioni come --two-stems=vocals. In termini pratici, significa che la stessa famiglia di tecnologia di separazione può supportare sia un flusso di rimozione vocale sia un flusso completo di split in stem.

Per chi vuole approfondire la parte di ricerca, il paper Hybrid Transformers for Music Source Separation è il riferimento tecnico alla base di HTDemucs.

Cosa Sta Realmente Stimando il Modello

È importante essere precisi su ciò che fa la separazione AI. Non recupera la sessione originale di studio. Se un brano è stato esportato da una DAW, masterizzato, compresso e pubblicato come file stereo, le informazioni multitraccia originali non sono più conservate al suo interno in modo pulito e reversibile.

Il modello fa una stima informata. Dato il segnale mixato, predice come probabilmente suona lo stem vocale, come probabilmente suonano batteria e basso e cosa dovrebbe restare nello stem other. Più il modello è buono, migliori diventano queste stime.

Per questo i risultati possono essere impressionanti ma non matematicamente perfetti. Una voce separata può contenere ancora un po’ di piatti o di texture di chitarra. Una traccia strumentale può conservare una lieve ombra vocale, soprattutto nelle code di riverbero. Uno stem di batteria può includere parte dell’attacco del basso se kick e basso sono stratificati molto strettamente. Non sono errori casuali. Sono il segno della difficoltà di fondo: in un mix finito, le sorgenti si sovrappongono fisicamente.

In una buona separazione, questi artefatti sono abbastanza piccoli da rendere l’output utile. Per karaoke, pratica, remix, campionamento o analisi, una stima di alta qualità è spesso esattamente ciò che serve al workflow.

Rimozione Vocale vs. Separazione in Stem

La rimozione vocale e la separazione in stem sono correlate, ma servono compiti creativi diversi.

AI Vocal Remover è migliore quando la domanda è specifica: "Posso rimuovere la voce principale?" oppure "Posso estrarre la voce?" Le uscite attese sono di solito un acapella e uno strumentale. Questo lo rende adatto a karaoke, esercizio per cover, analisi vocale e basi rapide.

AI Stem Splitter è migliore quando vuoi lavorare sulla struttura del mix. L’output a quattro stem ti dà voce, batteria, basso e altri strumenti. È utile quando vuoi silenziare la batteria per esercitarti, isolare una linea di basso, campionare un groove, costruire un remix, studiare l’arrangiamento o riequilibrare parti del brano in una DAW.

Dal punto di vista tecnico, la separazione a quattro stem è un compito più dettagliato. Il modello non deve solo decidere cosa è voce e cosa non lo è, ma anche come dividere l’accompagnamento in gruppi musicalmente significativi. È utile, ma significa anche che ci sono più confini in cui possono verificarsi piccole perdite di segnale.

La scelta giusta dipende dall’obiettivo. Se vuoi una traccia strumentale, usa la rimozione vocale. Se vuoi più controllo creativo sull’arrangiamento, usa la separazione in stem.

Cosa Influenza la Qualità della Separazione

Il file in ingresso conta. Un WAV o FLAC pulito di solito offre al modello più dettagli utili di un MP3 a basso bitrate. Un audio di alta qualità non garantisce stem perfetti, ma fornisce al modello un segnale migliore da analizzare.

Conta anche l’arrangiamento. Brani scarni con voce chiara, batteria definita e una linea di basso stabile sono in genere più facili da separare. Mix rock densi, tracce synth molto stratificate, registrazioni live, chitarre distorte, rumore del pubblico e lunghe code di riverbero sono più difficili. Questi suoni possono coprirsi a vicenda sia in frequenza sia nel tempo.

Anche le scelte di mix hanno importanza. Se la voce è immersa in delay e riverbero, la voce secca può separarsi bene mentre l’ambiente resta in parte nello strumentale. Se kick e basso sono fortemente sidechainati o distorti insieme, le basse frequenze possono essere più difficili da dividere in modo pulito. Se cori, voce principale e pad synth occupano gamme simili, parte della texture può spostarsi tra gli stem.

Questo è il modo onesto di intendere la source separation AI: non è un pulsante lossless per "smixare al contrario", ma è uno strumento potente di ricostruzione. I risultati migliori arrivano fornendo al modello una sorgente pulita, scegliendo la modalità di separazione corretta e usando l’output come materiale creativo invece di aspettarsi una perfetta multitraccia da studio.

Perché l’Accelerazione GPU è Importante

La source separation è molto più pesante di un filtro audio tradizionale. Un filtro può applicare una regola fissa. Un modello come Demucs esegue inferenza di reti neurali profonde sull’audio, analizzando tempo, frequenza e contesto prima di produrre nuovi output audio.

Un flusso di source separation in stile Demucs eseguito su infrastruttura GPU

Questo costo computazionale è uno dei motivi per cui l’accelerazione GPU è importante. Le GPU moderne sono progettate per la matematica parallela utilizzata dalle reti neurali. Eseguire la separazione su una GPU potente può far sembrare il processo uno strumento vero e proprio, invece di un progetto tecnico di configurazione.

Noi eseguiamo questo processamento su GPU NVIDIA A100. Il punto importante per gli utenti non è il nome dell’hardware in sé. È ciò che quell’hardware rende possibile: tempi di risposta più rapidi, elaborazione stabile per modelli impegnativi e nessuna necessità di installare localmente Python, CUDA, checkpoint dei modelli o strumenti da riga di comando.

Tu carichi l’audio. Il sistema gestisce il lavoro pesante di inferenza.

Approfondimenti

Se vuoi approfondire la tecnologia alla base, inizia dal repository Demucs e dal paper di ricerca HTDemucs. Per il contesto hardware, la pagina NVIDIA sulla GPU A100 Tensor Core spiega la classe di infrastruttura GPU comunemente usata per i carichi di lavoro AI.

Come Questo Diventa una Funzionalità di CreateMusicAI

CreateMusicAI trasforma questo flusso tecnico in due strumenti semplici: AI Vocal Remover e AI Stem Splitter.

Il livello di prodotto è volutamente semplice: Nessuna installazione richiesta. Carica un file audio, scegli se vuoi la rimozione vocale o la separazione completa in stem, e lascia che il processamento alimentato da A100 gestisca il lavoro pesante. Non devi installare Demucs, configurare driver GPU, scegliere file modello o eseguire comandi da terminale.

Dietro l’interfaccia c’è una tecnologia seria di separazione delle sorgenti. Davanti a te c’è un flusso di lavoro rapido e pratico per trasformare brani finiti in stem di alta qualità, pronti per la creatività: strumentali, acapella, batteria, basso e altri stem per karaoke, remix, pratica, analisi e creazione di contenuti.

Rimuovi voce da canzone con AI

Carica un brano e separa voce e base usando l'AI. Ottieni acapella pulite o backing track per karaoke, remix, apprendimento o creazione di contenuti, senza installare software.

0:00 / 0:00
Vocale
LR
0
75
Strumentale
LR
0
75
Carica audio per rimuovere la voce