Så fungerar AI-borttagning av sång och stem-separering
2026/05/13

Så fungerar AI-borttagning av sång och stem-separering

En praktisk genomgång av Demucs, källseparering och hur CreateMusicAI gör avancerad ljudseparering till lättanvända verktyg för kreatörer.

Det sägs att det inte går att ta isär en färdigbakad kaka. Att separera en färdig låt i sång, trummor och bas har länge känts ungefär likadant: beståndsdelarna går att höra, men inte att plocka isär utan rester. AI-baserad källseparering återskapar inte den ursprungliga studiosessionen, men kan i dag göra förvånansvärt användbara uppskattningar.

Därför börjar många ljudverktyg med en praktisk fråga: går det att ta bort sången från låten, eller dela upp spåret i delar som går att arbeta vidare med?

För en lyssnare är en färdig låt en helhet. För en producent, DJ, sångare, lärare eller innehållsskapare innehåller samma låt flera användbara lager: sång, ett trumkomp, en basgång och resten av arrangemanget. AI-borttagning av sång och AI-baserad stem-separering försöker göra om den färdiga mixen till separata ljudfiler.

På ytan är flödet enkelt: ladda upp en låt, välj önskat resultat och ladda ner filerna. Under ytan är detta ett av de mer intressanta problemen inom musik-AI. Ljudfilen innehåller inga separata mappar märkta ”sång”, ”trummor” och ”bas”. Den innehåller en enda mixad vågform där ljuden överlappar i tid, frekvens, ljudstyrka, stereoposition och efterklang.

Därför använder moderna verktyg modeller för källseparering, exempelvis Demucs, i stället för äldre metoder som EQ-filtrering eller utsläckning av mittkanalen.

Vad innebär källseparering?

Källseparering innebär att enskilda ljudkällor uppskattas utifrån en mixad ljudsignal. För musik är de vanligaste målen sång, trummor, bas och övriga instrument. När en modell skapar fyra sådana utgångar kallas de normalt för stems.

AI-baserad vocal removal är en smalare variant av samma princip. I stället för fyra stems delas ljudet in i två breda grupper:

  • sång
  • ackompanjemang, alltså instrumentalspåret utan sången.

Det passar för karaokeversioner, a cappella-spår, covers, sångövning, remixskisser och snabba arrangemangsexperiment. Stem-separering ger mer kontroll genom att dela mixen i sång, trummor, bas och övrigt. Det är användbart för remixning, sampling, instudering av stämmor och analys av en låts produktion.

Båda arbetsflödena bygger på samma grundproblem: modellen lyssnar på en färdig mix och uppskattar vilka delar av signalen som sannolikt tillhör respektive källa.

Varför är en färdig låt svår att dela upp?

Om musik vore prydligt indelad efter frekvens skulle källseparering vara enkel. Då kunde låga frekvenser tas bort för bas, höga för cymbaler och mellanregistret användas för sång. Verklig musik fungerar inte så.

Överlappande ljudlager gör källseparering svår

En röst kan ligga i samma frekvensområde som gitarrer, syntar, piano, virveltrumma och rumsreflexer. Kick och elbas kan dela samma basregister. Sångens efterklang kan spridas över stereobilden och flyta ihop med pads eller bakgrundsinstrument. Komprimering vid mastring kan dessutom binda ihop ljuden ännu mer.

Det förklarar varför äldre vocal remover-metoder ofta gav ojämna resultat. Många antog att leadsången låg i stereobildens mitt och försökte släcka mittkanalen. Metoden kan fungera för vissa låtar, men riskerar samtidigt att ta bort kick, bas, virvel och annat som ligger nära mitten. Den har också svårt för reverb, körsång, stereoeffekter och täta moderna produktioner.

AI-baserad källseparering fungerar annorlunda. Den skär inte bara bort ett frekvensband eller en stereoposition. En tränad modell känner igen mönster som brukar tillhöra olika ljudkällor: hur en röst ser ut i signalen, hur trummor utvecklas över tid, vad bastoner bidrar med och hur övriga instrument fyller arrangemanget.

Demucs bakom arbetsflödet

Demucs är ett open source-projekt för musikalisk källseparering som skapades av Alexandre Défossez och ursprungligen utvecklades på Meta AI. Projektet beskriver Demucs som en avancerad modell som kan separera låtar i trummor, bas, sång och övrigt ackompanjemang.

Den version som är mest relevant i moderna arbetsflöden är Hybrid Transformer Demucs, vanligen kallad HTDemucs. Projektet beskriver den som en hybridmodell som kombinerar spektrogram och vågform med Transformers. Det innebär att modellen kan använda både ljudets råa form över tid och en frekvensbild av mixen. Vågformsdelen hjälper till att bevara timing, transienter och små detaljer. Spektrogramdelen hjälper modellen att känna igen harmoniska mönster och frekvensmönster. Transformer-lagren ger ett bredare musikaliskt sammanhang, så att en sångfras, ett trumkomp eller en basgång kan förstås som något som utvecklas över tid och inte bara som isolerade ljudskivor.

Demucs har också ett tvåstamsläge för sång, bland annat via alternativet --two-stems=vocals. Samma modellfamilj kan därför användas både för ett vocal remover-flöde och för en fullständig stem splitter.

Den som vill läsa mer om tekniken hittar forskningsunderlaget i artikeln Hybrid Transformers for Music Source Separation.

Vad uppskattar modellen egentligen?

Det är viktigt att beskriva resultatet korrekt. AI-separering återställer inte den ursprungliga studiosessionen. När en låt har exporterats från en DAW, mastrats, komprimerats och getts ut finns multitrackinformationen inte längre kvar i stereofilen i en ren och reversibel form.

Modellen gör en kvalificerad uppskattning. Utifrån den mixade signalen förutsäger den hur sångspåret, trummorna och basen sannolikt låter och vad som bör hamna i spåret för övriga instrument. Ju bättre modellen är, desto bättre blir uppskattningarna.

Därför kan resultatet vara imponerande utan att vara matematiskt perfekt. Ett separerat sångspår kan innehålla lite cymbalklang eller gitarrtextur. Instrumentalspåret kan behålla en svag skugga av rösten, särskilt i reverbsvansar. Ett trumspår kan innehålla en del av basanslaget när kick och bas ligger tätt tillsammans. Det är inte slumpmässiga fel, utan följder av att ljudkällorna fysiskt överlappar i en färdig mix.

Vid en bra separering är artefakterna tillräckligt små för att resultatet ska bli användbart. För karaoke, övning, remixning, sampling och analys är en bra uppskattning ofta precis vad arbetsflödet behöver.

Vocal remover eller stem splitter?

Verktygen bygger på samma teknik men löser olika kreativa uppgifter.

En AI vocal remover passar när frågan är specifik: ”Kan jag ta bort leadsången?” eller ”Kan jag extrahera sången?” Resultatet är normalt ett a cappella-spår och ett instrumentalspår. Det passar för karaoke, coverövning, sånganalys och snabba bakgrundsspår.

En AI stem splitter passar bättre när du vill arbeta med mixens uppbyggnad. Fyra stems ger sång, trummor, bas och övriga instrument. Då går det att stänga av trummorna under övning, isolera en basgång, sampla ett groove, bygga en remix, studera arrangemanget eller balansera om delar i en DAW.

Ur teknisk synvinkel är separering i fyra stems en mer detaljerad uppgift. Modellen måste inte bara skilja sång från resten, utan också dela upp ackompanjemanget i musikaliskt meningsfulla grupper. Det ger större kontroll men också fler gränser där lite överhörning kan uppstå.

Rätt val beror på målet. Behöver du ett instrumentalspår använder du vocal removal. Behöver du större kontroll över arrangemanget väljer du stem-separering.

Vad påverkar kvaliteten?

Källfilen spelar roll. En ren WAV- eller FLAC-fil innehåller normalt mer användbar detalj än en MP3 med låg bithastighet. Hög ljudkvalitet garanterar inte perfekta stems, men ger modellen en bättre signal att analysera.

Även arrangemanget påverkar resultatet. Sparsmakade låtar med tydlig sång, avgränsade trummor och en stabil basgång är i regel enklare att separera. Täta rockmixar, lager av syntar, liveinspelningar, distorderade gitarrer, publikljud och långa reverbsvansar är svårare eftersom ljuden täcker varandra både i tid och frekvens.

Mixbesluten har också betydelse. Om sången har mycket delay och reverb kan den torra rösten separeras väl samtidigt som delar av rumsklangen blir kvar i instrumentalspåret. Om kick och bas är kraftigt sidechain-komprimerade eller distorderade tillsammans blir basregistret svårare att dela. När leadsång, körer och synthpads ligger i samma register kan texturer flytta mellan olika stems.

Det är den ärliga bilden av AI-baserad källseparering: den är inte en förlustfri knapp som ”mixar isär” filen, utan ett starkt rekonstruktionsverktyg. Bäst resultat kommer från en ren källa, rätt separeringsläge och en förväntan om att filerna är kreativt arbetsmaterial, inte perfekta studiomultitracks.

Därför spelar GPU-acceleration roll

Källseparering är betydligt tyngre än ett traditionellt ljudfilter. Ett filter följer en fast regel. En modell som Demucs kör djup neuronnätverksinferens över ljudet, analyserar tid, frekvens och sammanhang och skapar sedan nya ljudfiler.

Arbetsflöde för källseparering i stil med Demucs på GPU-infrastruktur

Beräkningsbehovet är en anledning till att GPU-acceleration har betydelse. Moderna GPU:er är byggda för den parallella matematik som neuronnät använder. Med en kraftfull GPU kan källsepareringen fungera som ett praktiskt verktyg i stället för ett installationsprojekt.

Vi kör bearbetningen på NVIDIA A100-GPU:er. Hårdvarunamnet är inte huvudpoängen för användaren. Det viktiga är vad infrastrukturen möjliggör: kortare väntetid, stabil bearbetning för krävande modeller och inget behov av att installera Python, CUDA, modellfiler eller kommandoradsverktyg lokalt.

Du laddar upp ljudet. Systemet sköter den tunga inferensen.

Vidare läsning

Vill du fördjupa dig i tekniken kan du börja med Demucs-projektet och forskningsartikeln om HTDemucs. NVIDIA:s sida om A100 Tensor Core GPU beskriver den typ av GPU-infrastruktur som ofta används för AI-arbetslaster.

Så blir tekniken en funktion i CreateMusicAI

CreateMusicAI gör det tekniska flödet till två lättanvända verktyg: AI vocal remover och AI stem splitter.

Produktflödet är avsiktligt enkelt och kräver ingen installation. Ladda upp en ljudfil, välj om du vill ta bort sång eller separera fullständiga stems och låt den A100-baserade bearbetningen sköta resten. Du behöver inte installera Demucs, konfigurera GPU-drivrutiner, välja modellfiler eller köra terminalkommandon.

Bakom gränssnittet finns avancerad teknik för källseparering. Framför användaren finns ett praktiskt flöde som gör färdiga låtar till kreativa stems: instrumentalspår, a cappella, trummor, bas och övriga instrument för karaoke, remixning, övning, analys och innehållsskapande.

AI Vocal Remover

Ladda upp en låt och separera sången från instrumentalen med AI. Skapa rena acapellaspår eller bakgrundsspår för karaoke, remixar, övning och innehåll – utan att installera något program.

0:00 / 0:00
Sång
LR
0
75
Instrumental
LR
0
75
Ladda upp ljud och ta bort sång