
MusicZed Magazine
جداسازی صدای خواننده و ساز با هوش مصنوعی چیست و به چه کار میآید؟
تصور کنید آهنگی دارید که فقط یک فایل صوتی کامل است، اما میخواهید صدای خواننده را حذف کنید تا کارائوکه بسازید. تا چند سال پیش این کار تقریباً غیرممکن یا بسیار ناقص بود. امروز مدلهای هوش مصنوعی میتوانند اجزای یک آهنگ را با کیفیت قابل قبولی از هم جدا کنند. به این کار «جداسازی استم» گفته میشود.
استم چیست؟
استم (Stem) یک گروه از صداها در آهنگ است؛ مثلاً همهی صداهای خواننده، درام، بیس یا سازهای ملودیک. در استودیو هر استم جداگانه ضبط و میکس میشود. اما فایل نهایی همه را با هم ترکیب میکند. مدلهای جداسازی سعی میکنند این ترکیب را دوباره تفکیک کنند.
چگونه کار میکند؟
مدل آموزش میبیند که ویژگیهای صدای انسان، درام و بیس را در طیف فرکانسی تشخیص دهد. سپس هر بخش را بهصورت جداگانه بازسازی میکند. چون این کار حدسزدنی است، نتیجه همیشه بینقص نیست و ممکن است بخشی از یک صدا در استم دیگر نفوذ کند.
کاربردها
- ساخت نسخهی بیکلام یا کارائوکه
- ریمیکس و مشاشپ
- مطالعهی تنظیم: شنیدن مجزای خط بیس یا درام
- تمرین نوازندگان روی یک ساز خاص
- اصلاح میکس آهنگهایی که فقط فایل نهاییشان باقی مانده
چه چیزهایی را در نظر بگیریم؟
کیفیت نتیجه به کیفیت فایل ورودی وابسته است. فایلهای با فشردهسازی شدید معمولاً جداسازی ضعیفتری دارند. همچنین استفاده از آهنگ دیگران باید با احترام به حقوق آنها باشد؛ جداسازی صدا حق مالکیت شما را ایجاد نمیکند.
نکته برای شروع
اگر آهنگ خودتان است، از بهترین کیفیت موجود استفاده کنید و پس از جداسازی، هر استم را جداگانه بشنوید. اگر نویز یا ناهمواری شنیدید، با ابزارهای ویرایش صدا کمی آن را اصلاح کنید.