You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
Napraviti emulaciju gitarskih pojačala i efekata koja bi se mogla koristiti u realnom vremenu.
Motivacija:
Očuvanje audio opreme u digitalnom obliku, mogućnost korišćenja većeg broja opreme u jednom modelu, pravljenje novih efekata i zvukova kombinovanjem različitih modela koji modeluju drugačiju opremu.
Zbog toga što je problem u domenu zvuka, a planirano je da se modeli proizvedeni rešavanjem problema mogu praktično koristiti, potrebno je napraviti modele koji efikasno mogu raditi sa 44,100 uzoraka u sekundi (i to u realnom vremenu). Zbog toga će biti potrebno da se izaberu modeli sa relativno malim brojem skrivenih slojeva.
Problem bi bio rešen pristupom black-box audio modelling-a, gde nije poznato kako uređaj funkcioniše, samo su nam dati ulazni i izlazni signal.
Zbog činjenice da modeli veštačkih neuronskih mreža ne rade dobro sa podacima u domenu audio signala gde je potrebno modelovati uređaj koji efektuje signal na način da efekat traje duže od 50ms, za uređaje koji bi se modelovali bi bili izabrani neki od sledećih:
Gitarsko/Bass Pojačalo (sa i bez distorzije)
Overdrive pedale i efekti
Distortion pedale i efekti
Kompresor pedale i efekti
Equalizer pedale i efekti
Gitarski zvučnici i kabineti
Bilo kakav efekat ili uređaj koji kao nuspojavu svog rada ima efekat sličan kao gore naveden
Skup podataka
Rešavanje problema emulacije gitarskih pojačala i efekata primenom tehnika black-box modelling-a zahteva da postoje neefektovan signal kao ulaz i efektovan signal kao izlaz sa kojim bi se poredio model.
Dodatan skup neefektovanog gitarskog signala koji bi bio ručno pravljen/snimljen
Skup podataka koji ima efektovan signal bi se ručno pravio, provođenjem neefektovanog signala kroz različite audio uređaje, gitarska/bass pojačala i pedale.
Skupovi podataka bi bili kombinovani u jedan veći skup, potom na slučajan način podeljeni u podskupove od 80% za trening, 10% za test i 10% za validaciju.
Metodologija
U radovima koji su rešavali sličan problem [1][2], korišćene su dva tipa neuronskih mreža, jedna na bazi WaveNet arhitekture, a druga na bazi arhitektura rekurentnih neuronskih mreža od koje postoje dva različita modela, jedan na bazi LSTM a drugi na bazi GRU arhitekture. Ideja je da se naprave 3 deep neural network modela (WaveNet, LSTM i GRU) i da se uporede po brzini inferencije i preciznosti.
Svaki različit audio uređaj bi trebalo da ima 3 zasebna modela, jedan baziran na WaveNet-u, jedan na LSTM-u i jedan na GRU-u.
Evaluacija - definisati kako planirate da evaluirate vaše rešenje i koju meru/mere performansi planirate da koristite.
Glavne mere performansi će biti ESR (error-to-signal ratio) loss i MSE (mean squared errror) loss za preciznost modela.
Za brzinu inferencije modela bi se napravio poseban benchmark za svaki od 3 tipa modela, gde je cilj da model bude što brži na CPU.
Tim
Definicija problema
Problem:
Motivacija:
Zbog toga što je problem u domenu zvuka, a planirano je da se modeli proizvedeni rešavanjem problema mogu praktično koristiti, potrebno je napraviti modele koji efikasno mogu raditi sa 44,100 uzoraka u sekundi (i to u realnom vremenu). Zbog toga će biti potrebno da se izaberu modeli sa relativno malim brojem skrivenih slojeva.
Problem bi bio rešen pristupom black-box audio modelling-a, gde nije poznato kako uređaj funkcioniše, samo su nam dati ulazni i izlazni signal.
Zbog činjenice da modeli veštačkih neuronskih mreža ne rade dobro sa podacima u domenu audio signala gde je potrebno modelovati uređaj koji efektuje signal na način da efekat traje duže od 50ms, za uređaje koji bi se modelovali bi bili izabrani neki od sledećih:
Skup podataka
Rešavanje problema emulacije gitarskih pojačala i efekata primenom tehnika black-box modelling-a zahteva da postoje neefektovan signal kao ulaz i efektovan signal kao izlaz sa kojim bi se poredio model.
Skupovi podataka koji imaju neefektovan signal:
Skup podataka koji ima efektovan signal bi se ručno pravio, provođenjem neefektovanog signala kroz različite audio uređaje, gitarska/bass pojačala i pedale.
Skupovi podataka bi bili kombinovani u jedan veći skup, potom na slučajan način podeljeni u podskupove od 80% za trening, 10% za test i 10% za validaciju.
Metodologija
U radovima koji su rešavali sličan problem [1] [2], korišćene su dva tipa neuronskih mreža, jedna na bazi WaveNet arhitekture, a druga na bazi arhitektura rekurentnih neuronskih mreža od koje postoje dva različita modela, jedan na bazi LSTM a drugi na bazi GRU arhitekture. Ideja je da se naprave 3 deep neural network modela (WaveNet, LSTM i GRU) i da se uporede po brzini inferencije i preciznosti.
Svaki različit audio uređaj bi trebalo da ima 3 zasebna modela, jedan baziran na WaveNet-u, jedan na LSTM-u i jedan na GRU-u.
Evaluacija - definisati kako planirate da evaluirate vaše rešenje i koju meru/mere performansi planirate da koristite.