Підвищення ефективності та продуктивності в детекції глибоких підробок аудіо через механізми нейронного дропіна та нейропластичності
https://ift.tt/GAQle20
Поточна детекція аудіо глибоких підробок досягла видатних результатів із використанням різноманітних архітектур глибокого навчання, таких як ResNet, і зазнала подальших покращень завдяки впровадженню великих моделей (LM) на кшталт Wav2Vec. Успіх великих мовних моделей (LLM) демонструє переваги масштабування параметрів моделі, але водночас висвітлює одну вузьку місцевість, де приріст продуктивності обмежується кількістю параметрів. Просто додавання нових шарів, як це робиться в сучасних LLM, є обчислювально витратним і вимагає повного повторного навчання. Більшість існуючих методів адаптації з низьким рангом застосовуються переважно до архітектур на основі уваги, що обмежує їх застосування. Надихнувшись нейронною пластичністю, яку спостерігають у мозку ссавців, ми пропонуємо нові алгоритми — dropin та подальшу пластичність — що динамічно регулюють кількість нейронів у певних шарах для гнучкого модулювання параметрів моделі. Ми оцінюємо ці алгоритми на кількох архітектурах, включаючи ResNet, увімкнені рецурентні нейронні мережі (Gated Recurrent Neural Networks) та Wav2Vec. Експериментальні результати на широко відомому наборі даних ASVSpoof2019 LA, PA та FakeorReal демонструють стабільні покращення обчислювальної ефективності за допомогою підходу dropin та максимальне близько 39% та 66% відносне скорочення рівня помилок рівності (Equal Error Rate) відповідно для dropin та пластичності серед цих наборів даних. Код і додаткові матеріали доступні за посиланням на Github.
HI-FI News
через штучний інтелект https://ift.tt/tCGfY4k
26 березня 2026 року, 04:09 ранку
March 26, 2026 at 04:09AM

Залишити відповідь
Щоб відправити коментар вам необхідно авторизуватись.