Аудіовізуальна контрастивна прив’язка для дифузійного базованого на зоровому факторі вдосконалення мови у шумному середовищі
https://ift.tt/2MH4wD0
Аудіовізуальне вдосконалення мови (AVSE) використовує візуальні підказки, такі як рухи губ, для відновлення мови в зашумлених умовах. Останні роботи запровадили діфузійне, без вчителя AVSE, де модель діфузії мови, умови на основі візуальних ознак через крос-уважання, навчана та використовується як дані-орієнтований пріор для відбору за допомогою розподілу постеріор. Незважаючи на обіцяльні результати порівняно з лише аудіо версією, вплив явного забезпечення крос-модальної прив’язки у злитті залишається невизначеним. У цій роботі ми пропонуємо доповнити об’єктив навчання діфузії контрастивним аудіовізуальним втратою, щоб заохотити більш значу використання візуальної інформації, залишаючи рамку постеріорного відбору без змін. Експерименти на зро́джних та розбіжних тестових даних демонструють послідовне покращення у придушенні інтерференції, відтворенні сигналу та перцепційній якості, з найбільшими виграшами на низьких SNR. Код доступний на https://github.com/ cexauce/AV-CA-DiffUSE
HI-FI News
через Штучний інтелект https://ift.tt/oQ4nqiz
24 червня 2026 року, 05:49 AM
June 24, 2026 at 05:49AM

Залишити відповідь
Щоб відправити коментар вам необхідно авторизуватись.