Ефективний конвеєр виведення на основі vLLM для узгодженого розуміння та генерації аудіо
https://ift.tt/Ox8SqCL
Хоча великі мультимодальні моделі демонструють високу здатність до розуміння, високопродуктивні двигуни виведення не мають нативної підтримки мультимодальної генерації. Це особливо стосується моделей перетворення мовлення на текст (Speech Language Models), де генерація багатошарових аудіо-токенів за допомогою відокремлених AR+NAR або синхронного багатопотокового прогнозування (MTP) з чергуванням за затримкою суперечить типовим однопоточним циклам. Ми представляємо конвеєр виведення на основі vLLM для узгодженого розуміння та генерації мовлення. Ми розширюємо автогенеративне декодування до нативного виконання деінтерleaving затримки за схемою затримки та координованого багатопоточкового вибірки, інтегруючи акустичний декодер на GPU для завершеного синтезу форми сигналу. Важливо, ми подолали спільне уявлення про те, що CFG (кероване без класифікаційного сигналу) зменшує пропускну спроможність наполовину. Делікуючи спільний розклад парних умовних та безумовних запитів у безперервній партії, наша реалізація CFG утримує 80% пропускної спроможності без CFG, поглинаючи накладні витрати на подвійний запит та злиття логітів. Ми відкриваємо код нашої системи як відкритий проект.
HI-FI News
через штучний інтелект https://ift.tt/3izZtbc
3 липня 2026 року, 05:49 за київським часом
July 3, 2026 at 05:49AM

Залишити відповідь
Щоб відправити коментар вам необхідно авторизуватись.