An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation

від

у

Ефективний конвеєр виведення на основі vLLM для узгодженого розуміння та генерації аудіо

https://ift.tt/Ox8SqCL

Хоча великі мультимодальні моделі демонструють високу здатність до розуміння, високопродуктивні двигуни виведення не мають нативної підтримки мультимодальної генерації. Це особливо стосується моделей перетворення мовлення на текст (Speech Language Models), де генерація багатошарових аудіо-токенів за допомогою відокремлених AR+NAR або синхронного багатопотокового прогнозування (MTP) з чергуванням за затримкою суперечить типовим однопоточним циклам. Ми представляємо конвеєр виведення на основі vLLM для узгодженого розуміння та генерації мовлення. Ми розширюємо автогенеративне декодування до нативного виконання деінтер­leaving затримки за схемою затримки та координованого багатопоточкового вибірки, інтегруючи акустичний декодер на GPU для завершеного синтезу форми сигналу. Важливо, ми подолали спільне уявлення про те, що CFG (кероване без класифікаційного сигналу) зменшує пропускну спроможність наполовину. Делікуючи спільний розклад парних умовних та безумовних запитів у безперервній партії, наша реалізація CFG утримує 80% пропускної спроможності без CFG, поглинаючи накладні витрати на подвійний запит та злиття логітів. Ми відкриваємо код нашої системи як відкритий проект.

HI-FI News

через штучний інтелект https://ift.tt/3izZtbc

3 липня 2026 року, 05:49 за київським часом

July 3, 2026 at 05:49AM