Tencent AI Open Sources Covo-Audio: A 7B Speech Language Model and Inference Pipeline for Real-Time Audio Conversations and Reasoning

від

у

Tencent AI Open Sources Covo-Audio: 7B мовна модель з обробкою мови та інференс-процес для реального часу аудіо-розмов та мислення
https://ift.tt/9W3ERtl

Tencent AI Lab випустила Covo-Audio, модель з 7 мільярдами параметрів, енд‑то‑енд Large Audio Language Model (LALM). Модель розроблена для уніфікації обробки мови та мовної інтелігенції шляхом прямої обробки безперервного аудіо на вході та генерації аудіо-виводу в рамках однієї архітектури.

Система: архітектура та компоненти
– Audio Encoder: модель використовує Whisper-large-v3 як основний енкодер завдяки стійкості до помітного шуму та різних акцентів. Цей компонент працює на частоті кадрів 50 Гц.
– Audio Adapter: для з’єднання енкодера та LLM використано спеціальний адаптер із трьома модулями зменшення розмірності, що інтегрує лінійні та згорткові шари, щоб зменшити частоту кадрів з 50 Гц до 6,25 Гц.
– LLM Backbone: система побудована на Qwen2.5-7B-Base, адаптованому для обробки послідовностей з безперервних акустичних ознак та текстових токенів.
– Speech Tokenizer and Decoder: токенізатор на основі WavLM-large використовує кодовий словник розміром 16 384 та генерує дискретні аудіо-токени з частотою 25 Гц. Декодер застосовує базову схему Flow-Matching (FM) та вокодер BigVGAN для відтворення високоякісних 24K хвиль.

Ієрархічне три-модальне чергування (Hierarchical Tri-modal Interleaving)
Ключовим внеском цієї роботи є стратегія Hierarchical Tri-modal Speech-Text Interleaving. На відміну від традиційних методів, які оперують лише на рівні слів або символів, цей фреймwrk узгоджує безперервні акустичні ознаки, дискретні голосові токени та природний мовний текст.
Модель використовує два основні патерни:
1) Послідовне чергування (Sequential Interleaving): безперервні ознаки, текст та дискретні токени розташовані у послідовному ланцюжку.
2) Паралельна інтеграція (Parallel Integration): безперервні ознаки узгоджуються з поєднаним текстово-дискретним блоком.
Ієрархічний аспект забезпечує структурну узгодженість за рахунок використання міжфразового чергування для тонкої вирівнювання та міжречевого чергування для збереження глобальної семантики у довгих висловленнях. Навчання здійснювалося у двох етапах, обробляючи загалом 2 трлн токенів.

Розділення інтелектуальності та голосу (Intelligence-Speaker Decoupling)
Щоб зменшити високу вартість побудови великомасштабних діалогових даних для конкретних спікерів, команда запропонувала стратегію Intelligence Speaker Decoupling. Вона розділяє діалогову інтелектуальність та відтворення голосу, дозволяючи гнучу настройку голосу за допомогою мінімальних даних для синтезу мови (TTS).
Метод форматує високоякісні записи TTS у псевдодіалоги з використанням маскованої втрати тексту. Вилучаючи частину відповіді тексту з розрахунку втрат, модель зберігає свої вміння мислення, водночас успадковуючи природність мовного спікера. Це дозволяє персоналізований взаємодій без потреби у широких діапазонах діалогових даних для конкретного спікера.

Повнодуплексна голосова взаємодія (Full-Duplex Voice Interaction)
Covo-Audio розвинулося у Covo-Audio-Chat-FD, варіант, здатний до одночасної двохпотокової комунікації. Енкодер аудіо перероблено на режим пакетного стрімінгу, а потоки користувача та моделі взаємопереплітаються у відношенні 1:4. Кожен пакет становить 0,16 секунди аудіо.
Система керує станами розмови за допомогою специфічних архітектурних токенів:
– THINK Token: позначає стан лише прослуховування, поки модель очікує відповідь.
– SHIFT Token: означає перехід до черги мовлення моделі.
– BREAK Token: виявляє сигнали переривання (barge-ins), змушуючи модель закінчити говоріння та повернутися до режиму слухання.
У багатокурсних сценаріях модель реалізує рекурсивну стратегію заповнення контексту: безперервні аудіо-ознаки від входу користувача та згенеровані токени з попередніх раундів префіксуються як історичний контекст.

Аудіо-розуміння та навчання з підкріпленням (Audio Reasoning and Reinforcement Learning)
Для покращення складного мислення модель інтегрує Chain-of-Thought (CoT) та Group Relative Policy Optimization (GRPO). Модель оптимізується за допомогою веріфікованої комбінованої функції винагороди:
R_total = R_accuracy + R_format + R_consistency + R_thinking
Ця структура дозволяє оптимізувати правильність, дотримання структурованого виводу, логічну послідовність та глибину мислення.

Оцінка та продуктивність
Covo-Audio (7B) демонструє конкурентоспроможні або переважні результати на кількох оцінюваних бенчмарках, причому найсильніші заяви зроблено для моделей аналогічного масштабу та окремих завдань із мовленням/аудіо. На бенчмарку MMAU він досяг середнього балу 75,30%, найвищий серед оцінених 7B‑масштабних моделей. Значно преуспів у розумінні музики з результатом 76,05%. На бенчмарку MMSU Covo-Audio досягла лідируючої середньої точності 66,64%.
Щодо варіантів для діалогу, Covo-Audio-Chat показала сильні результати на URO-Bench, особливо в задачах розуміння мови та розмови, випередивши моделі на кшталт Qwen3-Omni на китайському треку. У завданнях емпатійної взаємодії на бенчмарку VStyle вона досягла стану мистецтва для мандарину з показниками злість 4.89, сум 4.93 та тривога 5.00.
Команда зазначає проблему “ранньої відповіді” на повнодуплексному режимі GaokaoEval: надмірно тривалі мовчазні паузи між фрагментами голосу можуть призвести до передчасних відповідей. Це поведінка, пов’язана із показником обробки пауз моделі, та вважається критичним напрямком для подальшої оптимізації.

Ключові висновки
– Уніфікована енд‑то‑енд архітектура: Covo-Audio — модель з 7B параметрів, яка нативно обробляє безперервні аудіо-входи та генерує високоякісні аудіо-виводи в рамках однієї єдиної архітектури. Відсутня потреба у каскадних ASR-LLM-TTS конвеєрах, що зменшує пропуск помилок та втрату інформації.
– Ієрархічне три-модальне чергування: модель використовує спеціалізовану стратегію для узгодження безперервних акустичних ознак, Discrete speech tokens та природного тексту. Чергування на рівнях фраз та речення дозволяє зберігати глобальну семантику та водночас уловлювати дрібні просодичні нюанси.
– Розмежування інтелекту спікера: команда вводить метод, який дозволяє розділити діалогову інтелектуальність від конкретного відтворення голосу, забезпечуючи гнучу настройку голосу за допомогою легковагових даних TTS та значно знижуючи витрати на розробку персоналізованих діалогових агентів.
– Внутрішньо‑глибока взаємодія: Covo-Audio-Chat-FD підтримує одночасне прослуховування та говоріння. Використовуються токени THINK, SHIFT та BREAK для координації складних взаємодій у реальному часі, таких як плавне чергування, супровід та примусове переривання користувачем.
– Вища параметрична ефективність: попри компактний розмір 7B, Covo-Audio демонструє стан-арт або високу конкурентоспроможність за ключовими бенчмарками (MMAU, MMSU, URO-Bench), часто відповідаючи або перевершуючи продуктивність набагато більших систем, таких як 32B-моделі, у задачах аудіо та розуміння мови.

Джерела
Перегляньте Paper, модель на HF та репозиторій:
– Paper: arxiv.org/pdf/2602.09823
– Модель на HF: huggingface.co/tencent/Covo-Audio-Chat
– Репозиторій: github.com/Tencent/Covo-Audio
Також слідкуйте за нами в Twitter та підписуйтеся на 120k+ ML SubReddit та наші оновлення (Newsletter). Також долучайтеся до Telegram.

Публікація Tencent AI Open Sources Covo-Audio: A 7B Speech Language Model and Inference Pipeline for Real-Time Audio Conversations and Reasoning з’явилася першою на MarkTechPost.

March 26, 2026 at 08:38AM


Коментарі

Залишити відповідь