← Все статьи
Новости

Сбер выложил в опенсорс аудио-модели GigaAM Multilingual и GigaChat Audio

15 июля 2026 4 мин чтения
🚀

Распознавание редких языков

Сбер открыл веса GigaAM Multilingual — стека распознавания речи для русского, казахского, киргизского, узбекского и английского языков. Базовый аудиоэнкодер обучен на 2 млн часов речи, благодаря чему быстро адаптируется под новые домены: например, после дообучения на одном датасете для башкирского и грузинского языков ошибка распознавания (WER) опустилась до ~4% — против более 11% у Whisper Encoder на тех же данных. При этом компактная модель CTC ASR всего на 240 млн параметров обходит по качеству куда более крупные Whisper Large v3 и Omnilingual 1B.

GigaChat Audio: не просто транскрипция

Вторая модель, GigaChat Audio, построена поверх GigaAM Multilingual и GigaChat3.1-10B-A1.8B и умеет держать в контексте до двух часов аудио. Ключевая способность — temporal grounding: модель не просто расшифровывает запись, а находит на длинной дорожке конкретные события и делает выжимку с таймстемпами. На записях от 20 до 60 минут точность локализации событий у неё — 48.3, тогда как у зарубежных Voxtral, Phi-4 и Qwen3-Omni показатели близки к нулю. На бенчмарке RuBQ-Audio модель набирает 60.0 против 43.7 у Qwen3-Omni. Вместе с весами опубликован и датасет TimeGround-1M для обучения именно этой привязке событий ко времени.

Где это уже работает

Полноразмерная GigaChat-Max-Audio уже доступна на giga.chat, а распознавание голосовых на пяти языках работает в боте @smartspeech_sber_bot. Для тех, кто разбирает многочасовые записи созвонов или лекций, инструмент с таймстемпами по событиям — это уже не просто транскрибация, а реальный поиск по смыслу записи.

При чём тут видео

Звук — не менее важная часть генеративного видео, чем картинка: например, в Seedance 2.0 в генераторе TTV можно сразу получить ролик с нативной аудиодорожкой, а не озвучивать его отдельно.

Попробуйте сами
Runway, Veo, Kling и Seedance — видео из текста или фото за 60 секунд.
✦ Начать
Ещё из блога
Индустрия
Netflix: генеративный ИИ уже в ~300 тайтлах и меняет экономику продакшена
На отчётном звонке за Q2 2026 Netflix заявил, что AI-воркфлоу использовались примерно в 300 тайтлах. Пример — 17 минут AI-кадров в сериале за половину стоимости и вдвое быстрее.
21 июля 2026 5 мин
Новости
SenseNova U1: открытая модель картинок с нативным 8K и версией под инфографику
Китайская open-source модель генерации изображений SenseNova U1 вышла в версии V3: нативное разрешение до 8K, сверхширокие и сверхвысокие кадры, редактирование и отдельная версия под тексты и инфографику. Есть GGUF под 10-12 ГБ VRAM.
21 июля 2026 4 мин
🚀 Новости
Lucy 2.5: реалтайм-композ и редактирование видео прямо в потоке
Decart обновил Lucy до версии 2.5 — редактирование видео в реальном времени: замена персонажей и фона, VFX и виртуальная примерка прямо на вебке или в трансляции с почти нулевой задержкой.
21 июля 2026 4 мин