Распознавание редких языков
Сбер открыл веса GigaAM Multilingual — стека распознавания речи для русского, казахского, киргизского, узбекского и английского языков. Базовый аудиоэнкодер обучен на 2 млн часов речи, благодаря чему быстро адаптируется под новые домены: например, после дообучения на одном датасете для башкирского и грузинского языков ошибка распознавания (WER) опустилась до ~4% — против более 11% у Whisper Encoder на тех же данных. При этом компактная модель CTC ASR всего на 240 млн параметров обходит по качеству куда более крупные Whisper Large v3 и Omnilingual 1B.
GigaChat Audio: не просто транскрипция
Вторая модель, GigaChat Audio, построена поверх GigaAM Multilingual и GigaChat3.1-10B-A1.8B и умеет держать в контексте до двух часов аудио. Ключевая способность — temporal grounding: модель не просто расшифровывает запись, а находит на длинной дорожке конкретные события и делает выжимку с таймстемпами. На записях от 20 до 60 минут точность локализации событий у неё — 48.3, тогда как у зарубежных Voxtral, Phi-4 и Qwen3-Omni показатели близки к нулю. На бенчмарке RuBQ-Audio модель набирает 60.0 против 43.7 у Qwen3-Omni. Вместе с весами опубликован и датасет TimeGround-1M для обучения именно этой привязке событий ко времени.
Где это уже работает
Полноразмерная GigaChat-Max-Audio уже доступна на giga.chat, а распознавание голосовых на пяти языках работает в боте @smartspeech_sber_bot. Для тех, кто разбирает многочасовые записи созвонов или лекций, инструмент с таймстемпами по событиям — это уже не просто транскрибация, а реальный поиск по смыслу записи.
При чём тут видео
Звук — не менее важная часть генеративного видео, чем картинка: например, в Seedance 2.0 в генераторе TTV можно сразу получить ролик с нативной аудиодорожкой, а не озвучивать его отдельно.