← Все статьи
Новости

Сбер выложил в опенсорс аудио-модели GigaAM Multilingual и GigaChat Audio

15 июля 2026 4 мин чтения
🚀

Распознавание редких языков

Сбер открыл веса GigaAM Multilingual — стека распознавания речи для русского, казахского, киргизского, узбекского и английского языков. Базовый аудиоэнкодер обучен на 2 млн часов речи, благодаря чему быстро адаптируется под новые домены: например, после дообучения на одном датасете для башкирского и грузинского языков ошибка распознавания (WER) опустилась до ~4% — против более 11% у Whisper Encoder на тех же данных. При этом компактная модель CTC ASR всего на 240 млн параметров обходит по качеству куда более крупные Whisper Large v3 и Omnilingual 1B.

GigaChat Audio: не просто транскрипция

Вторая модель, GigaChat Audio, построена поверх GigaAM Multilingual и GigaChat3.1-10B-A1.8B и умеет держать в контексте до двух часов аудио. Ключевая способность — temporal grounding: модель не просто расшифровывает запись, а находит на длинной дорожке конкретные события и делает выжимку с таймстемпами. На записях от 20 до 60 минут точность локализации событий у неё — 48.3, тогда как у зарубежных Voxtral, Phi-4 и Qwen3-Omni показатели близки к нулю. На бенчмарке RuBQ-Audio модель набирает 60.0 против 43.7 у Qwen3-Omni. Вместе с весами опубликован и датасет TimeGround-1M для обучения именно этой привязке событий ко времени.

Где это уже работает

Полноразмерная GigaChat-Max-Audio уже доступна на giga.chat, а распознавание голосовых на пяти языках работает в боте @smartspeech_sber_bot. Для тех, кто разбирает многочасовые записи созвонов или лекций, инструмент с таймстемпами по событиям — это уже не просто транскрибация, а реальный поиск по смыслу записи.

При чём тут видео

Звук — не менее важная часть генеративного видео, чем картинка: например, в Seedance 2.0 в генераторе TTV можно сразу получить ролик с нативной аудиодорожкой, а не озвучивать его отдельно.

Попробуйте сами
Runway, Veo, Kling и Seedance — видео из текста или фото за 60 секунд.
✦ Начать
Ещё из блога
✍️ Гайды
GPT Image 2 против Nano Banana 2: что лучше показал практический тест
Сравнили новую модель генерации изображений GPT Image 2 с Nano Banana 2 на серии одинаковых промптов: у кого лучше пространственная логика, точность текста и чистота картинки.
15 июля 2026 4 мин
📊 Индустрия
Кейс: как режиссёр рекламы собрал ИИ-ролик с нуля и на что ушли 75 долларов
Режиссёр рекламы Эльшан Алескеров подробно расписал недельный процесс сборки скетч-ролика из нескольких нейросетей — от сценария на бумаге до финального монтажа в Premiere.
15 июля 2026 5 мин
🚀 Новости
Что нового у Runway, Luma и Kling: разбор свежих инструментов для AI-видео
Runway выпустил приложения Ad Concepter и Multi-Shot, Luma представила Creative Agents, а Kling довезла Motion Control до третьей версии модели — собрали, что каждый инструмент умеет на практике.
15 июля 2026 5 мин