Сбер обновил GigaChat Audio: модель считывает интонацию и запоминает факты из диалогов
Главным нововведением стало распознавание эмоций.

Сбера представила обновлённую версию GigaChat Audio: модель умеет обрабатывать аудиофайлы и голосовые сообщения, не прибегая к промежуточному преобразованию речи в текст.
Ключевое улучшение — функция распознавания эмоций. Теперь GigaChat анализирует интонацию, особенности голоса и детали произношения, чтобы определить эмоциональный настрой пользователя (позитивный или негативный) и адаптировать тон ответа.
Обновлённая модель способна работать с аудиозаписями продолжительностью до трёх часов. Она позволяет находить в них нужные фрагменты, пересказывать отдельные части, создавать краткие изложения (саммари) с привязкой к таймкодам, а также различать голоса разных участников разговора. В Сбере подчёркивают, что такие возможности будут полезны, например, для фиксации итогов совещаний, ведения протоколов звонков и удобной навигации по объёмным аудиоматериалам.
Ещё одна полезная опция — память по результатам голосового взаимодействия. GigaChat Audio фиксирует значимые сведения, озвученные в ходе диалога, и использует их в последующих сессиях — к примеру, при планировании маршрута поездки. Пользователь может просматривать сохранённые данные, вносить в них правки или отключить эту функцию в настройках своего профиля.
Согласно внутренним тестам Arena Hard Audio, где сравнивались ответы различных моделей на идентичные голосовые запросы, GigaChat Audio одержала победу в 75 % случаев. Этот показатель близок к результату Gemini‑3‑Flash‑preview (77,5 %) и превосходит показатели Gemini‑2.5‑Pro (62 %). В задаче распознавания эмоций модель продемонстрировала точность на уровне 80 %, опередив Qwen3‑Omni‑30B (70 %) и Kimi‑Audio (62 %).
Помимо внедрения в ИИ‑помощника, Сбер предоставил разработчикам доступ к облегчённой версии модели — GigaChat3.1‑Audio‑10B. На её базе можно создавать сервисы для транскрибации, голосовые переводчики, а также инструменты для оценки качества озвучки.
Также открыто опубликовано семейство моделей для распознавания речи GigaAM Multilingual. По утверждению компании, это первая российская открытая мультиязычная модель, которая допускает в 1,5–2 раза меньше ошибок по сравнению с ближайшими аналогами. Она поддерживает русский, английский, киргизский, казахский и узбекский языки.
GigaChat Audio интегрирована в ИИ‑помощник ГигаЧат, а облегчённая версия модели доступна в открытом доступе для разработчиков. Обе модели размещены на платформах GitVerse и Hugging Face.
В марте 2026 года Сбер уже проводил обновление ИИ‑помощника: тогда версия GigaChat Ultra получила функцию долгосрочной памяти, а также возможности поиска данных в интернете и выполнения кода.
Статья подготовлена редакцией рекламной экосистемы Vitamin.tools, возвращающей до 18% с пополнений рекламных бюджетов.
Нейросеть Claude заблокировала сотни аккаунтов пользователей из России – Baza Статья
Российские разработчики заметно снизили стоимость использования ИИ-моделей Статья
DeepSeek представила мультимодальную модель, приблизившуюся к Claude Opus 4.8 Статья

5 фраз из-за которых администраторы клиники косметологии теряют до 40% запись каждый месяц Статья
Потолок стоимости пациента: метрика, без которой реклама клиники косметологии превращается в лотерею Статья
Мобильное приложение как канал удержания: что работает Статья
Биржа блогеров: ТОП-10 сервисов для покупки рекламы у блогеров Статья
Кейс: 157 заявок в школу актерского и ораторского мастерства — как мы отказались от халявщиков и набрали учеников за 3 месяца Статья
Как клиника косметологии теряет миллионы на ушедших пациентах и почему дело не в рекламе Статья





