14.07.2026, 16:10

ГигаЧат научился понимать эмоции по голосу и находить нужные моменты в длинных записях

Сбер представил обновлённую нейросеть GigaChat Audio, которая теперь доступна в ИИ-помощнике ГигаЧат и в открытом коде для разработчиков. Новая модель обрабатывает аудиофайлы и голосовые сообщения без предварительного преобразования речи в текст, а также научилась распознавать интонацию и эмоции пользователя.
ГигаЧат научился понимать эмоции по голосу и находить нужные моменты в длинных записях

ГигаЧат теперь понимает, с какой эмоцией к нему обращаются — позитивной или негативной, и реагирует уместнее: мягче отвечает раздражённому пользователю или поддерживает настроение, если человек делится хорошей новостью. Модель способна обрабатывать записи длиной до трёх часов, находить нужные моменты в разговоре, пересказывать отдельные отрезки и делать саммари всей записи с таймкодами. Она также различает спикеров, что полезно для разбора совещаний и звонков.

По результатам тестов GigaChat Audio набрала 75% побед в Arena Hard Audio, почти догнав Gemini-3-Flash-preview (77,5%) и обойдя Gemini-2.5-Pro (62%). Точность распознавания эмоций достигает 80%, что выше, чем у Qwen3-Omni-30B (70%) и Kimi-Audio (62%).

Разработчикам доступна облегчённая версия GigaChat3.1-Audio-10B, которая распознаёт русский, английский и другие языки. На её основе можно создавать сервисы транскрибации, тренажёры произношения, голосовые переводчики. Также в открытый доступ выложено семейство моделей GigaAM Multilingual — первая российская открытая модель для распознавания речи на нескольких языках, допускающая в 1,5–2 раза меньше ошибок, чем конкуренты. Поддерживаются русский, английский, киргизский, казахский и узбекский языки.

Рубрика:
{}Исследования
Новости в вашей почте
mail

PLUSworld в соцсетях:
telegram
vk
dzen
youtube
ЕЩЁ НОВОСТИ