, июль 21, 2026

GigaChat Audio және GigaAM Multilingual: ұзын контекст пен ТМД тілдерін қолдайтын жаңа Open Source модельдер


Сбер GigaAM Multilingual мен GigaChat Audio-ны ашты: қазақ, қырғыз, өзбек тілдерін қолдайтын сөйлеуді тану және талдау.

  •   1 мин чтения
GigaChat Audio және GigaAM Multilingual: ұзын контекст пен ТМД тілдерін қолдайтын жаңа Open Source модельдер

Содержание

Жарнама

Толыққанды audio-native LLM ашық кодта әлі сирек кездеседі, ал Speech AI-дегі прогрестің дерлік барлығы ағылшын тіліне және қысқа жазбаларға шоғырланған. Қолданыстағы ашық модельдердің сапасы low-resource тілдерде және ұзын контексте күрт төмендейді.

Сбер бір мезгілде екі ірі жұмысты ашық қолжетімділікке шығарды: GigaAM-нің кеңейтілген нұсқасы мен ұзын контекстті қолдайтын жаңа GigaChat Audio. Компанияның мәлімдеуінше, екі модель бойынша мақалалар сөйлеу технологиялары бойынша басты әлемдік конференция — Interspeech 2026-ға қабылданды.

GigaAM Multilingual

Сбердің сөйлеуді тану SOTA-моделін қазақ, қырғыз, өзбек және ағылшын тілдеріне кеңейту.

  • Self-supervised Audio Encoder (240M / 600M) — ТМД-ға басымдық бере отырып, 70-тен астам тілдегі 2 млн сағат сөйлеуде алдын ала оқытылған. Жаңа тілдерге Whisper мен Omnilingual-ден жылдамырақ әрі арзанырақ бейімделеді: грузин және башқұрт тілдерінде бір ғана Common Voice-тен Word Error Rate ~4%-ға дейін қосымша оқытылды — Whisper Encoder-дегі 11%+-ке қарсы.
  • Multilingual CTC ASR (240M / 600M) — 50 мың сағат көпдоменді сөйлеуде (ru/en/uz/ky/kk) қосымша оқытылған. Whisper, Seamless және Omnilingual-ден асып түседі; тіпті ықшам 240M нұсқасы еселеп кіші көлемде Whisper Large v3 бен Omnilingual 1B-ны басып озады (орташа WER 12,2% пен 14%+-ке қарсы).

GigaChat Audio

GigaAM Multilingual мен GigaChat3.1-10B-A1.8B негізіндегі audio-native LLM. Multi-turn диалогты, аудио классификациясын, аударманы және сөйлеуді тануды, сондай-ақ temporal grounding — оқиғаларды уақыт бойынша локализациялауды, аудио аралығын сипаттауды және уақыт белгілерімен қорытындылауды қолдайды.

  • Ең күшті тұсы — уақытты түсінуде: 20–60 минуттық жазбаларда оқиғаларды локализациялаудың Intersection-over-Union көрсеткіші 48,3, ал Voxtral, Phi-4 және Qwen3-Omni-де ~0. Контекстті 2 сағат аудиоға дейін ұстайды.
  • Орыс тілін жақсы түсінеді: RuBQ-Audio 60,0 (Qwen3-Omni-дегі 43,7-ге қарсы), Dusha эмоцияларын тану 90%+.
  • Сбер TimeGround-1M деректер жинағын ұсынды — LLM-ді оқиғаларды уақытқа байлауға үйрету үшін.

Модельдер мен мақалалар — Hugging Face-те Сбер: huggingface.co/ai-sage

Материал компания ұсынған ақпарат негізінде дайындалды.

Похожие материалы