, сентябрь 04, 2026

GigaChat үш жаңа эмбеддинг моделін ашады: MoE-флагман 10B-A1.8B, әрі әмбебап 3B және ықшам 480M


GigaChat үш жаңа embedding-моделін ашады: 1,8 млрд белсенді параметрі бар MoE-флагман 10B-A1.8B, әмбебап 3B және ықшам 480M. Флагман ruMTEB-те бірінші орын алады және vLLM-де жылдамдық бойынша Qwen3 Embedding 4B-ден асып түседі.

  •   1 мин чтения
GigaChat үш жаңа эмбеддинг моделін ашады: MoE-флагман 10B-A1.8B, әрі әмбебап 3B және ықшам 480M

Содержание

GigaChat әзірлеушілері GigaEmbeddings желісінің жаңартылған нұсқасын open source форматында шығарды. Mixture-of-Experts архитектурасындағы флагман ресейлік MTEB сегментінде бірінші орынды алды. Ал ықшам 480M моделі дистилляция арқылы сапа мен жылдамдық арасындағы алшақтықты қысқартты.

GigaChat әзірлеушісі үш эмбеддинг моделін шығарды: Giga-Embeddings-instruct-480M-0826, 3B-0826 және 10B-A1.8B-0826. Үшеуі де vLLM және SGLang экожүйесінде жұмыс істейді, салмақтары MIT лицензиясы бойынша қолжетімді.

10B-A1.8B флагманы DeepSeek-V3 архитектурасына (MLA + MoE) негізделген: жалпы параметрлер саны 10 млрд, оның ішінде токенге 1,8 млрд параметр белсенді жұмыс істейді. Модель ruMTEB бенчмаркінде 74,99 балл жинады және код бойынша тапсырмаларда отбасы ішіндегі нұсқалардан асып түсті (78,40 балл — 3B моделінің 76,93 және алдыңғы буынның 62,37 балына қарсы). H100 GPU-да 512 токен кірісімен өткізілген vLLM бенчмаркінде флагман секундына 112,6 мың токен өңдейді — бұл Qwen3 Embedding 4B моделінен (секундына 70,1 мың токен) 61%-ға жылдам әрі конфигурацияға байланысты 1,44–1,61 есе жоғары нәтиже көрсетеді.

Әмбебап 3B моделі код бойынша нәтижесін жақсартты: 76,93 балл, алдыңғы буында 62,37 болған. Орыс, ағылшын тілдері мен код арасындағы теңгерімді ол салмақтарды біріктіру кезінде SLERP (Spherical Linear Interpolation) әдісі арқылы сақтайды.

Ықшам 480M моделі жүктемесі жоғары іздеу үшін жасалған. Ол дистилляция арқылы оқытылды: батч ішіндегі cosine similarity үлестірімдері KL divergence арқылы берілді. Бұл минималды көлемде сапаны сақтауға мүмкіндік берді — ruMTEB бойынша 70,98 балл.

Оқыту кезінде Nemotron, F2LLM және KALM қоса алғанда, кеңейтілген деректер жиынтықтары қолданылды. GigaChat әзірлеушілері contrastive pretrain және fine-tuning көлемін алдыңғы нұсқамен салыстырғанда бірнеше есе арттырды.

Похожие материалы