Разработчики GigaChat выпустили в open source обновлённую линейку GigaEmbeddings. Флагман с архитектурой Mixture-of-Experts занял первое место в российском сегменте MTEB, а компактная 480M-модель сократила разрыв между качеством и скоростью за счёт дистилляции.
Разработчик GigaChat выпустил три модели эмбеддингов: Giga-Embeddings-instruct-480M-0826, 3B-0826 и 10B-A1.8B-0826. Все три работают в экосистеме vLLM и SGLang, их веса доступны под лицензией MIT.
Флагман 10B-A1.8B построен на архитектуре DeepSeek-V3 (MLA + MoE): 10 млрд общих параметров, из которых активны 1,8 млрд на токен. Он набрал 74,99 в ruMTEB и обогнал внутрисемейные версии на задачах с кодом (78,40 против 76,93 у 3B и 62,37 у предыдущего поколения). В бенчмарке vLLM на H100 с входом в 512 токенов флагман обрабатывает 112,6 тыс. токенов в секунду — на 61% быстрее Qwen3 Embedding 4B (70,1 тыс. токенов/с) и в 1,44–1,61 раза быстрее в зависимости от конфигурации.
Универсальная модель 3B улучшила результаты по коду: 76,93 против 62,37 у предшественника. Баланс между русским, английским языками и кодом она сохраняет за счёт SLERP (Spherical Linear Interpolation) при слиянии весов.
Компактная 480M предназначена для высоконагруженного поиска. Её обучали через дистилляцию: распределения cosine similarity внутри батча передавались через KL divergence. Это позволило сохранить качество при минимальном размере — 70,98 в ruMTEB.
В обучении использовались расширенные наборы данных, включая Nemotron, F2LLM и KALM. Разработчики GigaChat увеличили объём contrastive pretrain и fine-tuning в несколько раз по сравнению с предыдущей версией.
Похожие материалы
Speedo iQ: модуль для очков Vanquisher, который считает четыре стиля плавания
сент. 04, 2026
Экономика AI: почему токены дешевеют, а счета растут
сент. 04, 2026
Утечки данных в Центральной Азии: что показывают цифры F6, а что — нет
сент. 04, 2026