, август 14, 2026

Что такое Mixture of Experts и почему огромные модели работают быстрее, чем кажется


DeepSeek-V3 весит 671 млрд параметров, но на каждый токен считает только 37 млрд. Разбираем архитектуру Mixture of Experts.

  •   1 мин чтения
Что такое Mixture of Experts и почему огромные модели работают быстрее, чем кажется

Содержание

Подготовлено RD media

Коротко: архитектура Mixture of Experts (MoE) активирует лишь часть параметров модели на каждый запрос — у DeepSeek-V3 из 671 млрд параметров на токен используется только 37 млрд, то есть 5,5%.

В характеристиках современных языковых моделей всё чаще встречается запись вроде «671 млрд параметров» или «405 млрд параметров». Кажется невероятным, что модель такого размера способна отвечать за несколько секунд. Секрет в том, что большинство современных моделей не используют все свои параметры одновременно — это называется Mixture of Experts (MoE), «смесь экспертов».

Как устроена MoE

Представьте большую компанию: в ней работают бухгалтеры, юристы, программисты, маркетологи. Если приходит вопрос по налогам, директор не собирает весь коллектив — он вызывает только бухгалтеров. То же происходит внутри MoE: модель состоит из множества специализированных блоков-«экспертов», и на каждый запрос специальный механизм выбирает лишь несколько наиболее подходящих, остальные в вычислениях не участвуют. DeepSeek-V3, например, использует 256 экспертов, из которых на каждый токен активны только 8.

Почему это выгодно

Модель может содержать сотни миллиардов параметров, но использовать лишь малую их часть при генерации каждого токена — это резко снижает стоимость вычислений. Именно поэтому современные модели одновременно становятся больше, быстрее и дешевле в эксплуатации.

Сложность реализации

Построить такую систему сложнее, чем обычную модель: нужно не только обучить множество экспертов, но и научить модель правильно выбирать, кого использовать в каждой ситуации. Тем не менее именно MoE сегодня — одна из ключевых архитектур крупнейших LLM.

Частые вопросы

Если у модели 671 млрд параметров, значит ли это, что она «умнее» модели с меньшим числом параметров?

Не напрямую — общее число параметров в MoE-модели не показывает, сколько из них реально работает на каждый запрос. Важнее реальная (активная) часть и качество на бенчмарках.

MoE увеличивает или уменьшает стоимость запроса к модели?

Уменьшает по сравнению с плотной (dense) моделью того же общего размера — за счёт активации лишь части параметров вычисления обходятся дешевле.

Источники

DeepSeek-V3 Technical Report

Карточка модели DeepSeek-V3

Серия: следующая статья — «Как модель понимает контекст: механизм Attention».

Похожие материалы