Подготовлено RD media
Коротко: архитектура Mixture of Experts (MoE) активирует лишь часть параметров модели на каждый запрос — у DeepSeek-V3 из 671 млрд параметров на токен используется только 37 млрд, то есть 5,5%.
В характеристиках современных языковых моделей всё чаще встречается запись вроде «671 млрд параметров» или «405 млрд параметров». Кажется невероятным, что модель такого размера способна отвечать за несколько секунд. Секрет в том, что большинство современных моделей не используют все свои параметры одновременно — это называется Mixture of Experts (MoE), «смесь экспертов».
Как устроена MoE
Представьте большую компанию: в ней работают бухгалтеры, юристы, программисты, маркетологи. Если приходит вопрос по налогам, директор не собирает весь коллектив — он вызывает только бухгалтеров. То же происходит внутри MoE: модель состоит из множества специализированных блоков-«экспертов», и на каждый запрос специальный механизм выбирает лишь несколько наиболее подходящих, остальные в вычислениях не участвуют. DeepSeek-V3, например, использует 256 экспертов, из которых на каждый токен активны только 8.
Почему это выгодно
Модель может содержать сотни миллиардов параметров, но использовать лишь малую их часть при генерации каждого токена — это резко снижает стоимость вычислений. Именно поэтому современные модели одновременно становятся больше, быстрее и дешевле в эксплуатации.
Сложность реализации
Построить такую систему сложнее, чем обычную модель: нужно не только обучить множество экспертов, но и научить модель правильно выбирать, кого использовать в каждой ситуации. Тем не менее именно MoE сегодня — одна из ключевых архитектур крупнейших LLM.
Частые вопросы
Если у модели 671 млрд параметров, значит ли это, что она «умнее» модели с меньшим числом параметров?
Не напрямую — общее число параметров в MoE-модели не показывает, сколько из них реально работает на каждый запрос. Важнее реальная (активная) часть и качество на бенчмарках.
MoE увеличивает или уменьшает стоимость запроса к модели?
Уменьшает по сравнению с плотной (dense) моделью того же общего размера — за счёт активации лишь части параметров вычисления обходятся дешевле.
Источники
Серия: следующая статья — «Как модель понимает контекст: механизм Attention».
Похожие материалы
40°C вместо 70°C: южнокорейские инженеры научили адсорбционные системы работать на бросовом тепле
авг. 14, 2026
Google Pixel 11: первый смартфон на 2nm-чипе обогнал Apple. Разбираем, что это значит
авг. 14, 2026
Перевод в наушниках в 2026: системная функция вместо отдельного устройства
авг. 14, 2026