, август 14, 2026

Mixture of Experts деген не және неге алып модельдер жылдамырақ жұмыс істейді


DeepSeek-V3 моделінің 671 млрд параметрі бар, бірақ әр токенге небәрі 37 млрд-ы жұмыс істейді. Mixture of Experts архитектурасын талдаймыз.

  •   1 мин чтения
Mixture of Experts деген не және неге алып модельдер жылдамырақ жұмыс істейді

Содержание

Дайындаған: RD media

Қысқаша: Mixture of Experts (MoE) архитектурасы әр сұраныста модель параметрлерінің тек бір бөлігін ғана іске қосады — DeepSeek-V3-те 671 млрд параметрдің ішінен әр токенге небәрі 37 млрд, яғни 5,5% пайдаланылады.

Заманауи тілдік модельдердің сипаттамаларында «671 млрд параметр» немесе «405 млрд параметр» деген жазулар жиі кездеседі. Мұндай көлемдегі модельдің бірнеше секундта жауап беруі мүмкін емес сияқты көрінеді. Құпиясы — заманауи модельдердің көбі барлық параметрлерін бір мезгілде пайдаланбайды. Бұл Mixture of Experts (MoE) — «сарапшылар қоспасы» деп аталады.

MoE қалай құрылған

Үлкен компанияны елестетіңіз: онда бухгалтерлер, заңгерлер, бағдарламашылар, маркетологтар жұмыс істейді. Салық бойынша сұрақ келсе, директор бүкіл ұжымды жинамайды — тек бухгалтерлерді шақырады. MoE ішінде де дәл осылай болады: модель көптеген мамандандырылған блок-«сарапшылардан» тұрады, әр сұраныста арнайы механизм солардың ішінен ең сәйкес келетін бірнешеуін ғана таңдайды, қалғандары есептеуге қатыспайды. Мысалы, DeepSeek-V3 моделінде 256 сарапшы бар, олардың әр токенге тек 8-і белсенді болады.

Бұл неге тиімді

Модельде жүздеген миллиард параметр болуы мүмкін, бірақ әр токенді генерациялау кезінде олардың тек аз бөлігі ғана жұмыс істейді — бұл есептеу құнын күрт төмендетеді. Дәл осы себепті заманауи модельдер бір мезгілде үлкейіп те, жылдамдап та, пайдалануда арзандап та барады.

Іске асыру қиындығы

Мұндай жүйені құру әдеттегі модельге қарағанда қиынырақ: көптеген сарапшыны оқыту жеткіліксіз — модельді әр жағдайда кімді пайдалану керегін дұрыс таңдауға да үйрету қажет. Дегенмен дәл MoE бүгінде ірі LLM-дердің негізгі архитектураларының бірі болып отыр.

Жиі қойылатын сұрақтар

Модельде 671 млрд параметр болса, ол параметрі азырақ модельден «ақылдырақ» дегенді білдіре ме?

Тікелей емес — MoE моделіндегі жалпы параметр саны әр сұраныста нақты қаншасы жұмыс істейтінін көрсетпейді. Маңыздысы — нақты (белсенді) бөлігі мен бенчмарктердегі сапасы.

MoE модельге сұраныс құнын арттыра ма, әлде төмендете ме?

Төмендетеді — сол көлемдегі тығыз (dense) модельмен салыстырғанда, параметрлердің тек бір бөлігі белсенді болғандықтан есептеу арзанырақ шығады.

Дереккөздер

DeepSeek-V3 Technical Report

DeepSeek-V3 моделінің карточкасы

Серияның жалғасы: келесі мақала — Attention механизмі туралы.

Похожие материалы