Дайындаған: RD media
Қысқаша: Mixture of Experts (MoE) архитектурасы әр сұраныста модель параметрлерінің тек бір бөлігін ғана іске қосады — DeepSeek-V3-те 671 млрд параметрдің ішінен әр токенге небәрі 37 млрд, яғни 5,5% пайдаланылады.
Заманауи тілдік модельдердің сипаттамаларында «671 млрд параметр» немесе «405 млрд параметр» деген жазулар жиі кездеседі. Мұндай көлемдегі модельдің бірнеше секундта жауап беруі мүмкін емес сияқты көрінеді. Құпиясы — заманауи модельдердің көбі барлық параметрлерін бір мезгілде пайдаланбайды. Бұл Mixture of Experts (MoE) — «сарапшылар қоспасы» деп аталады.
MoE қалай құрылған
Үлкен компанияны елестетіңіз: онда бухгалтерлер, заңгерлер, бағдарламашылар, маркетологтар жұмыс істейді. Салық бойынша сұрақ келсе, директор бүкіл ұжымды жинамайды — тек бухгалтерлерді шақырады. MoE ішінде де дәл осылай болады: модель көптеген мамандандырылған блок-«сарапшылардан» тұрады, әр сұраныста арнайы механизм солардың ішінен ең сәйкес келетін бірнешеуін ғана таңдайды, қалғандары есептеуге қатыспайды. Мысалы, DeepSeek-V3 моделінде 256 сарапшы бар, олардың әр токенге тек 8-і белсенді болады.
Бұл неге тиімді
Модельде жүздеген миллиард параметр болуы мүмкін, бірақ әр токенді генерациялау кезінде олардың тек аз бөлігі ғана жұмыс істейді — бұл есептеу құнын күрт төмендетеді. Дәл осы себепті заманауи модельдер бір мезгілде үлкейіп те, жылдамдап та, пайдалануда арзандап та барады.
Іске асыру қиындығы
Мұндай жүйені құру әдеттегі модельге қарағанда қиынырақ: көптеген сарапшыны оқыту жеткіліксіз — модельді әр жағдайда кімді пайдалану керегін дұрыс таңдауға да үйрету қажет. Дегенмен дәл MoE бүгінде ірі LLM-дердің негізгі архитектураларының бірі болып отыр.
Жиі қойылатын сұрақтар
Модельде 671 млрд параметр болса, ол параметрі азырақ модельден «ақылдырақ» дегенді білдіре ме?
Тікелей емес — MoE моделіндегі жалпы параметр саны әр сұраныста нақты қаншасы жұмыс істейтінін көрсетпейді. Маңыздысы — нақты (белсенді) бөлігі мен бенчмарктердегі сапасы.
MoE модельге сұраныс құнын арттыра ма, әлде төмендете ме?
Төмендетеді — сол көлемдегі тығыз (dense) модельмен салыстырғанда, параметрлердің тек бір бөлігі белсенді болғандықтан есептеу арзанырақ шығады.
Дереккөздер
DeepSeek-V3 моделінің карточкасы
Серияның жалғасы: келесі мақала — Attention механизмі туралы.
Похожие материалы
40°C орнына 70°C: оңтүстіккореялық инженерлер адсорбциялық жүйелерді қалдық жылумен жұмыс істеуге үйретті
авг. 14, 2026
Google Pixel 11: 2nm чипті алғашқы смартфон Apple-ды басып озды
авг. 14, 2026
2026 жылғы құлаққаптағы аударма: жеке құрылғының орнына жүйелік функция
авг. 14, 2026