10 қыркүйекте DeepSeek V4.1 Flash моделін шығарды. Бір қарағанда — биылғы ондаған релиздің қатарындағы тағы бір жаңа модель.
Бірақ оның артында әлдеқайда қызық тарих тұр.
DeepSeek үлкен ЖИ моделінің есептеу жүктемесін мүмкіндіктер деңгейін сақтай отырып қаншалықты қатты қысқартуға болатынын көрсетті.
V4.1 Flash-та 552 млрд параметр бар. Кіріс мәтінді өңдеу кезінде әрбір токенге шамамен 8 млрд параметр іске қосылады, ал жауап генерациялау кезінде — 16 млрд.
Салыстыру үшін: алдыңғы V4 Pro шамамен 1,6 трлн параметрден тұрады және шамамен 49 млрд-ты іске қосады.
Яғни жаңа Flash жалпы параметр саны бойынша шамамен үш есе аз және жұмыс кезінде одан да аз есептеу қуатын пайдаланады.
Сонымен қатар V4.1 Flash бастапқыдан мультимодальды: ол бір архитектурада мәтінмен және суреттермен жұмыс істей алады.
Модель салмақтары Hugging Face платформасында MIT лицензиясымен жарияланған, сондықтан архитектураны зерттеуге, өз бетінше орналастыруға және өз өнімдерінде пайдалануға болады.
Бұл қалай мүмкін болды
Жүздеген бөлімшесі бар үлкен компанияны елестетейік.
Клиент сұрақ қояды. Барлық қызметкерді бір жиналысқа шақырудың орнына арнайы диспетчер нақ осы міндетті шешу үшін қандай бөлімшелер қажет екенін анықтайды.
Қалғандары бұл сәтте есептеуге қатыспайды.
Mixture-of-Experts — «сарапшылар қоспасы», немесе MoE технологиясы дәл осылай жұмыс істейді.
Модель ішінде көптеген ірі нейрондық блоктар — «сарапшылар» бар. Арнайы бағыттау механизмі — router — әрбір токен үшін қазір қайсысы жұмыс істеу керектігін анықтайды.
Бағдарламашылар әдетте қолмен тағайындамайды: «мынау — Python бойынша сарапшы», «мынау — математика бойынша сарапшы», «мынау — ағылшын тілі бойынша сарапшы».
Мамандану желіні оқыту барысында өздігінен қалыптасады.
Бір сарапшылар тобы біртіндеп бір ақпарат түрі үшін пайдалырақ бола бастайды, екіншісі — басқасы үшін. Router әрбір токенді өңдеу ең жақсы нәтиже беретін жерге бағыттауды үйренеді.
Қызық құрылым шығады.
Модель жүздеген миллиард параметрден тұруы мүмкін, осының арқасында үлкен сыйымдылыққа ие болады, бірақ нақты токенді өңдеу үшін оған бүкіл желінің тек шағын бөлігі қажет болады.
Үлкен модель толығымен өмір сүреді. Әр сәтте оның тек бір бөлігі жұмыс істейді.
MoE-ді DeepSeek-тен әлдеқайда бұрын ойлап тапты
Mixture-of-Experts қағидасының өзі қазіргі қытайлық ЖИ буумынан әлдеқайда бұрын пайда болды.
Google Research мұндай архитектураларды көп жылдан бері дамытып келеді.
Мысалы, GLaM моделі шамамен 1,2 трлн параметрден тұрды, бірақ әрбір токенді өңдеу кезінде шамамен 97 млрд — бүкіл желінің шамамен 8%-ын пайдаланды.
Сондықтан V4.1 Flash-тағы басты жайт — осы идеяның одан әрі дамуы.
DeepSeek модельді асимметриялы етіп жасады.
Қазіргі ЖИ-де екі мүлдем әртүрлі операция бар.
Біріншісі — өзіне берілгенді оқу.
Екіншісі — жауап қалыптастыру.
Техникалық терминологияда бұл кезеңдер prefill және decode деп аталады.
DeepSeek оларға әртүрлі көлемдегі есептеуді пайдалануды таңдады.
Әрбір кіріс токенді оқу кезінде V4.1 Flash шамамен 8 млрд параметрді іске қосады.
Жауап генерациялау кезінде — шамамен 16 млрд.
Яғни оқу жауап жазуға қарағанда шамамен екі есе аз белсенді параметрді қажет етеді.
Дәл осы жерде архитектураның басты экономикалық мәні пайда болады.
ЖИ агенттері жазғаннан гөрі әлдеқайда көп оқиды
Үлкен бағдарламалық жобадан қате табуды тапсырған ЖИ агентін елестетейік.
Алдымен ол жүздеген файлды, құжаттаманы, өзгерістер тарихын, қате туралы хабарламаларды және мыңдаған код жолын оқи алады.
Ал нәтижесінде бірнеше абзац түсіндірме мен жиырма жол түзетілген код қалады.
Дәл солай корпоративтік құжаттармен, заңды материалдармен, зерттеулермен немесе үлкен білім қорларымен жұмыс кезінде де болады.
ЖИ салыстырмалы түрде шағын нәтиже беру үшін орасан көп ақпаратты өңдеуге мәжбүр болады.
Сондықтан агенттік жүйелер үшін оқу құны ерекше маңызды болып келеді.
Ал DeepSeek жұмыстың дәл осы бөлігін арнайы оңтайландырды.
Тағы бір қымбат бөлік бар — жады
Үлкен тілдік моделде ресурстар тек есептеулерге ғана жұмсалмайды.
Модель ұзын мәтінді оқыған кезде, келесі токендерді генерациялау үшін оқылған ақпарат туралы жұмыс деректерін сақтауы керек.
Бұл KV cache — key-value cache деп аталады, моделдің жұмыс жады сияқты нәрсе.
Контекст ұзарған сайын, жады да көп қажет болады.
V4.1 Flash жаңа Causal Encoder-Decoder архитектурасында құрылған.
Алдымен 20 қабат encoder келген контекстті өңдейді, содан кейін 20 қабат decoder нәтижені қалыптастырады.
Мұндай құрылым decoder-ге оқылған ақпараттың неғұрлым ықшам көрінісін қолдануға мүмкіндік береді.
Нәтижесінде алдыңғы V4-Flash-пен салыстырғанда KV cache үшін мыналар қажет:
- шамамен 4 есе аз HBM — үдеткіштердің жоғары жылдамдықты жады;
- шамамен 8 есе аз SSD-жинақтауыш.
Сонымен қатар модель 1 млн токенге дейінгі контекст терезесін қолдайды.
Яғни ол мәтіннің, бағдарламалық кодтың және құжаттардың өте үлкен көлемдерімен жұмыс істей алады, әрі жадыға қойылатын талаптарды төмендетеді.
Үнем бірнеше құрамдастан бірден құралады:
белсенді параметрлер азырақ → есептеулер азырақ;
кірісті өңдеу арзанырақ → ұзын агенттік тапсырмалар арзанырақ;
KV cache азырақ → қымбат жады мен сақтау көлемі азырақ.
Дәл осы — V4.1 Flash-тың жоғары есептеу тиімділігінің техникалық негізі.
Ол қаншалықты арзан
Пиктен тыс сағаттарда V4.1 Flash үшін бір миллион кіріс токені ¥1 тұрады.
Бұрын өңделген контекст кэште сақталған жағдайда — миллион токен үшін ¥0,02.
Миллион шығыс токені — ¥4.
Пик сағаттарында тарифтер екі есе жоғары.
Алдыңғы Flash тарифімен салыстырғанда:
- кэштелген кіріс: ¥0,05 → ¥0,02 — 60%-ға төмендеді;
- қарапайым кіріс: ¥1,5 → ¥1 — шамамен 33%-ға төмендеді;
- шығыс: ¥4,5 → ¥4 — шамамен 11%-ға төмендеді.
Дегенмен мұнда маңызды жайт бар.
Алдыңғы тариф DeepSeek бағаны көтерген 17 тамызда пайда болған.
Оған дейін миллион шығыс токені ¥2 тұратын.
Қазір кіріс құны сәуір деңгейіне іс жүзінде қайта оралды, ал шығыс құны бұрынғысынша ¥4 — ескі деңгейден екі есе қымбат болып қалуда.
Сондықтан қазіргі баға өзгерісін тамыз айындағы көтерілістің ішінара кейін қайтарылуы ретінде қарастырған дұрысырақ. Шығыс токендер бойынша жаңа баға минимумы бұл жерде орнатылған жоқ.
Бұл маңызды айырмашылық.
V4.1 Flash-тың архитектуралық тиімділігі шынайы, бірақ DeepSeek-тің тарифтік саясаты компанияның коммерциялық стратегиясымен де анықталады.
Сапасы қандай
DeepSeek жариялаған нәтижелер бойынша V4.1 Flash агенттік және бағдарламалық тапсырмаларда күшті көрсеткіштер танытады:
- Terminal-Bench 2.1 — 90,6
- DeepSWE v1.1 — 74,2
- CyberGym — 88,1
- Automation-Bench — 54,8
- Codeforces — рейтинг 3471
Компания жаңа модельге соншалықты сенімді, сондықтан 14 қыркүйектен бастап API арқылы V4 Pro-ға келетін сұраныстар уақытша V4.1 Flash-қа бағытталып, Flash бағасы бойынша тарифтеледі.
Бұл болашақ V4.1 Pro іске қосылғанға дейін жалғасады.
Дәл осы жерде салыстыру ерекше көрсеткіш болып тұр:
V4 Pro:
1,6 трлн параметр
49 млрд белсенді
V4.1 Flash:
552 млрд параметр
оқу кезінде 8 млрд белсенді
генерация кезінде 16 млрд белсенді
Яғни DeepSeek өзінің әлдеқайда үлкен Pro моделін уақытша әлдеқайда үнемді Flash моделімен алмастырып отыр.
Бұл бүкіл релиздегі ең күшті сигналдардың бірі.
Дегенмен салыстырмалы нәтижелердің едәуір бөлігін әзірге DeepSeek өзі жариялаған. Бұл артықшылықтардың нақты production жүктемелерінде қаншалықты сақталатынын тәуелсіз тесттер ғана көрсете алады.
Неге бұрыннан осылай жасамайды
Себебі идея жүзеге асырудан әлдеқайда қарапайым көрінеді.
Mixture-of-Experts әдісі бұрыннан белгілі. Google және басқа зерттеу топтары сирек модельдермен көп жыл жұмыс істеп келеді.
Басты мәселе — мұндай жүйені шынымен тиімді жұмыс істетуде.
Router миллиардтаған рет кезекті токендерді қай экспертке жіберу керегін шешуі тиіс.
Бұл ретте бір танымал эксперт шамадан тыс жүктелмеуі, ал басқа үдеткіштер бос тұрмауы керек.
Эксперттер әртүрлі графикалық процессорларда — GPU — орналасуы мүмкін. Демек, деректерді көптеген чиптер арасында өте жоғары жылдамдықпен тасымалдау қажет.
Модельдің барлық 552 млрд параметрін белгілі бір сәтте олардың тек аз бөлігі қолданылса да, бір жерде сақтап, жылдам қолжетімді ету керек.
Оқыту, жүктемені теңгеру, жадымен жұмыс және сапаны сақтау қажеттілігін қосыңыз — заманауи есептеу техникасының ең күрделі инженерлік міндеттерінің бірі шығады.
Мұнда математика, нейрондық желі архитектурасы және үлестірілген есептеулер инженериясы бір мезгілде жұмыс істейді.
Тағы бір маңызды жайт бар.
DeepSeek моделінің тек бөлігін пайдаланады, ал GPT, Claude немесе Gemini міндетті түрде барлық параметрлерін іске қосады деп айту дұрыс емес.
OpenAI, Anthropic және Google компанияларының ең күшті жабық модельдерінің архитектурасы толық ашылмаған.
Олар нақты токен үшін қанша параметр іске қосатынын және MoE немесе басқа шартты есептеу әдістерінің қандай түрлерін қолданатынын білмейміз.
DeepSeek-тің ерекшелігі мынада: компания архитектураны жария түрде көрсетті және есептеу тиімділігін өнімнің басты артықшылықтарының біріне айналдырды.
MIT лицензиясы бойынша ашық салмақтар бұл архитектураны басқа әзірлеушілер де зерттеп, қолдана алатынын білдіреді.
Яғни бағалық қысым DeepSeek-тің өз API-мен шектелмей, кеңірек тарайды.
Нарық неге алаңдайды
Егер кеше әзірлеуші Pro-модель үшін жоғары баға төлесе, ал бүгін Flash бағасымен соған ұқсас мүмкіндік алса, жағымсыз сұрақ туындайды:
неге көп төлеу керек?
Бәсекелестерде бірнеше жол бар.
Әлдеқайда күшті модель жасап, клиентті қосымша баға төлеуге көндіруге болады.
Өз бағаларын төмендетуге болады.
Инфрақұрылым тиімділігін арттырып, токен құны төмен болса да маржаны сақтауға болады.
Бірақ жетекші модельдердің сапасы бірте-бірте жақындап, есептеу тиімділігі өсе берсе, бәсеке одан сайын қатаяды.
Нарық мұны есепке ала бастады да қойды.
10 қыркүйектегі сауда-саттықтың түскі үзілісіне қарай MiniMax акциялары 6,73%-ға, Z.AI акциялары 7,88%-ға төмендеді.
Бұл ретте Гонконгтың бүкіл технологиялық секторы қысымда болды, сондықтан барлық қозғалысты тек DeepSeek-пен байланыстыру дұрыс болмас еді.
Дегенмен Morgan Stanley жеке атап өткендей, Flash модельдер арасында бағалық бәсеке күшею қаупі бар.
Оқиғаның басты мәні дәл осында.
DeepSeek саланың экономикасы үшін кезекті бенчмарк рекордынан да қауіпті нәрсені көрсетті: күшті ЖИ-ді едәуір арзан іске қосуға болады.
V4.1 Flash моделі жоғары мүмкіндік деңгейін сақтай отырып, есептеу жүктемесін қаншалықты күшті азайтуға болатынын көрсетеді.
Ал DeepSeek-тің тарифтік саясаты бұл тиімділікті бәсекелестік күресте компанияның қаншалықты агрессивті пайдалануға дайын екенін көрсетеді.
Егер архитектуралық жарысты басқа компаниялар жалғастырса, модельдің құндылығы «жүздеген миллиард параметр» деген әдемі санмен азырақ анықталады.
Әлдеқайда маңызды көрсеткіш мынау болады:
бір пайдалы нәтиже алу үшін қанша есептеу мен ақша жұмсау керек.
Клиенттер үшін бұл жақсы жаңалық.
Болашақ пайдасы ЖИ-есептеулердің жоғары бағасына құрылған компаниялар үшін — әлдеқайда жағымсыз жаңалық.
Сонымен қатар DeepSeek-тің өзі Шанхай қор биржасының STAR Market технологиялық алаңында алғашқы жария акция ұсынысына (IPO) дайындалып жатыр.
Reuters мәліметінше, компания IPO-ны дайындау үшін CITIC Securities-ті тартты.
RD media дайындады
Дереккөздер
1. [DeepSeek — ресми сайты](https://www.deepseek.com/)
2. [DeepSeek V4.1 Flash — Hugging Face](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash)
3. [Google Research — Mixture-of-Experts with Expert Choice Routing](https://research.google/blog/mixture-of-experts-with-expert-choice-routing/)
4. [Google Research — More Efficient In-Context Learning with GLaM](https://research.google/blog/more-efficient-in-context-learning-with-glam/)
5. [Reuters — China's DeepSeek launches V4.1 Flash model, 10 қыркүйек 2026](https://www.reuters.com/world/asia-pacific/chinas-deepseek-launches-v41-flash-model-2026-09-10/)
6. [Reuters — China's DeepSeek taps CITIC Securities for domestic IPO, 9 қыркүйек 2026](https://www.reuters.com/world/chinas-deepseek-taps-citic-securities-domestic-ipo-sources-say-2026-09-09/)
7. [AASTOCKS — MiniMax пен Z.AI реакциясы және Morgan Stanley түсініктемесі](https://secure.aastocks.com/en/mobile/News.aspx?NewsID=NOW.1543798&NewsSource=HK6&NewsType=)
Похожие материалы
ЖИ сіздің ақшаңызды кім жұмсатуға рұқсат берді?
сент. 17, 2026
Дрондар, цифрлық қалалар және ЖИ: Тоқаевтың Кореяға сапарының технологиялық қорытындылары
сент. 17, 2026
Әдеттегі қоңырау интернет арқылы жұмыс істеуді үйренді. VoLTE пен Wi-Fi Calling телефон байланысын қалай өзгертіп жатыр
сент. 16, 2026