, сентябрь 17, 2026

DeepSeek показала, как сделать сильный ИИ дешевле. Акции конкурентов упали


DeepSeek выпустила V4.1 Flash — асимметричную MoE-модель с 552 млрд параметров, активирующую 8–16 млрд параметров на токен. Открытые веса MIT, снижение цен до ¥1 за млн токенов, временное перенаправление API V4 Pro на Flash.

  •   6 мин чтения
DeepSeek показала, как сделать сильный ИИ дешевле. Акции конкурентов упали

Содержание

10 сентября DeepSeek выпустила V4.1 Flash. На первый взгляд — очередная новая модель среди десятков релизов этого года.

Но за ней стоит гораздо более интересная история.

DeepSeek показала, насколько сильно можно сократить вычислительную нагрузку большой ИИ-модели, сохранив высокий уровень возможностей.

У V4.1 Flash 552 млрд параметров. При обработке входящего текста на каждый токен активируется около 8 млрд, а при генерации ответа — 16 млрд.

Для сравнения: предыдущая V4 Pro содержит около 1,6 трлн параметров и активирует примерно 49 млрд.

То есть новая Flash почти втрое меньше по общему числу параметров и использует ещё меньше вычислений при работе.

При этом V4.1 Flash изначально мультимодальна: она умеет работать с текстом и изображениями в одной архитектуре.

Веса модели опубликованы на Hugging Face под лицензией MIT, поэтому архитектуру можно изучать, разворачивать самостоятельно и использовать в собственных продуктах.

Как это вообще возможно

Представим большую компанию из сотен отделов.

Клиент задаёт вопрос. Вместо того чтобы собирать всех сотрудников на одно совещание, специальный диспетчер определяет, какие несколько отделов нужны для решения именно этой задачи.

Остальные в этот момент в вычислениях не участвуют.

Примерно так работает технология Mixture-of-Experts — «смесь экспертов», или MoE.

Внутри модели существует множество крупных нейронных блоков — «экспертов». Специальный механизм маршрутизации — router — для каждого токена определяет, какие из них должны работать сейчас.

Программисты обычно не назначают вручную: «вот эксперт по Python», «вот эксперт по математике», «вот эксперт по английскому языку».

Специализация формируется во время обучения самой сети.

Один набор экспертов постепенно становится полезнее для одних типов информации, другой — для других. Router учится направлять каждый токен туда, где его обработка даёт лучший результат.

Получается интересная конструкция.

Модель может содержать сотни миллиардов параметров и благодаря этому обладать огромной ёмкостью, но для обработки конкретного токена ей требуется лишь небольшая часть всей сети.

Большая модель существует целиком. В каждый момент работает только её часть.

MoE придумали задолго до DeepSeek

Сам принцип Mixture-of-Experts появился задолго до нынешнего китайского ИИ-бума.

Google Research развивает такие архитектуры много лет.

Например, модель GLaM содержала около 1,2 трлн параметров, но при обработке каждого токена использовала примерно 97 млрд — около 8% всей сети.

Поэтому главное в V4.1 Flash — дальнейшее развитие этой идеи.

DeepSeek сделала модель асимметричной.

У современного ИИ есть две очень разные операции.

Первая — прочитать то, что ему дали.

Вторая — сформировать ответ.

В технической терминологии это стадии prefill и decode.

DeepSeek решила использовать для них разное количество вычислений.

При чтении каждого входного токена V4.1 Flash активирует около 8 млрд параметров.

При генерации ответа — около 16 млрд.

То есть чтение требует примерно вдвое меньше активных параметров, чем написание ответа.

И именно здесь появляется главный экономический смысл архитектуры.

ИИ-агенты гораздо больше читают, чем пишут

Представьте ИИ-агента, которому поручили найти ошибку в большом программном проекте.

Сначала он может прочитать сотни файлов, документацию, историю изменений, сообщения об ошибках и тысячи строк кода.

А итогом окажутся несколько абзацев объяснения и двадцать строк исправленного кода.

То же самое происходит при работе с корпоративными документами, юридическими материалами, исследованиями или большими базами знаний.

ИИ приходится обработать огромный объём информации, чтобы выдать относительно небольшой результат.

Поэтому для агентных систем стоимость чтения становится особенно важной.

И DeepSeek специально оптимизировала эту часть работы.

Есть ещё одна дорогая часть — память

В большой языковой модели ресурсы расходуются не только на вычисления.

Когда модель читает длинный текст, ей приходится сохранять рабочую информацию о прочитанном, чтобы использовать её при генерации следующих токенов.

Это называется KV cache — key-value cache, своего рода рабочая память модели.

Чем длиннее контекст, тем больше памяти требуется.

V4.1 Flash построена на новой архитектуре Causal Encoder-Decoder.

Сначала 20 слоёв encoder обрабатывают входящий контекст, затем 20 слоёв decoder формируют результат.

Такая конструкция позволяет decoder использовать более компактное представление уже прочитанной информации.

В результате по сравнению с предыдущим V4-Flash KV cache требует:

  • примерно в 4 раза меньше HBM — высокоскоростной памяти ускорителей;
  • примерно в 8 раз меньше SSD-хранилища.

При этом модель поддерживает контекстное окно до 1 млн токенов.

То есть она может работать с очень большими массивами текста, программного кода и документов, одновременно снижая требования к памяти.

Экономия складывается сразу из нескольких компонентов:

меньше активных параметров → меньше вычислений;

дешевле обработка входа → дешевле длинные агентные задачи;

меньше KV cache → меньше дорогой памяти и хранения.

Это и есть техническая основа высокой вычислительной эффективности V4.1 Flash.

Насколько она дешёвая

В непиковые часы миллион входных токенов V4.1 Flash стоит ¥1.

Если ранее обработанный контекст уже находится в кэше — ¥0,02 за миллион токенов.

Миллион выходных токенов — ¥4.

В пиковые часы тарифы вдвое выше.

По сравнению с предыдущим Flash-тарифом:

  • кэшированный вход: ¥0,05 → ¥0,02 — снижение на 60%;
  • обычный вход: ¥1,5 → ¥1 — примерно на 33%;
  • выход: ¥4,5 → ¥4 — примерно на 11%.

Но здесь есть важная деталь.

Предыдущий тариф появился 17 августа, когда DeepSeek повысила цены.

До этого миллион выходных токенов стоил ¥2.

Сейчас стоимость входа фактически вернулась к апрельским значениям, а выход по-прежнему стоит ¥4 — вдвое дороже прежнего уровня.

Поэтому нынешнее изменение цен корректнее считать частичным откатом августовского повышения. Новый ценовой минимум по выходным токенам здесь не установлен.

Это важное различие.

Архитектурная эффективность V4.1 Flash реальна, но тарифная политика DeepSeek определяется ещё и коммерческой стратегией компании.

Что с качеством

По результатам, опубликованным самой DeepSeek, V4.1 Flash показывает сильные результаты в агентных и программных задачах:

  • Terminal-Bench 2.1 — 90,6
  • DeepSWE v1.1 — 74,2
  • CyberGym — 88,1
  • Automation-Bench — 54,8
  • Codeforces — рейтинг 3471

Компания настолько уверена в новой модели, что с 14 сентября запросы к V4 Pro через API будут временно направляться на V4.1 Flash и тарифицироваться по цене Flash.

Так будет продолжаться до запуска будущей V4.1 Pro.

И вот здесь особенно показательно сравнение:

V4 Pro:

1,6 трлн параметров

49 млрд активных

V4.1 Flash:

552 млрд параметров

8 млрд активных при чтении

16 млрд при генерации

То есть DeepSeek временно заменяет собственную значительно более крупную Pro-модель гораздо более экономичной Flash.

Это один из самых сильных сигналов всего релиза.

При этом значительная часть сравнительных результатов пока опубликована самой DeepSeek. Независимые тесты ещё должны показать, насколько хорошо эти преимущества сохраняются в реальных production-нагрузках.

Почему тогда все давно так не делают

Потому что идея выглядит гораздо проще, чем её реализация.

Mixture-of-Experts известна давно. Google и другие исследовательские команды работают с разреженными моделями много лет.

Главная проблема — заставить такую систему работать действительно эффективно.

Router должен миллиарды раз принимать решение, каким экспертам отправить очередные токены.

При этом нельзя допустить, чтобы один популярный эксперт оказался перегружен, пока другие ускорители простаивают.

Эксперты могут находиться на разных графических процессорах — GPU. Значит, данные нужно с огромной скоростью передавать между множеством чипов.

Все 552 млрд параметров модели всё равно необходимо где-то хранить и быстро делать доступными, даже если в конкретный момент используется лишь небольшая их часть.

Добавьте сюда обучение, балансировку нагрузки, работу с памятью и необходимость сохранять качество — и получается одна из самых сложных инженерных задач современной вычислительной техники.

Здесь одновременно работают математика, архитектура нейронных сетей и инженерия распределённых вычислений.

Есть ещё одна важная оговорка.

Нельзя утверждать, что DeepSeek использует только часть модели, а GPT, Claude или Gemini обязательно задействуют все свои параметры.

Архитектуры наиболее мощных закрытых моделей OpenAI, Anthropic и Google полностью не раскрываются.

Мы просто не знаем, сколько параметров они активируют для конкретного токена и какие разновидности MoE или других методов условных вычислений используют внутри.

Особенность DeepSeek в другом: компания публично показала архитектуру и сделала эффективность вычислений одним из центральных преимуществ продукта.

А открытые веса под лицензией MIT означают, что эту архитектуру могут изучать и использовать другие разработчики.

То есть ценовое давление распространяется шире, чем собственный API DeepSeek.

Почему от этого нервничает рынок

Если вчера разработчик платил премиальную цену за Pro-модель, а сегодня получает сопоставимый уровень возможностей по цене Flash, возникает неприятный вопрос:

за что платить больше?

У конкурентов есть несколько вариантов.

Можно создать значительно более сильную модель и убедить клиента платить премию.

Можно снижать собственные цены.

Можно повышать эффективность инфраструктуры и сохранять маржу при более низкой стоимости токена.

Но если качество ведущих моделей постепенно сближается, а вычислительная эффективность продолжает расти, конкуренция становится всё жёстче.

И рынок уже начал это учитывать.

К полуденному перерыву торгов 10 сентября акции MiniMax снизились на 6,73%, а Z.AI — на 7,88%.

При этом весь технологический сектор Гонконга находился под давлением, поэтому связывать всё движение исключительно с DeepSeek было бы неправильно.

Однако Morgan Stanley отдельно указал на риск усиления ценовой конкуренции среди Flash-моделей.

В этом и состоит главный смысл истории.

DeepSeek показала кое-что потенциально более опасное для экономики отрасли, чем очередной рекорд в бенчмарке: сильный ИИ можно запускать значительно дешевле.

V4.1 Flash показывает, насколько сильно можно уменьшить вычислительную нагрузку модели, сохранив высокий уровень возможностей.

А тарифная политика DeepSeek показывает, насколько агрессивно компания готова использовать эту эффективность в конкурентной борьбе.

Если архитектурную гонку продолжат другие компании, ценность модели будет всё меньше определяться красивым числом «сотни миллиардов параметров».

Гораздо важнее станет другой показатель:

сколько вычислений и денег нужно потратить, чтобы получить один полезный результат.

Для клиентов это хорошая новость.

Для компаний, чьи будущие прибыли построены на высокой цене ИИ-вычислений, — гораздо менее приятная.

Параллельно сама DeepSeek готовится к возможному первичному публичному размещению акций на технологической площадке STAR Market Шанхайской фондовой биржи.

По данным Reuters, для подготовки IPO компания привлекла CITIC Securities.

Подготовлено RD media

Источники

1. [DeepSeek — официальный сайт](https://www.deepseek.com/)

2. [DeepSeek V4.1 Flash — Hugging Face](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash)

3. [Google Research — Mixture-of-Experts with Expert Choice Routing](https://research.google/blog/mixture-of-experts-with-expert-choice-routing/)

4. [Google Research — More Efficient In-Context Learning with GLaM](https://research.google/blog/more-efficient-in-context-learning-with-glam/)

5. [Reuters — China's DeepSeek launches V4.1 Flash model, 10 сентября 2026](https://www.reuters.com/world/asia-pacific/chinas-deepseek-launches-v41-flash-model-2026-09-10/)

6. [Reuters — China's DeepSeek taps CITIC Securities for domestic IPO, 9 сентября 2026](https://www.reuters.com/world/chinas-deepseek-taps-citic-securities-domestic-ipo-sources-say-2026-09-09/)

7. [AASTOCKS — реакция MiniMax и Z.AI и комментарий Morgan Stanley](https://secure.aastocks.com/en/mobile/News.aspx?NewsID=NOW.1543798&NewsSource=HK6&NewsType=)

Похожие материалы