, август 14, 2026

DeepSeek снизил цену API на 75% — и показал, куда движется вся индустрия ИИ


DeepSeek снизил цену API на 75%, объясняя это эффективностью архитектуры. Дефицит HBM-памяти сдерживает индустрию MoE годами.

  •   2 мин чтения
DeepSeek снизил цену API на 75% — и показал, куда движется вся индустрия ИИ

Содержание

Подготовлено RD media

Коротко: DeepSeek снизил цену API на 75%, объясняя это эффективностью архитектуры (MoE); дефицит HBM-памяти сдерживает индустрию MoE годами.

31 мая DeepSeek снизил цены на API V4 Pro на 75%. Компания объясняет это эффективностью архитектуры (MoE, оптимизация внимания), себестоимость не раскрывает. MoE — не новость: на неё перешли ещё в 2023–2024-м как на решение compute/memory tradeoff. Новость в том, что эффект на цену стал измеримым именно сейчас, когда классические scaling laws третий год подряд показывают всё меньшую отдачу.

Архитектура

Среди лидирующих моделей (DeepSeek, Kimi K2, Mistral Large 3) доминирует MoE — по оценке NVIDIA, на GB200 NVL72 такие модели дают 10-кратный прирост и 1/10 стоимости токена относительно H200.

Данные

Дефицит качественных текстовых датасетов подталкивает к синтетике и жёсткому курированию — по Epoch AI, запасы качественного текста в интернете могут закончиться между 2026 и 2032 годами.

Инфраструктура

Дефицит HBM-памяти архитектурой не решается. MoE снижает вычисления на токен, но требует держать в памяти всех экспертов — модель «широкая» по памяти, хоть и «лёгкая» по вычислениям. SK Hynix и Samsung: мощности на 2026 год распроданы, цены выросли на 60%, дефицит может затянуться на годы.

Парадокс

Преимущество переходит от размера модели к контрактам на память.

Для Казахстана и СНГ

Это означает: API MoE-моделей дешевеет, но собственный инференс всё равно упирается в HBM, которую нельзя купить по каталогу. В открытых источниках данных о пилотах госструктур РК нет.

Наш взгляд

Конкуренция сместилась с числа параметров на стоимость одного токена. Метрика эффективности теперь не FLOPS и даже не миллиард параметров, а цена миллиона токенов, латентность и ватты на запрос. DeepSeek понял это раньше других. Но эффективная архитектура без гарантированного доступа к памяти — как двигатель без топлива: на бумаге выигрывает, на практике стоит.

Частые вопросы

Почему DeepSeek снизил цены на API на 75%?

Компания объясняет это ростом эффективности архитектуры — MoE и оптимизацией внимания, — не раскрывая полную структуру себестоимости.

Что такое MoE и почему это не новая технология?

Mixture of Experts (MoE) — архитектура, на которую индустрия перешла ещё в 2023–2024 годах как на решение compute/memory tradeoff; сейчас её ценовой эффект стал измеримым.

Почему дефицит HBM-памяти не решается архитектурой MoE?

MoE снижает вычисления на токен, но требует держать в памяти всех экспертов модели — модель становится «широкой» по памяти. SK Hynix и Samsung сообщают, что мощности на 2026 год уже распроданы.

Источники

DeepSeek · Epoch AI · Tom's Hardware · NVIDIA

Похожие материалы