Подготовлено RD media
Коротко: DeepSeek снизил цену API на 75%, объясняя это эффективностью архитектуры (MoE); дефицит HBM-памяти сдерживает индустрию MoE годами.
31 мая DeepSeek снизил цены на API V4 Pro на 75%. Компания объясняет это эффективностью архитектуры (MoE, оптимизация внимания), себестоимость не раскрывает. MoE — не новость: на неё перешли ещё в 2023–2024-м как на решение compute/memory tradeoff. Новость в том, что эффект на цену стал измеримым именно сейчас, когда классические scaling laws третий год подряд показывают всё меньшую отдачу.
Архитектура
Среди лидирующих моделей (DeepSeek, Kimi K2, Mistral Large 3) доминирует MoE — по оценке NVIDIA, на GB200 NVL72 такие модели дают 10-кратный прирост и 1/10 стоимости токена относительно H200.
Данные
Дефицит качественных текстовых датасетов подталкивает к синтетике и жёсткому курированию — по Epoch AI, запасы качественного текста в интернете могут закончиться между 2026 и 2032 годами.
Инфраструктура
Дефицит HBM-памяти архитектурой не решается. MoE снижает вычисления на токен, но требует держать в памяти всех экспертов — модель «широкая» по памяти, хоть и «лёгкая» по вычислениям. SK Hynix и Samsung: мощности на 2026 год распроданы, цены выросли на 60%, дефицит может затянуться на годы.
Парадокс
Преимущество переходит от размера модели к контрактам на память.
Для Казахстана и СНГ
Это означает: API MoE-моделей дешевеет, но собственный инференс всё равно упирается в HBM, которую нельзя купить по каталогу. В открытых источниках данных о пилотах госструктур РК нет.
Наш взгляд
Конкуренция сместилась с числа параметров на стоимость одного токена. Метрика эффективности теперь не FLOPS и даже не миллиард параметров, а цена миллиона токенов, латентность и ватты на запрос. DeepSeek понял это раньше других. Но эффективная архитектура без гарантированного доступа к памяти — как двигатель без топлива: на бумаге выигрывает, на практике стоит.
Частые вопросы
Почему DeepSeek снизил цены на API на 75%?
Компания объясняет это ростом эффективности архитектуры — MoE и оптимизацией внимания, — не раскрывая полную структуру себестоимости.
Что такое MoE и почему это не новая технология?
Mixture of Experts (MoE) — архитектура, на которую индустрия перешла ещё в 2023–2024 годах как на решение compute/memory tradeoff; сейчас её ценовой эффект стал измеримым.
Почему дефицит HBM-памяти не решается архитектурой MoE?
MoE снижает вычисления на токен, но требует держать в памяти всех экспертов модели — модель становится «широкой» по памяти. SK Hynix и Samsung сообщают, что мощности на 2026 год уже распроданы.
Источники
DeepSeek · Epoch AI · Tom's Hardware · NVIDIA
Похожие материалы
ИИ ускорил разработчика. Почему компания всё ещё работает медленно
сент. 29, 2026
Флюорит: зачем промышленности минерал, который планируют добывать в Казахстане
сент. 29, 2026
Глава NVIDIA спорит с нобелевским лауреатом — и готовится к визиту в Астану
сент. 29, 2026